Klasifikasi Sentimen Publik Terhadap Banjir di Sumatera pada Teks Berita dan Media Sosial X Menggunakan IndoBERT

Authors

  • Marini Salmonia Kisa Prodi Statistika, Fakultas Farmasi dan Sains, Universitas Islam Bandung, Indonesia
  • Fauziah Roshafara Prodi Statistika, Fakultas Farmasi dan Sains, Universitas Islam Bandung, Indonesia

DOI:

https://doi.org/10.29313/bcss.v6i2.24414

Keywords:

IndoBERT, media sosial X, media berita online

Abstract

Abstract. Flood disasters on Sumatra Island have triggered diverse public responses through online news coverage and social media platform X. This study applies IndoBERT, a BERT-based model that uses pre-trained weights and is subsequently fine-tuned to classify public sentiment regarding the disaster. Data were collected through web scraping from three national news portals, namely Detik, CNBC Indonesia, and Kompas, as well as from social media X using the keyword “banjir Sumatera” between November 28, 2025, and January 9, 2026. After data selection, 2,687 records were obtained, consisting of 1,494 news texts and 1,193 X posts. This study aims to evaluate IndoBERT performance on two data types with different linguistic characteristics. Initial sentiment labeling was conducted using the InSet lexicon, producing three classes: negative, neutral, and positive. On news data, IndoBERT achieved an accuracy of 0.81, precision of 0.81, recall of 0.80, and F1-score of 0.80. On social media X data, it achieved an accuracy of 0.79, precision of 0.78, recall of 0.78, and F1-score of 0.78. These findings indicate that IndoBERT performs better on news texts because their formal language characteristics are more consistent with the model’s pre-training corpus. The results demonstrate that corpus compatibility influences model performance across different Indonesian textual domains.

Abstrak. Bencana banjir di Pulau Sumatera memunculkan beragam respons publik melalui pemberitaan media berita online dan media sosial X. Penelitian ini menerapkan IndoBERT berbasis arsitektur BERT dengan memanfaatkan bobot pre-trained yang kemudian digunakan pada proses fine-tuning untuk mengklasifikasikan sentimen publik terkait bencana tersebut. Data dikumpulkan melalui web scraping dari tiga portal berita nasional, yaitu Detik, CNBC Indonesia, dan Kompas, serta media sosial X menggunakan kata kunci “banjir Sumatera” pada periode 28 November 2025 hingga 9 Januari 2026. Setelah proses seleksi, diperoleh 2.687 data yang terdiri atas 1.494 teks berita dan 1.193 cuitan X. Penelitian ini bertujuan mengevaluasi kinerja IndoBERT pada dua jenis data dengan karakteristik yang berbeda. Pelabelan awal dilakukan menggunakan kamus leksikon InSet dan menghasilkan tiga kelas sentimen, yaitu negatif, netral, dan positif. Hasil evaluasi menunjukkan bahwa pada data berita IndoBERT memperoleh accuracy 0,81, precision 0,81, recall 0,80, dan F1-score 0,80. Sementara  itu, pada data media sosial X diperoleh accuracy 0,79, precision 0,78, recall 0,78, dan F1-score 0,78. Hasil tersebut menunjukkan bahwa IndoBERT lebih baik dalam mengklasifikasikan sentimen pada teks berita karena karakteristik bahasanya lebih formal sesuai dengan korpus pre-training IndoBERT.

References

Asri, Y., Kuswardani, D., Horhoruw, L. F. M., & Siti Aisyah Ramadhana. (2024). Machine Learning dan Deep Learning Analisis Sentimen Menggunakan Ulasan Pengguna Aplikasi. Uwais Inspirasi Indonesia.
BNPB. (2025). Dashboard Penanganan Darurat Banjir dan Longsor Provinsi Aceh, Sumatera Utara, Dan Sumatera Barat Tahun 2025. BNPB.
Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). Bidirectional Encoder Representations from Transformers (BERT). NAACL HLT 2019 - 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies - Proceedings of the Conference, 1(Mlm), 4171–4186.
Dewi, B. E. S. (2025). Model Analisis Sentimen pada Kendaraan Listrik Menggunakan Algoritma Indobertweet dan Indobert. 19(1), 169–179.
Eddy, A., Saputro, S., & Notodiputro, K. A. (2018). Study of Sentiment of Governor ’ s Election Opinion in 2018. 4(11), 231–238.
Koto, F., Rahimi, A., Lau, J. H., & Baldwin, T. (2020). IndoLEM and IndoBERT: A Benchmark Dataset and Pre-trained Language Model for Indonesian NLP. COLING 2020 - 28th International Conference on Computational Linguistics, Proceedings of the Conference, 757–770. https://doi.org/10.18653/v1/2020.coling-main.66
Loshchilov, I., & Hutter, F. (2019). Decoupled Weight Decay Regularization.
Musfiroh, D., Khaira, U., Eko, P., Utomo, P., & Suratno, T. (2021). Sentiment Analysis of Online Lectures in Indonesia from Twitter Dataset Using InSet Lexicon. 1(April), 24–33.
Ramadhan, C., Atina, V., & Permatasari, H. (2025). Analisis Perbandingan Model CNN dan IndoBERT Dalam Sentimen Berita Politik Indonesia. 110–118.
Samsudin, Y. P. (2025). Klasifikasi Sentimen Publik Terhadap Isu Bonus Demografi di X Menggunakan Multinomial Naive Bayes.
Taryana, A., Rifa, M., Mahmudi, E., & Bekti, H. (2022). Analisis Kesiapsiagaan Bencana Banjir Di Jakarta. 13(2), 302–311.

Published

2026-07-31