Peningkatan Automatic Speech Recognition Dialek Bugis-Makassar Menggunakan Data Ucapan Sintetis
DOI:
https://doi.org/10.29313/bcsies.v6i2.26221Keywords:
Automatic Speech Recognition, Dialek Bugis-Makassar, Text to Speech, Partikel Dialek, ASR Low ResourceAbstract
Abstract. Speech in the Bugis-Makassar dialect poses a major challenge for Automatic Speech Recognition (ASR) systems, particularly in detecting clitic particles that are essential to utterance meaning but do not exist in standard Indonesian. This study investigates the effect of synthetic speech data augmentation using OpenAI's gpt-4o-mini-tts on ASR performance for this dialect, testing four ratios of synthetic-to-real data (0%, 50%, 100%, and 150%) through fine-tuning of the wav2vec2-large-xlsr-indonesian model. Evaluation was conducted using Word Error Rate (WER), Character Error Rate (CER), and Particle Detection Rate (PDR) as a dedicated metric for clitic particle detection. Results show that augmentation at a 50% ratio produced consistent improvements across all metrics compared to baseline, with WER decreasing by 3.47 percentage points and PDR increasing by 3.62 percentage points. Further increases in ratio progressively reduced these gains, forming an inverted-U pattern, with performance at a 150% ratio returning to near-baseline levels. Acoustic analysis identified a significant pitch distribution gap between synthetic and real speech (a difference of 58.09 Hz, or 24.8%) as a contributing factor to performance degradation at higher ratios. These findings indicate that TTS-based synthetic data augmentation effectively supports low-resource dialectal ASR, but only when applied at a controlled, moderate ratio.
Abstrak. Tuturan dialek Bugis-Makassar merupakan tantangan besar bagi sistem Automatic Speech Recognition (ASR), khususnya dalam mendeteksi partikel klitik yang penting bagi makna ujaran namun tidak terdapat dalam Bahasa Indonesia standar. Penelitian ini menginvestigasi pengaruh augmentasi data sintetis menggunakan OpenAI gpt-4o-mini-tts terhadap performa ASR dialek tersebut, dengan menguji empat rasio data sintetis terhadap data asli (0%, 50%, 100%, dan 150%) melalui fine-tuning model wav2vec2-large-xlsr-indonesian. Evaluasi dilakukan menggunakan Word Error Rate (WER), Character Error Rate (CER), dan Particle Detection Rate (PDR) sebagai metrik khusus deteksi partikel klitik. Hasil menunjukkan bahwa augmentasi pada rasio 50% menghasilkan peningkatan konsisten pada seluruh metrik dibandingkan baseline, dengan WER turun 3,47 poin persentase dan PDR naik 3,62 poin persentase. Penambahan rasio secara bertahap mengurangi manfaat tersebut dan membentuk pola kurva inverted-U, di mana performa pada rasio 150% kembali mendekati baseline. Analisis akustik mengidentifikasi perbedaan distribusi pitch yang signifikan antara data sintetis dan asli (selisih 58,09 Hz atau 24,8%) sebagai faktor yang berkontribusi terhadap degradasi performa pada rasio tinggi. Temuan ini menunjukkan bahwa augmentasi data sintetis berbasis TTS efektif mendukung ASR dialek low-resource, namun hanya jika diterapkan pada rasio yang terkontrol dan moderat.
References
Azis, H., Fajriansyah M, M. F., Darwis, H., Purnawansyah, Hasanuddin, T., & Sugiarti. (2026). Development of a Low-Resource Automatic Speech Recognition System for the Makassar Dialect. 2026 20th International Conference on Ubiquitous Information Management and Communication (IMCOM), 1–8. https://doi.org/10.1109/IMCOM69009.2026.11360893
Bartelds, M., San, N., McDonnell, B., Jurafsky, D., & Wieling, M. (2023). Making More of Little Data: Improving Low-Resource Automatic Speech Recognition Using Data Augmentation. In A. Rogers, J. Boyd-Graber, & N. Okazaki (Eds.), Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 715–729). Association for Computational Linguistics. https://doi.org/10.18653/v1/2023.acl-long.42
Casanova, E., Shulby, C. D., Korolev, A., Júnior, A. C., da Silva Soares, A., Aluísio, S. M., & Ponti, M. A. (2022). ASR data augmentation in low-resource settings using cross-lingual multi-speaker TTS and cross-lingual voice conversion. Interspeech. https://doi.org/10.21437/Interspeech.2023-496
Chiu, A. Y. F., Fung, P. K. C., Li, R. T. Y., Li, J., & Lee, T. (2025). A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations. https://doi.org/10.48550/arXiv.2501.05310
Conneau, A., Baevski, A., Collobert, R., Mohamed, A., & Auli, M. (2021). Unsupervised Cross-Lingual Representation Learning for Speech Recognition. Interspeech 2021, 2426–2430. https://doi.org/10.21437/Interspeech.2021-329
Fajar, A. H., & Rejeki, Y. S. (2021). Perancangan Fasilitas Kerja Ergonomis pada Stasiun Persiapan Menggunakan Analisis Virtual Environment Modelling. Jurnal Riset Teknik Industri, 1(2), 121–130. https://doi.org/10.29313/jrti.v1i2.413
Lim, Y., Kim, D., & Kim, S. H. (2025). Acoustic and linguistic effects in synthesized speech augmentation for speech recognition. ETRI Journal, 47(6), 1061–1070. https://doi.org/10.4218/etrij.2024-0050
Naufal Rafif Rizaldi, Djamaluddin, & Ajrina Febri Suahati. (2024). Implementasi Sistem Informasi Berbasis Enterprise Resource Planning (ERP) dengan Menggunakan Software Accurate. Jurnal Riset Teknik Industri, 169–178. https://doi.org/10.29313/jrti.v4i2.5483
Rosdiana, H., Ashari, Y., & Fauzi Isniarno, N. (n.d.). Pengaruh Intensitas Curah Hujan terhadap Kegiatan Pemompaan pada Sump Berdasarkan Water Balance di PT XYZ. Jurnal Sangkuriang Bandung. Retrieved https://journal.sbpublisher.com/index.php/minetech
Srinivasan, A., Singh, D., Yarra, C., Illa, A., & Ghosh, P. K. (2021). A Robust Speaking Rate Estimator Using a CNN-BLSTM Network. Circuits, Systems, and Signal Processing, 40(12), 6098–6120. https://doi.org/10.1007/s00034-021-01754-1
Yadav, I. C., & Pradhan, G. (2021). Pitch and noise normalized acoustic feature for children’s ASR. Digital Signal Processing, 109, 102922. https://doi.org/10.1016/j.dsp.2020.102922
Yang, G., Yu, F., Ma, Z., Du, Z., Gao, Z., Zhang, S., & Chen, X. (2024). Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap. ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 1–5. https://doi.org/10.1109/ICASSP49660.2025.10889894
Zheng, X., Liu, Y., Gunceler, D., & Willett, D. (2021). Using Synthetic Audio to Improve the Recognition of Out-of-Vocabulary Words in End-to-End Asr Systems. ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 5674–5678. https://doi.org/10.1109/ICASSP39728.2021.9414778