Human-AI Interaction dengan Antarmuka Suara dalam Bahasa Lokal/Dialek Nusantara
DOI:
https://doi.org/10.31004/riggs.v4i3.3113Keywords:
Speech Recognition, Dialek Nusantara, Kecerdasan Buatan, Transfer Learning, Word Error Rate, Interaksi Manusia-MesinAbstract
Penelitian ini mengeksplorasi kemampuan kecerdasan buatan (AI) dalam memahami perintah suara yang diucapkan dalam bahasa lokal atau dialek Nusantara, yang memiliki keragaman fonetik, intonasi, dan kosakata khas daerah. Tujuan utama dari penelitian ini adalah untuk mengembangkan model pengenalan suara berbasis deep learning yang mampu mengenali perintah suara dalam berbagai dialek lokal Indonesia dengan akurasi tinggi. Penelitian ini melibatkan tahapan pengumpulan data audio dari penutur asli berbagai daerah, yang mencakup berbagai dialek dan aksen lokal. Selanjutnya, data yang terkumpul menjalani proses pra-pemrosesan untuk membersihkan noise dan menormalkan variasi suara. Model pengenalan suara dilatih menggunakan pendekatan transfer learning, memanfaatkan model pretrained yang kemudian disesuaikan dengan data lokal melalui teknik fine-tuning. Evaluasi dilakukan menggunakan metrik Word Error Rate (WER) dan Command Accuracy untuk mengukur tingkat kesalahan dan akurasi model dalam mengenali perintah suara. Hasil penelitian menunjukkan bahwa akurasi pengenalan suara dalam dialek lokal lebih rendah dibandingkan dengan Bahasa Indonesia baku, namun teknik data augmentation dan fine-tuning model pretrained dapat menurunkan tingkat kesalahan hingga 15–20%. Selain itu, uji pengguna menunjukkan bahwa teknologi AI yang mendukung dialek lokal meningkatkan tingkat kenyamanan, kepercayaan, dan penerimaan pengguna. Penelitian ini menekankan pentingnya pengembangan dataset suara daerah yang lebih beragam dan desain antarmuka suara yang adaptif, guna memastikan teknologi AI yang lebih inklusif secara linguistik dan kultural.
Downloads
References
L. Besacier, E. Barnard, A. Karpov, and T. Schultz, “Automatic speech recognition for under-resourced languages: A survey,” Speech Commun., vol. 56, no. 1, pp. 85–100, 2014, doi: 10.1016/j.specom.2013.07.008.
I. G. A. G. A. Kadyanan et al., “Balinese text-to-speech dataset as digital cultural heritage,” Data Br., vol. 60, p. 111528, 2025, doi: 10.1016/j.dib.2025.111528.
B. Speech and T. Group, “Deep Speech 2 : End-to-End Speech Recognition in English and Mandarin Speech Interfaces : A New / Old Input Paradigm,” arXiv:1512.02595, pp. 1–17, 2016, [Online]. Available: http://www.jmlr.org/proceedings/papers/v48/amodei16.html
K. Kunci, “SYSTEMIC : Information System and Informatics Journal Sistem Pembelajaran Hukum Baca Al- Qur ’ an Menggunakan Algoritma LPC dan KNN,” vol. 6, no. 1, pp. 29–37, 2020.
S. Wahyuni et al., “Desain Sistem Speech Recognition Penerjemah Bahasa Toraja Menggunakan Hidden Markov Model Design System Speech Recognition Tranlator Toraja Language Using Hidden Markov Modelling,” Jppi, vol. 11, no. 2, pp. 107–119, 2021, doi: 10.17933/jppi.v11i2.286.
R. Patel and S. Patel, “Deep Learning for Natural Language Processing,” Lect. Notes Networks Syst., vol. 190, no. May 2020, pp. 523–533, 2021, doi: 10.1007/978-981-16-0882-7_45.
R. De Mori, “Recent advances in automatic speech recognition,” Signal Processing, vol. 1, no. 2, pp. 95–123, 1979, doi: 10.1016/0165-1684(79)90013-6.
D. Povey, G. Boulianne, L. Burget, P. Motlicek, and P. Schwarz, “the Kaldi Speech Recognition,” no. January, 1920.
A. Baevski, H. Zhou, A. Mohamed, and M. Auli, “wav2vec 2.0: A framework for self-supervised learning of speech representations,” Adv. Neural Inf. Process. Syst., vol. 2020-December, no. February, pp. 0–19, 2020, doi: 10.48550/arXiv.2006.11477.
B. R. Setiawan, A. Aranta, and B. Irmawati, “Speech To Text Bahasa Sasak Menggunakan Extraksi Fitur Mel-Frequency Cepstral Coefficients Dan Klasifikasi Convolutional Neural Networks,” J. Teknol. Informasi, Komputer, dan Apl. (JTIKA ), vol. 5, no. 1, pp. 21–32, 2023, doi: 10.29303/jtika.v5i1.235.
A. Graves, A. R. Mohamed, and G. Hinton, “Speech recognition with deep recurrent neural networks,” ICASSP, IEEE Int. Conf. Acoust. Speech Signal Process. - Proc., no. 3, pp. 6645–6649, 2013, doi: 10.1109/ICASSP.2013.6638947.
H. Y. Lee et al., “Self-supervised Representation Learning for Speech Processing,” NAACL 2022 - 2022 Conf. North Am. Chapter Assoc. Comput. Linguist. Hum. Lang. Technol. Tutor. Abstr., pp. 8–13, 2022, doi: 10.18653/v1/2022.naacl-tutorials.2.
Y. Jia, M. T. Ramanovich, Q. Wang, and H. Zen, “CVSS Corpus and Massively Multilingual Speech-to-Speech Translation,” 2022 Lang. Resour. Eval. Conf. Lr. 2022, pp. 6691–6703, 2022.
E. William and A. Zahra, “Speech Recognition Dengan Whisper Dalam Bahasa Indonesia,” Action Res. Lit., vol. 9, no. 2, pp. 386–397, 2025, doi: 10.46799/arl.v9i2.2573.
H. Henry and E. Eryc, “Speech Recognition Untuk Membantu Pelafalan Hanyu Pinyin Sebagai Bagian Dari Edukasi Bahasa Mandarin,” J. Ilm. Edutic Pendidik. dan Inform., vol. 10, no. 2, pp. 117–128, 2024, doi: 10.21107/edutic.v10i2.22633.
A. Hinsvark et al., “Accented Speech Recognition: A Survey,” 2021, [Online]. Available: http://arxiv.org/abs/2104.10747
Downloads
Published
How to Cite
Issue
Section
License
Copyright (c) 2025 Suherwin Suherwin, Siti Nur Asia, Rachmat Rachmat

This work is licensed under a Creative Commons Attribution 4.0 International License.


















