Ekstraksi Ciri Suara Gender Berdasarkan Frequency Domain Audio Feature
DOI:
https://doi.org/10.31004/riggs.v5i2.12409Keywords:
Ekstraksi Ciri Suara, MFCC, Spectral Centroid, Pengolahan Sinyal Suara, GenderAbstract
Penelitian ini bertujuan mengekstraksi ciri suara berdasarkan gender menggunakan Mel-Frequency Cepstral Coefficients (MFCC) dan Spectral Centroid. Data yang digunakan adalah 20 sampel rekaman vokal “A” dari 4 responden (2 laki-laki, 2 perempuan), masing-masing 5 kali perekaman. Seluruh sampel di-resample ke 16.000 Hz. Ekstraksi MFCC menghasilkan 13 koefisien yang dirata-ratakan per sampel, sedangkan Spectral Centroid dihitung rata-rata dan standar deviasinya. Hasil pengujian statistik dengan Independent Samples t-Test pada taraf signifikansi 0,05 menunjukkan perbedaan yang signifikan secara statistik antara kelompok laki-laki dan perempuan pada koefisien MFCC-2 (p=0,0154), MFCC-5 (p=0,0080), MFCC-7 (p=0,0014), MFCC-12 (p<0,0001), dan MFCC-13 (p=0,0001). Sementara itu, MFCC-1 tidak menunjukkan perbedaan yang signifikan (p=0,0723). Hasil perhitungan Spectral Centroid menunjukkan bahwa rata-rata perempuan mencapai 3105,38 Hz dan laki-laki 1944,91 Hz, dengan standar deviasi yang lebih tinggi pada perempuan (1113,47 Hz vs 486,80 Hz). Temuan ini mengonfirmasi bahwa suara perempuan memiliki distribusi energi frekuensi yang cenderung lebih tinggi dan lebih bervariasi, sesuai dengan karakteristik fisiologis pita suara yang lebih pendek. Informasi spektral ini memperlihatkan potensi MFCC dan Spectral Centroid sebagai penciri akustik gender yang dapat diaplikasikan pada asisten virtual atau forensik audio. Kedua fitur mampu merepresentasikan perbedaan akustik gender, meskipun penelitian terbatas pada sampel kecil. Oleh karena itu, diperlukan penelitian lanjutan dengan dataset lebih besar, variasi fonem, rentang usia, dan lingkungan perekaman terkontrol untuk meningkatkan keandalan fitur.
Downloads
References
[1]H. Hermansky, ‘Coding and decoding of messages in human speech communication: Implications for machine recognition of speech’, Speech Commun., vol. 106, pp. 112–117, Jan. 2019, doi: 10.1016/J.SPECOM.2018.12.004.
[2]M. Labied and A. Belangour, ‘Automatic Speech Recognition Features Extraction Techniques: A Multi-criteria Comparison’, Int. J. Adv. Comput. Sci. Appl., vol. 12, no. 8, pp. 177–182, 2021, doi: 10.14569/IJACSA.2021.0120821.
[3]T. Giannakopoulos and A. Pikrakis, Introduction to Audio Analysis: A MATLAB Approach. 2014. doi: 10.1016/C2012-0-03524-7.
[4]A. A. Shafhah, P. P. Adikara, and S. Adinugroho, ‘Klasifikasi Jenis Kelamin Berdasarkan Suara Menggunakan Metode Learning Vector Quantization’, J. Pengemb. Teknol. dan Ilmu Komput., vol. 4, no. 7, pp. 2301–2308, Aug. 2020.
[5]P. Negeri and L. Rahmadani, ‘KLASIFIKASI GENDER BERDASARKAN SUARA DENGAN NAIVE BAYES DAN MEL FREQUENCY CEPSTRAL COEFFICIENT’, VOCATECH Vocat. Educ. Technol. J., vol. 2, no. 1, pp. 19–26, Oct. 2020, doi: 10.38038/VOCATECH.V2I1.45.
[6]D. T. Kusuma, ‘Fast Fourier Transform (FFT) Dalam Transformasi Sinyal Frekuensi Suara Sebagai Upaya Perolehan Average Energy (AE) Musik’, Petir, vol. 14, no. 1, pp. 28–35, 2020, doi: 10.33322/petir.v14i1.1022.
[7]R. A. N. Diaz, N. L. G. P. Suwirmayanti, and K. Budiarta, ‘Perbandingan Kualitas Pengenalan Suara Untuk Ekstraksi Fitur Menggunakan Mfcc Dan Spectral’, Naratif J. Nas. Riset, Apl. dan Tek. Inform., vol. 6, no. 1, pp. 58–63, 2024, doi: 10.53580/naratif.v6i1.281.
[8]‘Spectral centroid - Wikipedia’.
[9]R. Umar, I. Riadi, and A. Hanif, ‘Analisis Bentuk Pola Suara Menggunakan Ekstraksi Ciri Mel-Frequencey Cepstral Coefficients (MFCC)’, CogITo Smart J., vol. 4, no. 2, pp. 294–304, 2019, doi: 10.31154/cogito.v4i2.130.294-304.
[10]H. (Heriyanto) Heriyanto, S. (Sri) Hartati, and A. E. (Agfianto) Putra, ‘Ekstraksi Ciri Mel Frequency Cepstral Coefficient (Mfcc) Dan Rerata Coefficient Untuk Pengecekan Bacaan Al-qur'an’, Telematika, vol. 15, no. 2, pp. 99–108, Oct. 2018, doi: 10.31315/TELEMATIKA.V15I2.3123.
[11]S. Kazazis, P. Depalle, and S. McAdams, ‘Interval and Ratio Scaling of Spectral Audio Descriptors’, Front. Psychol., vol. 13, p. 835401, Mar. 2022, doi: 10.3389/FPSYG.2022.835401/TEXT.
[12]J. Delisle, ‘Spectral centroid — Timbre and Orchestration Resource’.
[13]V. V. Bilqis, A. W. Septiani, F. N. Zildjian, and F. D. Ratnasari, ‘Analisis Perbedaan Spektrum Frekuensi Sinyal Suara Vokal Manusia Menggunakan Fast Fourier Transform (FFT) Berbasis Python’, RIGGS J. Artif. Intell. Digit. Bus., vol. 5, no. 2, pp. 3548–3558, May 2026, doi: 10.31004/RIGGS.V5I2.8994.
[14]A. A. Kasim, M. Bakri, I. Mahmudi, R. Rahmawati, and Z. Zulnabil, ‘Artificial Intelligent for Human Emotion Detection with the Mel-Frequency Cepstral Coefficient (MFCC)’, JUITA J. Inform., vol. 11, no. 1, pp. 47–55, May 2023, doi: 10.30595/JUITA.V11I1.15435.
[15]‘What Are Your Vocal Cords? (n.d.). Retrieved June 27, 2026, from https://my.clevelandclinic.org/health/body/24456-vocal-cords
[16]H. Terasawa, J. Berger, and S. Makino, ‘In search of a perceptual metric for timbre: Dissimilarity judgments among synthetic sounds with MFCC-derived spectral envelopes’, AES J. Audio Eng. Soc., vol. 60, no. 9, pp. 674–685, 2012.
Downloads
Published
How to Cite
Issue
Section
License
Copyright (c) 2026 Dhiandra Nirina Yusuf, Hari Purwadi, Didi Susilo Budi Utomo

This work is licensed under a Creative Commons Attribution 4.0 International License.


















