Implementasi Klasifikasi Genre Film Pada Platform Imdb Berdasarkan Deskripsi Sinopsis Film Menggunakan Algoritma Naïve Bayes, SVM, Dan Logistic Regression

Authors

  • Muhammad Ilyassa Universitas Ibn Khaldun Bogor
  • Satrio Akbar Universitas Ibn Khaldun Bogor
  • Ikhwanul Akmal Universitas Ibn Khaldun Bogor
  • Fakhrullah Abrisam Universitas Ibn Khaldun Bogor
  • Hanif Zaidan Sinaga Universitas Ibn Khaldun Bogor

DOI:

https://doi.org/10.69693/ijmst.v4i3.12210

Keywords:

Natural Language Processing, Klasifikasi Genre Film, Machine Learning, IMDb, Sinopsis Film, Naïve Bayes, Support Vector Machine, Logistic Regression

Abstract

Pertumbuhan data film digital dan meningkatnya penggunaan platform IMDb menuntut metode otomatis yang mampu mengelompokkan genre berdasarkan informasi tekstual secara konsisten. Penelitian ini bertujuan mengimplementasikan Natural Language Processing dan membandingkan kinerja Multinomial Naïve Bayes, Support Vector Machine LinearSVC, SVM dengan pembobotan kelas seimbang, serta Logistic Regression untuk mengklasifikasikan genre primer film berdasarkan sinopsis. Dataset IMDb Top 1000 dari Kaggle diseleksi menjadi 811 film pada lima genre utama, yaitu Drama, Action, Comedy, Crime, dan Biography. Tahapan penelitian meliputi case folding, cleaning, tokenization, stopword removal, stemming, ekstraksi fitur Term Frequency-Inverse Document Frequency, pembagian data secara stratified 80:20, pelatihan model, evaluasi accuracy, precision, recall, F1-score, confusion matrix, dan validasi silang stratified lima lipatan. Baseline kelas mayoritas menghasilkan akurasi 35,6%. Logistic Regression memberikan hasil terbaik dengan akurasi pengujian 43,56% dan rata-rata validasi silang 44,63%. SVM Balanced mencapai akurasi 42,33%, LinearSVC 41,10%, dan Naïve Bayes 40,49%. Naïve Bayes menunjukkan bias kuat terhadap kelas Drama, sedangkan SVM dan Logistic Regression menghasilkan prediksi lebih seimbang. Kinerja yang masih terbatas terutama dipengaruhi ketidakseimbangan kelas, tumpang tindih naratif antargenre, sinopsis yang pendek, dan penyederhanaan label multigenre menjadi genre primer. Hasil penelitian menegaskan bahwa Logistic Regression merupakan model klasik paling efektif pada konfigurasi data dan fitur yang digunakan serta layak dijadikan baseline untuk penelitian lanjutan.

References

Amelia, R., Santoso, D. B., & Stikubank, U. (2023). Film Genre Prediction With Multi-Class Classification Synopsis. 6, 771–779.

Bahrein, M., & Apandi, S. (2025). Perbandingan Kinerja Naive Bayes, Support Vector Machine, Regresi Logistik, Dan Decision Tree Untuk Klasifikasi Sentimen Ulasan Produk Berbasis Tf-Idf. 24(4), 1067–1078.

Consulting, D. D. L. (2007). Large-Scale Bayesian Logistic Regression For Text Categorization. 49(3), 291–304. Https://Doi.Org/10.1198/004017007000000245

Cortes, C., & Vapnik, V. (1995). Support-Vector Networks. Machine Learning, 297(3), 273–297. Https://Doi.Org/10.1007/Bf00994018

Hudaini, R., Hendriansyah, M., & Gautama, E. (2026). Fake News Classification Using Logistic Regression With Tf-Idf Feature Extraction. June, 239–249.

Irawan, P., & Abdullah, A. (2025). Comparison Of Naïve Bayes And Svm Methods In Detecting Hoax News. 8(2). Https://Doi.Org/10.32877/Bt.V8i2.3122

Joachims, T. (1998). Text Categorization With Support Vector Machines: Learning With Many Relevant Features. 137–142. Https://Doi.Org/10.1007/Bfb0026683

Lukman, K., & Novianto, S. (2025). Komparasi Algoritma Naïve Bayes Dan Svm Untuk Identifikasi Cyberbullying Selebriti Di Media Sosial Twitter. 970–981. Https://Doi.Org/10.33364/Algoritma/V.22-1.2196

Manning, C. D., Raghavan, P., & Schütze, H. (2009). Online Edition (C) 2009 Cambridge Up. C.

Mccallum, A. (1997). A Comparison Of Event Models For Naive Bayes Text Classification.

Mohammad, A. H., & Al-Momani, O. (2016). Arabic Text Categorization Using Support Vector Machine , Naïve Bayes And Neural Network. 5(1). Https://Doi.Org/10.5176/2251-3043

Sebastiani, F. (2002). Machine Learning In Automated Text Categorization. 34(1), 1–47.

Chalkidis, I., & Søgaard, A. (2022). Improved Multi-Label Classification Under Temporal Concept Drift: Rethinking Group-Robust Algorithms In A Label-Wise Setting. In Findings Of The Association For Computational Linguistics: Acl 2022 (Pp. 2441-2454). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Findings-Acl.192

De Silva, B., Huang, K.-W., Lee, G., Hovsepian, K., Xu, Y., & Shen, M. (2023). Semantic Matching For Text Classification With Complex Class Descriptions. In Proceedings Of The 2023 Conference On Empirical Methods In Natural Language Processing (Pp. 7654-7680). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Emnlp-Main.475

Edwards, A., Ushio, A., Camacho-Collados, J., Ribaupierre, H., & Preece, A. (2022). Guiding Generative Language Models For Data Augmentation In Few-Shot Text Classification. In Proceedings Of The Fourth Workshop On Data Science With Human-In-The-Loop (Language Advances) (Pp. 51-63). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Dash-1.8

Fairstein, Y., Kalinsky, O., Karnin, Z., Kushilevitz, G., Libov, A., & Tolmach, S. (2024). Class Balancing For Efficient Active Learning In Imbalanced Datasets. In Proceedings Of The 18th Linguistic Annotation Workshop (Law-Xviii) (Pp. 77-86). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Law-1.8

Fonseca, G., Cunha, W., Prenassi, G., Gonçalves, M. A., & Rocha, L. C. D. D. (2025). Instance-Selection-Inspired Undersampling Strategies For Bias Reduction In Small And Large Language Models For Binary Text Classification. In Proceedings Of The 63rd Annual Meeting Of The Association For Computational Linguistics (Volume 1: Long Papers) (Pp. 9323-9340). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2025.Acl-Long.458

González-Santos, C., Vega-Rodríguez, M. A., López-Muñoz, J. M., Martínez-Sarriegui, I., & Pérez, C. J. (2024). Automatic Assignment Of Microgenres To Movies Using A Word Embedding-Based Approach. Multimedia Tools And Applications, 83, 48719-48735. Https://Doi.Org/10.1007/S11042-023-17442-Y

Henning, S., Beluch, W., Fraser, A., & Friedrich, A. (2023). A Survey Of Methods For Addressing Class Imbalance In Deep-Learning Based Natural Language Processing. In Proceedings Of The 17th Conference Of The European Chapter Of The Association For Computational Linguistics (Pp. 523-540). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Eacl-Main.38

Hossain, N., & Kabir, M. F. (2025). Context Minimization For Resource-Constrained Text Classification: Optimizing Performance-Efficiency Trade-Offs Through Linguistic Features. In Findings Of The Association For Computational Linguistics: Emnlp 2025 (Pp. 15412-15426). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2025.Findings-Emnlp.833

Jain, V., Rungta, M., Zhuang, Y., Yu, Y., Wang, Z., Gao, M., Skolnick, J., & Zhang, C. (2024). Higen: Hierarchy-Aware Sequence Generation For Hierarchical Text Classification. In Proceedings Of The 18th Conference Of The European Chapter Of The Association For Computational Linguistics (Volume 1: Long Papers) (Pp. 1354-1368). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Eacl-Long.82

Jung, V., & Plas, L. (2024). Understanding The Effects Of Language-Specific Class Imbalance In Multilingual Fine-Tuning. In Findings Of The Association For Computational Linguistics: Eacl 2024 (Pp. 2368-2376). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Findings-Eacl.157

Li, X., Jiang, J., Dharmani, R., Srinivasa, J., Liu, G., & Shang, J. (2024). Open-World Multi-Label Text Classification With Extremely Weak Supervision. In Proceedings Of The 2024 Conference On Empirical Methods In Natural Language Processing (Pp. 15084-15096). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Emnlp-Main.841

Lin, F., Yuan, J., Chen, Z., & Abiri, M. (2024). Enhancing Multimedia Management: Cloud-Based Movie Type Recognition With Hybrid Deep Learning Architecture. Journal Of Cloud Computing, 13, Article 104. Https://Doi.Org/10.1186/S13677-024-00668-Y

Lu, Z., Tian, J., Wei, W., Qu, X., Cheng, Y., Xie, W., & Chen, D. (2024). Mitigating Boundary Ambiguity And Inherent Bias For Text Classification In The Era Of Large Language Models. In Findings Of The Association For Computational Linguistics: Acl 2024 (Pp. 7841-7864). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Findings-Acl.467

Meunier, R., Farah, B., Moriceau, V., & Stolf, P. (2023). Image And Text: Fighting The Same Battle? Super Resolution Learning For Imbalanced Text Classification. In Findings Of The Association For Computational Linguistics: Emnlp 2023 (Pp. 10707-10720). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Findings-Emnlp.718

Mustafa, S., & Hama Saeed, M. (2025). Empowering Text Classification With Nlp And Explainable Ai For Enhanced Interpretability. Journal Of Electrical Systems And Information Technology, 12, Article 81. Https://Doi.Org/10.1186/S43067-025-00273-2

Rahamim, A., Uziel, G., Goldbraich, E., & Anaby Tavor, A. (2023). Text Augmentation Using Dataset Reconstruction For Low-Resource Classification. In Findings Of The Association For Computational Linguistics: Acl 2023 (Pp. 7389-7402). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Findings-Acl.466

Shao, Y., & Guo, N. (2024). Recognizing Online Video Genres Using Ensemble Deep Convolutional Learning For Digital Media Service Management. Journal Of Cloud Computing, 13, Article 102. Https://Doi.Org/10.1186/S13677-024-00664-2

Song, L., Zhang, J., Yang, T., & Goto, M. (2022). Adaptive Ranking-Based Sample Selection For Weakly Supervised Class-Imbalanced Text Classification. In Findings Of The Association For Computational Linguistics: Emnlp 2022 (Pp. 1641-1655). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Findings-Emnlp.119

Wang, M., & Liu, M. (2023). An Empirical Study On Active Learning For Multi-Label Text Classification. In Proceedings Of The Fourth Workshop On Insights From Negative Results In Nlp (Pp. 94-102). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Insights-1.12

Wu, Y., & Huang, X. (2022). Unsupervised Reinforcement Adaptation For Class-Imbalanced Text Classification. In Proceedings Of The 11th Joint Conference On Lexical And Computational Semantics (Pp. 311-322). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Starsem-1.27

Xia, T., Wang, Y., Tian, Y., & Chang, Y. (2022). Fastclass: A Time-Efficient Approach To Weakly-Supervised Text Classification. In Proceedings Of The 2022 Conference On Empirical Methods In Natural Language Processing (Pp. 4746-4758). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Emnlp-Main.313

Downloads

Published

28-07-2026

How to Cite

Ilyassa, M., Akbar, S., Akmal, I., Abrisam, F., & Zaidan Sinaga, H. (2026). Implementasi Klasifikasi Genre Film Pada Platform Imdb Berdasarkan Deskripsi Sinopsis Film Menggunakan Algoritma Naïve Bayes, SVM, Dan Logistic Regression. Indonesian Journal of Multidisciplinary on Social and Technology, 4(3), 1966–1976. https://doi.org/10.69693/ijmst.v4i3.12210