Implementasi Klasifikasi Genre Film Pada Platform Imdb Berdasarkan Deskripsi Sinopsis Film Menggunakan Algoritma Naïve Bayes, SVM, Dan Logistic Regression
DOI:
https://doi.org/10.69693/ijmst.v4i3.12210Keywords:
Natural Language Processing, Klasifikasi Genre Film, Machine Learning, IMDb, Sinopsis Film, Naïve Bayes, Support Vector Machine, Logistic RegressionAbstract
Pertumbuhan data film digital dan meningkatnya penggunaan platform IMDb menuntut metode otomatis yang mampu mengelompokkan genre berdasarkan informasi tekstual secara konsisten. Penelitian ini bertujuan mengimplementasikan Natural Language Processing dan membandingkan kinerja Multinomial Naïve Bayes, Support Vector Machine LinearSVC, SVM dengan pembobotan kelas seimbang, serta Logistic Regression untuk mengklasifikasikan genre primer film berdasarkan sinopsis. Dataset IMDb Top 1000 dari Kaggle diseleksi menjadi 811 film pada lima genre utama, yaitu Drama, Action, Comedy, Crime, dan Biography. Tahapan penelitian meliputi case folding, cleaning, tokenization, stopword removal, stemming, ekstraksi fitur Term Frequency-Inverse Document Frequency, pembagian data secara stratified 80:20, pelatihan model, evaluasi accuracy, precision, recall, F1-score, confusion matrix, dan validasi silang stratified lima lipatan. Baseline kelas mayoritas menghasilkan akurasi 35,6%. Logistic Regression memberikan hasil terbaik dengan akurasi pengujian 43,56% dan rata-rata validasi silang 44,63%. SVM Balanced mencapai akurasi 42,33%, LinearSVC 41,10%, dan Naïve Bayes 40,49%. Naïve Bayes menunjukkan bias kuat terhadap kelas Drama, sedangkan SVM dan Logistic Regression menghasilkan prediksi lebih seimbang. Kinerja yang masih terbatas terutama dipengaruhi ketidakseimbangan kelas, tumpang tindih naratif antargenre, sinopsis yang pendek, dan penyederhanaan label multigenre menjadi genre primer. Hasil penelitian menegaskan bahwa Logistic Regression merupakan model klasik paling efektif pada konfigurasi data dan fitur yang digunakan serta layak dijadikan baseline untuk penelitian lanjutan.
References
Amelia, R., Santoso, D. B., & Stikubank, U. (2023). Film Genre Prediction With Multi-Class Classification Synopsis. 6, 771–779.
Bahrein, M., & Apandi, S. (2025). Perbandingan Kinerja Naive Bayes, Support Vector Machine, Regresi Logistik, Dan Decision Tree Untuk Klasifikasi Sentimen Ulasan Produk Berbasis Tf-Idf. 24(4), 1067–1078.
Consulting, D. D. L. (2007). Large-Scale Bayesian Logistic Regression For Text Categorization. 49(3), 291–304. Https://Doi.Org/10.1198/004017007000000245
Cortes, C., & Vapnik, V. (1995). Support-Vector Networks. Machine Learning, 297(3), 273–297. Https://Doi.Org/10.1007/Bf00994018
Hudaini, R., Hendriansyah, M., & Gautama, E. (2026). Fake News Classification Using Logistic Regression With Tf-Idf Feature Extraction. June, 239–249.
Irawan, P., & Abdullah, A. (2025). Comparison Of Naïve Bayes And Svm Methods In Detecting Hoax News. 8(2). Https://Doi.Org/10.32877/Bt.V8i2.3122
Joachims, T. (1998). Text Categorization With Support Vector Machines: Learning With Many Relevant Features. 137–142. Https://Doi.Org/10.1007/Bfb0026683
Lukman, K., & Novianto, S. (2025). Komparasi Algoritma Naïve Bayes Dan Svm Untuk Identifikasi Cyberbullying Selebriti Di Media Sosial Twitter. 970–981. Https://Doi.Org/10.33364/Algoritma/V.22-1.2196
Manning, C. D., Raghavan, P., & Schütze, H. (2009). Online Edition (C) 2009 Cambridge Up. C.
Mccallum, A. (1997). A Comparison Of Event Models For Naive Bayes Text Classification.
Mohammad, A. H., & Al-Momani, O. (2016). Arabic Text Categorization Using Support Vector Machine , Naïve Bayes And Neural Network. 5(1). Https://Doi.Org/10.5176/2251-3043
Sebastiani, F. (2002). Machine Learning In Automated Text Categorization. 34(1), 1–47.
Chalkidis, I., & Søgaard, A. (2022). Improved Multi-Label Classification Under Temporal Concept Drift: Rethinking Group-Robust Algorithms In A Label-Wise Setting. In Findings Of The Association For Computational Linguistics: Acl 2022 (Pp. 2441-2454). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Findings-Acl.192
De Silva, B., Huang, K.-W., Lee, G., Hovsepian, K., Xu, Y., & Shen, M. (2023). Semantic Matching For Text Classification With Complex Class Descriptions. In Proceedings Of The 2023 Conference On Empirical Methods In Natural Language Processing (Pp. 7654-7680). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Emnlp-Main.475
Edwards, A., Ushio, A., Camacho-Collados, J., Ribaupierre, H., & Preece, A. (2022). Guiding Generative Language Models For Data Augmentation In Few-Shot Text Classification. In Proceedings Of The Fourth Workshop On Data Science With Human-In-The-Loop (Language Advances) (Pp. 51-63). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Dash-1.8
Fairstein, Y., Kalinsky, O., Karnin, Z., Kushilevitz, G., Libov, A., & Tolmach, S. (2024). Class Balancing For Efficient Active Learning In Imbalanced Datasets. In Proceedings Of The 18th Linguistic Annotation Workshop (Law-Xviii) (Pp. 77-86). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Law-1.8
Fonseca, G., Cunha, W., Prenassi, G., Gonçalves, M. A., & Rocha, L. C. D. D. (2025). Instance-Selection-Inspired Undersampling Strategies For Bias Reduction In Small And Large Language Models For Binary Text Classification. In Proceedings Of The 63rd Annual Meeting Of The Association For Computational Linguistics (Volume 1: Long Papers) (Pp. 9323-9340). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2025.Acl-Long.458
González-Santos, C., Vega-Rodríguez, M. A., López-Muñoz, J. M., Martínez-Sarriegui, I., & Pérez, C. J. (2024). Automatic Assignment Of Microgenres To Movies Using A Word Embedding-Based Approach. Multimedia Tools And Applications, 83, 48719-48735. Https://Doi.Org/10.1007/S11042-023-17442-Y
Henning, S., Beluch, W., Fraser, A., & Friedrich, A. (2023). A Survey Of Methods For Addressing Class Imbalance In Deep-Learning Based Natural Language Processing. In Proceedings Of The 17th Conference Of The European Chapter Of The Association For Computational Linguistics (Pp. 523-540). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Eacl-Main.38
Hossain, N., & Kabir, M. F. (2025). Context Minimization For Resource-Constrained Text Classification: Optimizing Performance-Efficiency Trade-Offs Through Linguistic Features. In Findings Of The Association For Computational Linguistics: Emnlp 2025 (Pp. 15412-15426). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2025.Findings-Emnlp.833
Jain, V., Rungta, M., Zhuang, Y., Yu, Y., Wang, Z., Gao, M., Skolnick, J., & Zhang, C. (2024). Higen: Hierarchy-Aware Sequence Generation For Hierarchical Text Classification. In Proceedings Of The 18th Conference Of The European Chapter Of The Association For Computational Linguistics (Volume 1: Long Papers) (Pp. 1354-1368). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Eacl-Long.82
Jung, V., & Plas, L. (2024). Understanding The Effects Of Language-Specific Class Imbalance In Multilingual Fine-Tuning. In Findings Of The Association For Computational Linguistics: Eacl 2024 (Pp. 2368-2376). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Findings-Eacl.157
Li, X., Jiang, J., Dharmani, R., Srinivasa, J., Liu, G., & Shang, J. (2024). Open-World Multi-Label Text Classification With Extremely Weak Supervision. In Proceedings Of The 2024 Conference On Empirical Methods In Natural Language Processing (Pp. 15084-15096). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Emnlp-Main.841
Lin, F., Yuan, J., Chen, Z., & Abiri, M. (2024). Enhancing Multimedia Management: Cloud-Based Movie Type Recognition With Hybrid Deep Learning Architecture. Journal Of Cloud Computing, 13, Article 104. Https://Doi.Org/10.1186/S13677-024-00668-Y
Lu, Z., Tian, J., Wei, W., Qu, X., Cheng, Y., Xie, W., & Chen, D. (2024). Mitigating Boundary Ambiguity And Inherent Bias For Text Classification In The Era Of Large Language Models. In Findings Of The Association For Computational Linguistics: Acl 2024 (Pp. 7841-7864). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2024.Findings-Acl.467
Meunier, R., Farah, B., Moriceau, V., & Stolf, P. (2023). Image And Text: Fighting The Same Battle? Super Resolution Learning For Imbalanced Text Classification. In Findings Of The Association For Computational Linguistics: Emnlp 2023 (Pp. 10707-10720). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Findings-Emnlp.718
Mustafa, S., & Hama Saeed, M. (2025). Empowering Text Classification With Nlp And Explainable Ai For Enhanced Interpretability. Journal Of Electrical Systems And Information Technology, 12, Article 81. Https://Doi.Org/10.1186/S43067-025-00273-2
Rahamim, A., Uziel, G., Goldbraich, E., & Anaby Tavor, A. (2023). Text Augmentation Using Dataset Reconstruction For Low-Resource Classification. In Findings Of The Association For Computational Linguistics: Acl 2023 (Pp. 7389-7402). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Findings-Acl.466
Shao, Y., & Guo, N. (2024). Recognizing Online Video Genres Using Ensemble Deep Convolutional Learning For Digital Media Service Management. Journal Of Cloud Computing, 13, Article 102. Https://Doi.Org/10.1186/S13677-024-00664-2
Song, L., Zhang, J., Yang, T., & Goto, M. (2022). Adaptive Ranking-Based Sample Selection For Weakly Supervised Class-Imbalanced Text Classification. In Findings Of The Association For Computational Linguistics: Emnlp 2022 (Pp. 1641-1655). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Findings-Emnlp.119
Wang, M., & Liu, M. (2023). An Empirical Study On Active Learning For Multi-Label Text Classification. In Proceedings Of The Fourth Workshop On Insights From Negative Results In Nlp (Pp. 94-102). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2023.Insights-1.12
Wu, Y., & Huang, X. (2022). Unsupervised Reinforcement Adaptation For Class-Imbalanced Text Classification. In Proceedings Of The 11th Joint Conference On Lexical And Computational Semantics (Pp. 311-322). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Starsem-1.27
Xia, T., Wang, Y., Tian, Y., & Chang, Y. (2022). Fastclass: A Time-Efficient Approach To Weakly-Supervised Text Classification. In Proceedings Of The 2022 Conference On Empirical Methods In Natural Language Processing (Pp. 4746-4758). Association For Computational Linguistics. Https://Doi.Org/10.18653/V1/2022.Emnlp-Main.313
Downloads
Published
How to Cite
Issue
Section
License
Copyright (c) 2026 Indonesian Journal of Multidisciplinary on Social and Technology

This work is licensed under a Creative Commons Attribution 4.0 International License.














