Perbandingan K-Nearest Neighbor dan Naive Bayes dalam Klasifikasi Genre Film Berdasarkan Sinopsis
DOI:
https://doi.org/10.56211/sudo.v5i3.1974Keywords:
K-Nearest Neighbor (K-NN); Naive Bayes; TF-IDF; Klasifikasi Teks; Sinopsis Film
Abstract
Pertumbuhan industri film dan semakin beragamnya konten menyebabkan pengelompokan film berdasarkan genre menjadi semakin menantang. Penelitian ini bertujuan untuk membandingkan kinerja algoritma K-Nearest Neighbor (KNN) dan Naive Bayes dalam mengklasifikasikan genre film berdasarkan teks sinopsis. Proses pengolahan teks dilakukan menggunakan pendekatan Natural Language Processing (NLP) dan ekstraksi fitur Term Frequency-Inverse Document Frequency (TF-IDF) dengan pendekatan single-label classification. Dataset diperoleh dari The Movie Database (TMDB) dan terdiri atas 1.000 sinopsis film berbahasa Inggris yang terbagi secara seimbang ke dalam lima genre, yaitu Action, Horror, Romance, Comedy, dan Science Fiction. Dataset kemudian dibagi menjadi 80% data latih dan 20% data uji. Hasil pengujian menunjukkan bahwa Naive Bayes dengan Laplace Smoothing (alpha = 1,0) menghasilkan kinerja lebih baik dengan Accuracy 59,00%, Precision 58,44%, Recall 59,00%, dan F1-score 58,50%. Sementara itu, KNN (K = 5) dengan Cosine Similarity memperoleh Accuracy 44,00%, Precision 45,16%, Recall 44,00%, dan F1-score 44,06%. Performa Naive Bayes yang lebih baik berkaitan dengan kemampuannya dalam memanfaatkan pola probabilitas kosakata pada masing-masing genre, meskipun kedua model masih menghadapi kesulitan pada genre dengan kosakata yang saling beririsan. Berdasarkan hasil tersebut, Naive Bayes lebih efektif dibandingkan KNN untuk klasifikasi genre film pada dataset yang digunakan.
Downloads
References
[1] J. M. A. Saputra, M. L. Huizen, and B. D. Arianto, “Sistem Rekomendasi Film pada Platform Streaming Menggunakan Metode Content-Based Filtering,” Jurnal Transformatika, vol. 22, no. 1, pp. 10–21, Jul. 2024, doi: 10.26623/transformatika.v22i1.7041.
[2] V. Agustina and A. Herliana, “Analisis Sentimen Publik atas Kebijakan Efisiensi Anggaran 2025 dengan Text Mining dan Natural Language Processing,” Jurnal Media Informatika, vol. 6, no. 3, pp. 2182–2194, Jul. 2025, doi: 10.55338/JUMIN.V6I3.6301.
[3] R. R. Putra, N. A. Putri, and A. D. Putra, Teknik Cosine Similarity Dan TF-IDF Dalam Analisis Data. Payakumbuh: PT. Serasi Media Teknologi, 2024.
[4] B. P. Candra and A. F. Mujaki, “Klasifikasi Jenis Surat Pada Sistem E-Arsip Menggunakan Metode K-Nearest Neighbor,” Jurnal Ilmiah Sistem Informasi, vol. 5, no. 1, pp. 449–459, Jan. 2026, doi: 10.51903/336mw957.
[5] L. Zhang, “Features extraction based on Naive Bayes algorithm and TF-IDF for news classification,” PLoS One, vol. 20, no. 7, p. e0327347, Jul. 2025, doi: 10.1371/journal.pone.0327347.
[6] Sutriawan, S. Mutmainnah, T. A. Lorosae, and S. Ramadhan, “Model Text Embedding dan TF-IDF+Ngram untuk Meningkatkan Kinerja Algoritma Binary Classifier pada Klasifikasi SMS Palsu,” Jurnal Sistem Informasi Triguna Dharma (JURSI TGD), vol. 4, no. 1, pp. 55–64, Jan. 2025, doi: 10.53513/jursi.v4i1.10582.
[7] K. Munawaroh and A. Alamsyah, “Performance Comparison of SVM, Naïve Bayes, and KNN Algorithms for Analysis of Public Opinion Sentiment Against COVID-19 Vaccination on Twitter,” Journal of Advances in Information Systems and Technology, vol. 4, no. 2, pp. 113–125, Mar. 2022, doi: 10.15294/jaist.v4i2.59493.
[8] A. Prayogo, F. Fauziah, and W. Winarsih, “PERBANDINGAN ALGORITMA NAÏVE BAYES DAN K-NEAREST NEIGHBOR PADA KLASIFIKASI JUDUL ARTIKEL PADA JURNAL ILMIAH,” JIPI (Jurnal Ilmiah Penelitian dan Pembelajaran Informatika), vol. 8, no. 4, pp. 1327–1338, Nov. 2023, doi: 10.29100/JIPI.V8I4.4141.
[9] N. Buslim, L. K. Oh, M. H. A. Hardy, and Y. Wijaya, “Comparative Analysis of KNN, Naïve Bayes and SVM Algorithms for Movie Genres Classification Based on Synopsis.,” JURNAL TEKNIK INFORMATIKA, vol. 15, no. 2, pp. 169–177, Dec. 2022, doi: 10.15408/jti.v15i2.29302.
[10] J. Akbar, E. Utami, and A. Yaqin, “Multi-Label Classification of Film Genres Based on Synopsis Using Support Vector Machine, Logistic Regression and Naïve Bayes Algorithms,” Institute of Electrical and Electronics Engineers, pp. 250–255, 2022, doi: 10.1109/ICITISEE57756.2022.10057828.
[11] R. Amelia and D. B. Santoso, “Prediksi Genre Film Dengan Klasifikasi Multi Kelas Sinopsis Menggunakan Jaringan LSTM,” INTECOMS: Journal of Information Technology and Computer Science, vol. 6, no. 2, pp. 771–779, Sep. 2023, doi: 10.31539/intecoms.v6i2.6961.
[12] G. P. A. Brahmantha, E. Utami, and A. Yaqin, “KLASIFIKASI GENRE ANIME BERDASARKAN SINOPSIS MENGGUNAKAN ALGORITMA K-NEAREST NEIGHBORS,” Jurnal Manajemen Informatika dan Sistem Informasi, vol. 7, no. 1, pp. 15–24, Feb. 2024, doi: 10.36595/MISI.V7I1.1016.
[13] K. Rahayu, V. Fitria, D. Septhya, R. Rahmaddeni, and L. Efrizoni, “Klasifikasi Teks untuk Mendeteksi Depresi dan Kecemasan pada Pengguna Twitter Berbasis Machine Learning,” MALCOM: Indonesian Journal of Machine Learning and Computer Science, vol. 3, no. 2, pp. 108–114, Sep. 2023, doi: 10.57152/MALCOM.V3I2.780.
[14] A. P. Harahap, A. Karim, and R. Rohani, “Analisis Klasifikasi Sentimen Prediksi Rating Aplikasi Apple’s AppStore Dengan Menggunakan Metode Algoritma Random Forest,” Building of Informatics, Technology and Science (BITS), vol. 6, no. 4, pp. 2371–2379, Mar. 2025, doi: 10.47065/BITS.V6I4.6812.
[15] M. Utami, “Komparasi Motode Support Vector Machine, Naïve Bayes, dan Random Forest Pada Natural Language Processing Terhadap Berita Negatif,” JCOSIS (Journal Computer Science and Information Systems), vol. 2, no. 1, pp. 8–13, May 2025, doi: 10.61567/JCOSIS.V2I1.229.
[16] M. S. Maulana, Y. Anshori, R. Azhar, R. Laila, and N. T. Lapatta, “IMPLEMENTASI PEMBOBOTAN TF-IDF PADA CHATBOT TELEGRAM UNTUK SISTEM LAYANAN INFORMASI,” JIPI (Jurnal Ilmiah Penelitian dan Pembelajaran Informatika), vol. 10, no. 3, pp. 1869–1877, Aug. 2025, doi: 10.29100/JIPI.V10I3.6314.
[17] M. A. Mazta, E. Saputra, and M. Razi, “PERBANDINGAN KINERJA TF-IDF DAN COUNT VECTORIZATION PADA SISTEM REKOMENDASI JUDUL SKRIPSI BERBASIS CONTENT-BASED FILTERING,” Jurnal Informatika Teknologi dan Sains (Jinteks), vol. 7, no. 4, pp. 1807–1816, Nov. 2025, doi: 10.51401/JINTEKS.V7I4.6741.
[18] N. F. Octavia and Berlilana, “Penerapan Algoritma K-Nearest Neighbor untuk Analisis Sentimen Ulasan Produk Elektronik pada Platform E-Commerce,” Jurnal Algoritma, vol. 22, no. 2, pp. 2110-2121–2110–2121, Nov. 2025, doi: 10.33364/ALGORITMA/V.22-2.3083.
[19] A. Davina, M. Putri, N. Sulistianingsih, and R. Rismayati, “Pengaruh Teknik Representasi Teks Bag-of-Words dan TF-IDF terhadap Akurasi Klasifikasi Sentimen Teks Multi-Domain,” Jurnal Teknologi Informasi dan Multimedia, vol. 7, no. 4, pp. 675–688, Oct. 2025, doi: 10.35746/jtim.v7i4.756.
[20] I. M. B. Gautama, “Klasifikasi Data Saran Pemustaka di Perpustakaan STIKOM Bali Menggunakan TF-IDF dan Multinomial Naive Bayes,” Jurnal Sistem dan Informatika (JSI), vol. 17, no. 2, pp. 62–72, May 2023, doi: 10.30864/JSI.V17I2.490.
[21] F. R. Valerian, M. Syarief, and D. A. Fatah, “KLASIFIKASI TINGKAT OBESITAS MENGGUNAKAN METODE GBM DAN CONFUSION MATRIX,” JATI (Jurnal Mahasiswa Teknik Informatika), vol. 9, no. 2, pp. 2242–2249, Mar. 2025, doi: 10.36040/JATI.V9I2.13062.
[22] M. Fadli and R. A. Saputra, “KLASIFIKASI DAN EVALUASI PERFORMA MODEL RANDOM FOREST UNTUK PREDIKSI STROKE,” Jurnal Teknik, vol. 12, no. 2, Oct. 2023, doi: 10.31000/JT.V12I2.9099.
Downloads
Article History
Pages: 254-264
How to Cite
Issue
Section
License
Copyright (c) 2026 Alfin Gimnastiar, Muhammad Ikhsan

This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.
Penulis yang mempublikasikan naskahnya pada sudo Jurnal Teknik Informatika menyetujui ketentuan berikut:
Hak cipta atas artikel apapun dalam sudo Jurnal Teknik Informatika dipegang penuh oleh penulisnya di bawah lisensi Creative Commons Attribution-ShareAlike 4.0 International License. dengan beberapa ketentuan sebagai berikut:
"Penulis mengakui bahwa sudo Jurnal Teknik Informatika berhak sebagai yang mempublikasikan pertama kali dengan lisensi Creative Commons Attribution-ShareAlike 4.0 International License / CC BY SA 4.0"
"Penulis dapat memasukan tulisan secara terpisah, mengatur distribusi non-ekskulif dari naskah yang telah terbit di jurnal ini ke dalam versi yang lain (misal: dikirim ke respository institusi penulis, publikasi ke dalam buku, dll), dengan mengakui bahwa naskah telah terbit pertama kali pada sudo Jurnal Teknik Informatika."
"Pembaca diperbolehkan mengunduh, menggunakan, dan mengadopsi isi artikel selama mengutip artikel dengan menyebutkan judul, penulis, dan nama jurnal ini. Pengutipan tersebut dilakukan demi kemajuan ilmu pengetahuan dan kemanusiaan serta tidak boleh melanggar hukum yang berlaku."









