Perbandingan K-Nearest Neighbor dan Naive Bayes dalam Klasifikasi Genre Film Berdasarkan Sinopsis

Abstract Views: 52   PDF Downloads: 64

Authors

  • Alfin Gimnastiar Universitas Islam Negeri Sumatera Utara
  • Muhammad Ikhsan Universitas Islam Negeri Sumatera Utara

DOI:

https://doi.org/10.56211/sudo.v5i3.1974

Keywords:

K-Nearest Neighbor (K-NN); Naive Bayes; TF-IDF; Klasifikasi Teks; Sinopsis Film

Abstract

Pertumbuhan industri film dan semakin beragamnya konten menyebabkan pengelompokan film berdasarkan genre menjadi semakin menantang. Penelitian ini bertujuan untuk membandingkan kinerja algoritma K-Nearest Neighbor (KNN) dan Naive Bayes dalam mengklasifikasikan genre film berdasarkan teks sinopsis. Proses pengolahan teks dilakukan menggunakan pendekatan Natural Language Processing (NLP) dan ekstraksi fitur Term Frequency-Inverse Document Frequency (TF-IDF) dengan pendekatan single-label classification. Dataset diperoleh dari The Movie Database (TMDB) dan terdiri atas 1.000 sinopsis film berbahasa Inggris yang terbagi secara seimbang ke dalam lima genre, yaitu Action, Horror, Romance, Comedy, dan Science Fiction. Dataset kemudian dibagi menjadi 80% data latih dan 20% data uji. Hasil pengujian menunjukkan bahwa Naive Bayes dengan Laplace Smoothing (alpha = 1,0) menghasilkan kinerja lebih baik dengan Accuracy 59,00%, Precision 58,44%, Recall 59,00%, dan F1-score 58,50%. Sementara itu, KNN (K = 5) dengan Cosine Similarity memperoleh Accuracy 44,00%, Precision 45,16%, Recall 44,00%, dan F1-score 44,06%. Performa Naive Bayes yang lebih baik berkaitan dengan kemampuannya dalam memanfaatkan pola probabilitas kosakata pada masing-masing genre, meskipun kedua model masih menghadapi kesulitan pada genre dengan kosakata yang saling beririsan. Berdasarkan hasil tersebut, Naive Bayes lebih efektif dibandingkan KNN untuk klasifikasi genre film pada dataset yang digunakan.

Downloads

Download data is not yet available.

References

[1] J. M. A. Saputra, M. L. Huizen, and B. D. Arianto, “Sistem Rekomendasi Film pada Platform Streaming Menggunakan Metode Content-Based Filtering,” Jurnal Transformatika, vol. 22, no. 1, pp. 10–21, Jul. 2024, doi: 10.26623/transformatika.v22i1.7041.

[2] V. Agustina and A. Herliana, “Analisis Sentimen Publik atas Kebijakan Efisiensi Anggaran 2025 dengan Text Mining dan Natural Language Processing,” Jurnal Media Informatika, vol. 6, no. 3, pp. 2182–2194, Jul. 2025, doi: 10.55338/JUMIN.V6I3.6301.

[3] R. R. Putra, N. A. Putri, and A. D. Putra, Teknik Cosine Similarity Dan TF-IDF Dalam Analisis Data. Payakumbuh: PT. Serasi Media Teknologi, 2024.

[4] B. P. Candra and A. F. Mujaki, “Klasifikasi Jenis Surat Pada Sistem E-Arsip Menggunakan Metode K-Nearest Neighbor,” Jurnal Ilmiah Sistem Informasi, vol. 5, no. 1, pp. 449–459, Jan. 2026, doi: 10.51903/336mw957.

[5] L. Zhang, “Features extraction based on Naive Bayes algorithm and TF-IDF for news classification,” PLoS One, vol. 20, no. 7, p. e0327347, Jul. 2025, doi: 10.1371/journal.pone.0327347.

[6] Sutriawan, S. Mutmainnah, T. A. Lorosae, and S. Ramadhan, “Model Text Embedding dan TF-IDF+Ngram untuk Meningkatkan Kinerja Algoritma Binary Classifier pada Klasifikasi SMS Palsu,” Jurnal Sistem Informasi Triguna Dharma (JURSI TGD), vol. 4, no. 1, pp. 55–64, Jan. 2025, doi: 10.53513/jursi.v4i1.10582.

[7] K. Munawaroh and A. Alamsyah, “Performance Comparison of SVM, Naïve Bayes, and KNN Algorithms for Analysis of Public Opinion Sentiment Against COVID-19 Vaccination on Twitter,” Journal of Advances in Information Systems and Technology, vol. 4, no. 2, pp. 113–125, Mar. 2022, doi: 10.15294/jaist.v4i2.59493.

[8] A. Prayogo, F. Fauziah, and W. Winarsih, “PERBANDINGAN ALGORITMA NAÏVE BAYES DAN K-NEAREST NEIGHBOR PADA KLASIFIKASI JUDUL ARTIKEL PADA JURNAL ILMIAH,” JIPI (Jurnal Ilmiah Penelitian dan Pembelajaran Informatika), vol. 8, no. 4, pp. 1327–1338, Nov. 2023, doi: 10.29100/JIPI.V8I4.4141.

[9] N. Buslim, L. K. Oh, M. H. A. Hardy, and Y. Wijaya, “Comparative Analysis of KNN, Naïve Bayes and SVM Algorithms for Movie Genres Classification Based on Synopsis.,” JURNAL TEKNIK INFORMATIKA, vol. 15, no. 2, pp. 169–177, Dec. 2022, doi: 10.15408/jti.v15i2.29302.

[10] J. Akbar, E. Utami, and A. Yaqin, “Multi-Label Classification of Film Genres Based on Synopsis Using Support Vector Machine, Logistic Regression and Naïve Bayes Algorithms,” Institute of Electrical and Electronics Engineers, pp. 250–255, 2022, doi: 10.1109/ICITISEE57756.2022.10057828.

[11] R. Amelia and D. B. Santoso, “Prediksi Genre Film Dengan Klasifikasi Multi Kelas Sinopsis Menggunakan Jaringan LSTM,” INTECOMS: Journal of Information Technology and Computer Science, vol. 6, no. 2, pp. 771–779, Sep. 2023, doi: 10.31539/intecoms.v6i2.6961.

[12] G. P. A. Brahmantha, E. Utami, and A. Yaqin, “KLASIFIKASI GENRE ANIME BERDASARKAN SINOPSIS MENGGUNAKAN ALGORITMA K-NEAREST NEIGHBORS,” Jurnal Manajemen Informatika dan Sistem Informasi, vol. 7, no. 1, pp. 15–24, Feb. 2024, doi: 10.36595/MISI.V7I1.1016.

[13] K. Rahayu, V. Fitria, D. Septhya, R. Rahmaddeni, and L. Efrizoni, “Klasifikasi Teks untuk Mendeteksi Depresi dan Kecemasan pada Pengguna Twitter Berbasis Machine Learning,” MALCOM: Indonesian Journal of Machine Learning and Computer Science, vol. 3, no. 2, pp. 108–114, Sep. 2023, doi: 10.57152/MALCOM.V3I2.780.

[14] A. P. Harahap, A. Karim, and R. Rohani, “Analisis Klasifikasi Sentimen Prediksi Rating Aplikasi Apple’s AppStore Dengan Menggunakan Metode Algoritma Random Forest,” Building of Informatics, Technology and Science (BITS), vol. 6, no. 4, pp. 2371–2379, Mar. 2025, doi: 10.47065/BITS.V6I4.6812.

[15] M. Utami, “Komparasi Motode Support Vector Machine, Naïve Bayes, dan Random Forest Pada Natural Language Processing Terhadap Berita Negatif,” JCOSIS (Journal Computer Science and Information Systems), vol. 2, no. 1, pp. 8–13, May 2025, doi: 10.61567/JCOSIS.V2I1.229.

[16] M. S. Maulana, Y. Anshori, R. Azhar, R. Laila, and N. T. Lapatta, “IMPLEMENTASI PEMBOBOTAN TF-IDF PADA CHATBOT TELEGRAM UNTUK SISTEM LAYANAN INFORMASI,” JIPI (Jurnal Ilmiah Penelitian dan Pembelajaran Informatika), vol. 10, no. 3, pp. 1869–1877, Aug. 2025, doi: 10.29100/JIPI.V10I3.6314.

[17] M. A. Mazta, E. Saputra, and M. Razi, “PERBANDINGAN KINERJA TF-IDF DAN COUNT VECTORIZATION PADA SISTEM REKOMENDASI JUDUL SKRIPSI BERBASIS CONTENT-BASED FILTERING,” Jurnal Informatika Teknologi dan Sains (Jinteks), vol. 7, no. 4, pp. 1807–1816, Nov. 2025, doi: 10.51401/JINTEKS.V7I4.6741.

[18] N. F. Octavia and Berlilana, “Penerapan Algoritma K-Nearest Neighbor untuk Analisis Sentimen Ulasan Produk Elektronik pada Platform E-Commerce,” Jurnal Algoritma, vol. 22, no. 2, pp. 2110-2121–2110–2121, Nov. 2025, doi: 10.33364/ALGORITMA/V.22-2.3083.

[19] A. Davina, M. Putri, N. Sulistianingsih, and R. Rismayati, “Pengaruh Teknik Representasi Teks Bag-of-Words dan TF-IDF terhadap Akurasi Klasifikasi Sentimen Teks Multi-Domain,” Jurnal Teknologi Informasi dan Multimedia, vol. 7, no. 4, pp. 675–688, Oct. 2025, doi: 10.35746/jtim.v7i4.756.

[20] I. M. B. Gautama, “Klasifikasi Data Saran Pemustaka di Perpustakaan STIKOM Bali Menggunakan TF-IDF dan Multinomial Naive Bayes,” Jurnal Sistem dan Informatika (JSI), vol. 17, no. 2, pp. 62–72, May 2023, doi: 10.30864/JSI.V17I2.490.

[21] F. R. Valerian, M. Syarief, and D. A. Fatah, “KLASIFIKASI TINGKAT OBESITAS MENGGUNAKAN METODE GBM DAN CONFUSION MATRIX,” JATI (Jurnal Mahasiswa Teknik Informatika), vol. 9, no. 2, pp. 2242–2249, Mar. 2025, doi: 10.36040/JATI.V9I2.13062.

[22] M. Fadli and R. A. Saputra, “KLASIFIKASI DAN EVALUASI PERFORMA MODEL RANDOM FOREST UNTUK PREDIKSI STROKE,” Jurnal Teknik, vol. 12, no. 2, Oct. 2023, doi: 10.31000/JT.V12I2.9099.

Downloads

Article History

Submitted: 18-08-2026
Published: 25-09-2026
Pages: 254-264

PlumX Metrics

How to Cite

Gimnastiar, A., & Ikhsan, M. (2026). Perbandingan K-Nearest Neighbor dan Naive Bayes dalam Klasifikasi Genre Film Berdasarkan Sinopsis. Sudo Jurnal Teknik Informatika, 5(3), 254–264. https://doi.org/10.56211/sudo.v5i3.1974