Pengaruh Strategi Penanganan Basa Ambigu DNA Terhadap Kinerja Klasifikasi Naive Bayes Pada Fragmen 16S rRNA Berbasis K-mer dan IPCA Pada Tingkat Family
Gen 16S rRNA banyak digunakan dalam klasifikasi taksonomi bakteri. Namun, data sekuens sering mengandung basa ambigu yang berpotensi menurunkan kinerja klasifikasi komputasional. Penelitian ini bertujuan mengevaluasi pengaruh tiga strategi penanganan basa ambigu, yaitu *Ambiguous Removal* (AR), *Random Replacement* (RR), dan *Proportional Replacement* (PR), terhadap efisiensi komputasi dan akurasi klasifikasi tingkat *Family*. Sekuens direpresentasikan menggunakan ekstraksi *k-mer* (k = 6) yang menstandarisasi dimensi data menjadi 4.096 fitur. Ekstraksi *k-mer* direduksi menggunakan *Incremental Principal Component Analysis* (IPCA) dengan target *Cumulative Explained Variance* (CEV) 95% agar efisien memori, dan selanjutnya diklasifikasikan menggunakan algoritma *Gaussian Naive Bayes*. Hasil pengujian menunjukkan ketiga strategi mampu menyederhanakan fitur menjadi 1.621 hingga 1.622 komponen utama tanpa perbedaan performa klasifikasi yang signifikan, terbukti dari kinerja model yang sangat stabil dengan nilai akurasi 0,864–0,865, *Weighted F1-Score* 0,894, dan *Confidence Score* 0,998 pada seluruh skenario. Secara keseluruhan, strategi *Proportional Replacement* (PR) dinilai paling optimal karena memberikan efisiensi penggunaan memori yang sangat baik (7.997,3 MB) dengan waktu eksekusi yang cepat (3.773,9 detik), sekaligus mampu merestorasi probabilitas informasi biologis DNA secara terukur.
URI
https://repo.itera.ac.id/depan/submission/SB2609080024
Keyword
16S rRNA Klasifikasi taksonomi k-mer Incremental PCA Naive Bayes