Klasifikasi Malaria pada Citra Sel Darah Menggunakan Vision Transformer (ViT) dan Cross-Attention Multi-Scale Vision Transformer (CrossViT)
Diagnosis malaria secara manual rentan terhadap kesalahan. Oleh karena itu, penelitian ini bertujuan untuk membandingkan kinerja serta menentukan konfigurasi hyperparameter terbaik antara arsitektur Vision Transformer (ViT) dan Cross-Attention Multi-Scale Vision Transformer (CrossViT) dalam mengklasifikasikan citra sel darah terinfeksi malaria. Metode yang digunakan melibatkan pelatihan model sepenuhnya dari awal (train from scratch) menggunakan variasi optimizer dan learning rate dengan fungsi kerugian Binary Cross Entropy with Logits Loss. Pencarian hyperparameter optimal menunjukkan kedua model mencapai performa terbaik menggunakan optimizer Adam dengan learning rate 0,0001. Evaluasi pada pengujian akhir membuktikan CrossViT lebih unggul dengan akurasi 96,48% dibandingkan ViT sebesar 96,23%. Selain itu, CrossViT berhasil meningkatkan recall kelas terinfeksi menjadi 0,96, yang mereduksi jumlah kesalahan fatal (False Negative) dari 73 menjadi 58 kasus. Hasil yang menunjukkan bahwa CrossViT berkinerja lebih baik dibandingkan dengan ViT ini menegaskan keandalannya sebagai arsitektur yang direkomendasikan untuk sistem diagnosis awal malaria.
URI
https://repo.itera.ac.id/depan/submission/SB2609150022
Keyword
Attention Map Cross-Attention Multi-Scale Vision Transformer (Cr Hyperparameter Malaria Vision Transformer (ViT)