(0721) 8030188    [email protected]   

All of ITERA Repository
Titles

ANALISIS KOMPARATIF ENSEMBLE HETEROGEN CNN DAN VISION TRANSFORMER UNTUK KLASIFIKASI CITRA INFORMASI KRISIS


View/Open

Author
ALIEF, FATHUR RAHMAN

Date Published
17 Aug 2026

Advisor
Hafiz Budi Firmansyah, S.Kom., M.Sc., Ph.D.,

Subject
Teknik Informatika

Publisher


Penyebaran citra media sosial yang masif selama bencana menciptakan tantangan signifikan bagi sistem manajemen krisis yang membutuhkan informasi yang cepat dan akurat, sehingga diperlukan pendekatan klasifikasi otomatis untuk mendukung operasi respons bencana. Penelitian ini membandingkan empat arsitektur deep learning dan mengevaluasi berbagai konfigurasi model tunggal serta ensemble untuk klasifikasi citra informasi krisis pada dataset CrisisMMD yang mencakup tiga tugas: klasifikasi citra informatif (Task 1), klasifikasi kategori kemanusiaan (Task 2), dan penilaian tingkat kerusakan (Task 3), menggunakan EfficientNetV2-M, ConvNeXt-Base, Swin-Small, dan ViT-B/16 yang merepresentasikan spektrum dari CNN murni hingga Transformer murni. Pelatihan menerapkan strategi two-stage fine-tuning, weighted cross-entropy loss, penggabungan kelas minoritas pada Task 2, dan augmentasi data, dengan ablation study menggunakan lima variant pelatihan untuk mengisolasi kontribusi setiap komponen. Setelah seleksi model secara cross-variant, tujuh konfigurasi ensemble dievaluasi, meliputi simple averaging, weighted voting, stacking dengan regresi logistik, dan empat variant komposisi arsitektur. Swin-Small mencapai Akurasi model tunggal terbaik pada Task 1 (0,8596), sementara ConvNeXt-Base unggul pada Task 2 (Macro F1: 0,7227) dan Task 3 (Macro F1: 0,5957). Ensemble stacking heterogen (E3) mencapai Akurasi 0,8722 pada Task 1, melampaui hasil ensemble homogen terbaik yang dilaporkan pada dataset yang sama sebesar 0,846, dan ensemble heterogen serupa (E6, ConvNeXt-Base dan Swin-Small) secara konsisten mencapai performa terbaik di antara seluruh konfigurasi ensemble dua model pada ketiga task. Analisis ablasi menunjukkan bahwa performa EfficientNetV2-M menurun signifikan pada prosedur two-stage fine-tuning, dengan indikasi keterkaitan terhadap karakteristik BatchNorm saat backbone dibekukan, dan bahwa penggabungan kelas minoritas terbukti konsisten meningkatkan Macro F1 pada Task 2, sementara weighted cross-entropy loss menunjukkan kontribusi yang bervariasi antar task.

URI
https://repo.itera.ac.id/depan/submission/SB2608140013

Keyword
klasifikasi citra krisis ensemble learning deep learning CrisisMMD vision transformer