Abstrak - Nafisha Virgin
Terbatas Irwan Sofiyan
» Gedung UPT Perpustakaan
Terbatas Irwan Sofiyan
» Gedung UPT Perpustakaan
Penggunaan chatbot berbasis Large Language Model (LLM) untuk layanan publik
menghadapi risiko jawaban yang tidak akurat atau tidak didukung dokumen resmi.
Retrieval-Augmented Generation (RAG) dapat mengurangi risiko tersebut dengan
menyediakan konteks dari basis pengetahuan eksternal. Namun, berbagai arsitektur
RAG memiliki mekanisme dan trade-off yang berbeda, sementara perbandingan
pada konteks layanan publik berbahasa Indonesia masih terbatas. Penelitian ini
mengembangkan sistem Question Answering berbasis RAG untuk layanan publik
Kabupaten Batang dan membandingkan tiga arsitektur, yaitu Naive RAG, Advanced
RAG, dan Agentic RAG, berdasarkan kualitas retrieval, kualitas jawaban, dan waktu
respons.
Pengembangan sistem mengikuti tahapan CRISP-DM. Dokumen resmi pada domain
Informasi OPD, Kependudukan, Perizinan, dan JDIH diolah menjadi 2.678 chunk.
Evaluasi dilakukan menggunakan 115 pertanyaan in-scope dan 25 pertanyaan outof-
scope dengan metrik Recall@5, Precision@5, MRR, Faithfulness, Semantic Similarity,
dan waktu respons.
Hasil evaluasi menunjukkan adanya trade-off antarkonfigurasi RAG. Pada eksperimen
utama, Naive RAG memperoleh hasil retrieval agregat tertinggi dengan Recall@
5 sebesar 0,857, MRR sebesar 0,793, dan Semantic Similarity sebesar 0,832. Hal
ini dapat dikaitkan dengan tidak adanya intent handling dan domain routing, sehingga
Naive RAG tidak mengalami kehilangan informasi akibat kesalahan pada kedua
tahap tersebut. Namun, Naive RAG tetap melakukan retrieval terhadap pertanyaan
out-of-scope. Studi ablasi menunjukkan bahwa kombinasi hybrid retrieval dan reranking
berpotensi meningkatkan kualitas retrieval pada Advanced RAG, meskipun
manfaatnya belum sepenuhnya terlihat pada pengujian end-to-end karena kesalahan
intent handling. Agentic RAG memperoleh Faithfulness tertinggi sebesar 0,923 dan
waktu respons tercepat untuk pertanyaan out-of-scope sebesar 1,61 detik, tetapi kinerjanya
bergantung pada ketepatan agent dalam menentukan kebutuhan retrieval
dan domain. Naive RAG memiliki rerata waktu respons terendah untuk pertanyaan
in-scope, yaitu 5,80 detik. Hasil tersebut menunjukkan bahwa tidak terdapat satu
arsitektur yang unggul pada seluruh dimensi, sehingga pemilihan arsitektur perlu
mempertimbangkan kualitas dan efisiensi sistem.
Perpustakaan Digital ITB