digilib@itb.ac.id +62 812 2508 8800

Abstrak - Nafisha Virgin
Terbatas  Irwan Sofiyan
» Gedung UPT Perpustakaan

Penggunaan chatbot berbasis Large Language Model (LLM) untuk layanan publik menghadapi risiko jawaban yang tidak akurat atau tidak didukung dokumen resmi. Retrieval-Augmented Generation (RAG) dapat mengurangi risiko tersebut dengan menyediakan konteks dari basis pengetahuan eksternal. Namun, berbagai arsitektur RAG memiliki mekanisme dan trade-off yang berbeda, sementara perbandingan pada konteks layanan publik berbahasa Indonesia masih terbatas. Penelitian ini mengembangkan sistem Question Answering berbasis RAG untuk layanan publik Kabupaten Batang dan membandingkan tiga arsitektur, yaitu Naive RAG, Advanced RAG, dan Agentic RAG, berdasarkan kualitas retrieval, kualitas jawaban, dan waktu respons. Pengembangan sistem mengikuti tahapan CRISP-DM. Dokumen resmi pada domain Informasi OPD, Kependudukan, Perizinan, dan JDIH diolah menjadi 2.678 chunk. Evaluasi dilakukan menggunakan 115 pertanyaan in-scope dan 25 pertanyaan outof- scope dengan metrik Recall@5, Precision@5, MRR, Faithfulness, Semantic Similarity, dan waktu respons. Hasil evaluasi menunjukkan adanya trade-off antarkonfigurasi RAG. Pada eksperimen utama, Naive RAG memperoleh hasil retrieval agregat tertinggi dengan Recall@ 5 sebesar 0,857, MRR sebesar 0,793, dan Semantic Similarity sebesar 0,832. Hal ini dapat dikaitkan dengan tidak adanya intent handling dan domain routing, sehingga Naive RAG tidak mengalami kehilangan informasi akibat kesalahan pada kedua tahap tersebut. Namun, Naive RAG tetap melakukan retrieval terhadap pertanyaan out-of-scope. Studi ablasi menunjukkan bahwa kombinasi hybrid retrieval dan reranking berpotensi meningkatkan kualitas retrieval pada Advanced RAG, meskipun manfaatnya belum sepenuhnya terlihat pada pengujian end-to-end karena kesalahan intent handling. Agentic RAG memperoleh Faithfulness tertinggi sebesar 0,923 dan waktu respons tercepat untuk pertanyaan out-of-scope sebesar 1,61 detik, tetapi kinerjanya bergantung pada ketepatan agent dalam menentukan kebutuhan retrieval dan domain. Naive RAG memiliki rerata waktu respons terendah untuk pertanyaan in-scope, yaitu 5,80 detik. Hasil tersebut menunjukkan bahwa tidak terdapat satu arsitektur yang unggul pada seluruh dimensi, sehingga pemilihan arsitektur perlu mempertimbangkan kualitas dan efisiensi sistem.