Institut Teknologi Bandung (ITB) mengumpulkan data teks tidak terstruktur dalam jumlah besar yang terus bertambah setiap semesternya dari portofolio perkuliahan, terdiri atas portofolio evaluasi perkuliahan yang diisi dosen untuk setiap kelas yang diampunya dan kuesioner evaluasi perkuliahan yang diisi mahasiswa peserta kelas yang sama. Data ini menyimpan wawasan berharga bagi pemangku kepentingan, tetapi jarang ditinjau ulang karena peninjauan manual yang tidak scalable, sifat data yang naratif, tidak seragam, dan bercampur bahasa menyulitkan analisis terstruktur, sementara penggunaan LLM komersial menimbulkan risiko keamanan dan halusinasi yang krusial bagi keputusan institusional. Tugas Akhir ini merancang dan mengimplementasikan komponen Retrieval-Augmented Generation (RAG) sebagai bagian dari sistem agen analisis data akademik ITB, berdampingan dengan komponen Text-to-SQL.
Komponen RAG dibangun di atas PostgreSQL dengan pgvector, menggabungkan pencarian dense dan sparse melalui Reciprocal Rank Fusion, reranking cross-encoder multibahasa, dan diversifikasi MMR, serta dilengkapi resolusi entitas berlapis dengan ekspansi kueri HyDE untuk kueri bernuansa sentimen. Keandalan jawaban dijaga melalui loop retrieval korektif (CRAG), ekspansi parent-document, dan evaluasi-diri bergaya Self-RAG yang memverifikasi faithfulness tiap segmen jawaban, di mana CRAG dan Self-RAG divalidasi silang dengan penilai independen pihak ketiga. Pengujian 176 kasus uji unit, 56 kasus uji integrasi pada 15 kategori kueri, dan kepatuhan kontrol akses menunjukkan seluruh metrik ketepatan biner mencapai 1.00, sementara Relevansi Jawaban dan Validitas Sitasi mencapai 0.97, di atas ambang batas yang ditetapkan, tanpa pelanggaran kontrol akses pada seluruh peran pengguna.
Perpustakaan Digital ITB