Sistem Retrieval-Augmented Generation (RAG) harus menemukan informasi yang relevan
dari dokumen sebelum model bahasa membentuk jawaban. Tantangan ini semakin
besar pada arsitektur multi-domain karena peraturan perundang-undangan bidang pendidikan
di Indonesia dan User Manual produk Netgear memiliki struktur, istilah, dan kebutuhan
pencarian yang berbeda. Pemotongan dokumen yang mengabaikan struktur dapat memutus
konteks atau menghilangkan identitas sumber, sedangkan strategi pengindeksan dan pembentukan
hubungan yang dibuat khusus untuk satu domain sulit dipelihara ketika sumber
baru ditambahkan. Diperlukan pipeline yang menjaga keterlacakan informasi sekaligus dapat
diperluas tanpa mengubah kode inti.
Penelitian ini merancang dan mengimplementasikan pipeline konstruksi basis pengetahuan
pada sistem OMNI-RAG sebagai arsitektur multi-domain berbasis plugin. Konstruksi
basis pengetahuan mencakup tiga proses utama, yaitu membagi dokumen menjadi unit informasi
yang lebih kecil dengan mempertahankan konteks, memproyeksikan unit tersebut
menjadi indeks pencarian sparse, dense, atau hybrid, serta membentuk entitas dan relasi
dalam knowledge graph dari chunk kanonik yang sama. Implementasi menyediakan empat
strategi chunker, tiga strategi indexer, dan dua strategi knowledge graph, yaitu legal graph
dan LLM graph, melalui kontrak yang seragam. Canonical artifact, provenance, profile,
manifest, dan kontrak kompatibilitas digunakan sebagai batas integrasi antarkomponen. Dengan
rancangan ini, strategi chunker, indexer, dan knowledge graph dapat dipilih atau ditambahkan
melalui plugin tanpa mengubah orkestrator inti. Komponen Context PII, guardrail,
dan history compactor melengkapi pengelolaan konteks percakapan.
Eksperimen dilakukan pada dua use case. User Manual mencakup sembilan manual
Netgear dengan total 1.400 halaman dan 200 baris pertanyaan yang berasal dari 100
slot dalam bahasa Inggris dan Indonesia. Use case hukum menggunakan 25 pertanyaan
yang disusun untuk eksperimen dan diverifikasi oleh ahli. Datasource hukum berisi 256
dokumen, yaitu 49 dokumen yang memuat context reference dan 207 dokumen noise
yang dipilih secara stratified. Retrieval menggunakan teks native dari parser tanpa OCR,
membandingkan lima konfigurasi, mematikan reranker dan knowledge graph pada jalur
langsung, serta menguji cutoff sampai K = 60. Recall menjadi metrik utama, sedangkan
precision, MRR, dan NDCG menjadi metrik pendukung. Generation menggunakan sepuluh
evidence teratas (K = 10) dan menilai correctness serta faithfulness dengan framework
Ragas dan openai/gpt-5.6-luna pada pengaturan reasoning yang ditetapkan untuk setiap
run.
vi
Pada User Manual, structure-aware hybrid mengalahkan baseline sliding-window dengan
recall 0,740 berbanding 0,685 pada K = 30. Structure-aware dense menjadi konfigurasi
indexer dengan recall 0,785, lebih tinggi daripada baseline structure-aware sparse
sebesar 0,420. Pada use case hukum, legal-structure dense memperoleh recall 0,6854,
mengungguli baseline sliding sebesar 0,6345 dan baseline sparse sebesar 0,6381. Pada
K = 10, structure-aware dense menghasilkan correctness/faithfulness 0,788/0,958 pada
User Manual, sedangkan legal-structure dense menghasilkan 0,690/0,972 pada dokumen
hukum. Eksperimen knowledge-graph hukum menggunakan legal graph dan menelusuri
neighborhood global sampai kedalaman dua. Skor neighborhood recall tertinggi adalah
1,000 pada sliding, tetapi metrik ini dibaca terpisah dari context-reference recall. Hasil tersebut
menunjukkan bahwa pemeliharaan struktur dan pencocokan semantik meningkatkan
cakupan konteks, sementara perbedaan precision, urutan hasil, dan kualitas jawaban perlu
dibaca sesuai tujuan setiap tahap. Temuan berlaku pada korpus, pertanyaan, dan konfigurasi
eksperimen yang digunakan.
Perpustakaan Digital ITB