digilib@itb.ac.id +62 812 2508 8800

Sistem Retrieval-Augmented Generation (RAG) harus menemukan informasi yang relevan dari dokumen sebelum model bahasa membentuk jawaban. Tantangan ini semakin besar pada arsitektur multi-domain karena peraturan perundang-undangan bidang pendidikan di Indonesia dan User Manual produk Netgear memiliki struktur, istilah, dan kebutuhan pencarian yang berbeda. Pemotongan dokumen yang mengabaikan struktur dapat memutus konteks atau menghilangkan identitas sumber, sedangkan strategi pengindeksan dan pembentukan hubungan yang dibuat khusus untuk satu domain sulit dipelihara ketika sumber baru ditambahkan. Diperlukan pipeline yang menjaga keterlacakan informasi sekaligus dapat diperluas tanpa mengubah kode inti. Penelitian ini merancang dan mengimplementasikan pipeline konstruksi basis pengetahuan pada sistem OMNI-RAG sebagai arsitektur multi-domain berbasis plugin. Konstruksi basis pengetahuan mencakup tiga proses utama, yaitu membagi dokumen menjadi unit informasi yang lebih kecil dengan mempertahankan konteks, memproyeksikan unit tersebut menjadi indeks pencarian sparse, dense, atau hybrid, serta membentuk entitas dan relasi dalam knowledge graph dari chunk kanonik yang sama. Implementasi menyediakan empat strategi chunker, tiga strategi indexer, dan dua strategi knowledge graph, yaitu legal graph dan LLM graph, melalui kontrak yang seragam. Canonical artifact, provenance, profile, manifest, dan kontrak kompatibilitas digunakan sebagai batas integrasi antarkomponen. Dengan rancangan ini, strategi chunker, indexer, dan knowledge graph dapat dipilih atau ditambahkan melalui plugin tanpa mengubah orkestrator inti. Komponen Context PII, guardrail, dan history compactor melengkapi pengelolaan konteks percakapan. Eksperimen dilakukan pada dua use case. User Manual mencakup sembilan manual Netgear dengan total 1.400 halaman dan 200 baris pertanyaan yang berasal dari 100 slot dalam bahasa Inggris dan Indonesia. Use case hukum menggunakan 25 pertanyaan yang disusun untuk eksperimen dan diverifikasi oleh ahli. Datasource hukum berisi 256 dokumen, yaitu 49 dokumen yang memuat context reference dan 207 dokumen noise yang dipilih secara stratified. Retrieval menggunakan teks native dari parser tanpa OCR, membandingkan lima konfigurasi, mematikan reranker dan knowledge graph pada jalur langsung, serta menguji cutoff sampai K = 60. Recall menjadi metrik utama, sedangkan precision, MRR, dan NDCG menjadi metrik pendukung. Generation menggunakan sepuluh evidence teratas (K = 10) dan menilai correctness serta faithfulness dengan framework Ragas dan openai/gpt-5.6-luna pada pengaturan reasoning yang ditetapkan untuk setiap run. vi Pada User Manual, structure-aware hybrid mengalahkan baseline sliding-window dengan recall 0,740 berbanding 0,685 pada K = 30. Structure-aware dense menjadi konfigurasi indexer dengan recall 0,785, lebih tinggi daripada baseline structure-aware sparse sebesar 0,420. Pada use case hukum, legal-structure dense memperoleh recall 0,6854, mengungguli baseline sliding sebesar 0,6345 dan baseline sparse sebesar 0,6381. Pada K = 10, structure-aware dense menghasilkan correctness/faithfulness 0,788/0,958 pada User Manual, sedangkan legal-structure dense menghasilkan 0,690/0,972 pada dokumen hukum. Eksperimen knowledge-graph hukum menggunakan legal graph dan menelusuri neighborhood global sampai kedalaman dua. Skor neighborhood recall tertinggi adalah 1,000 pada sliding, tetapi metrik ini dibaca terpisah dari context-reference recall. Hasil tersebut menunjukkan bahwa pemeliharaan struktur dan pencocokan semantik meningkatkan cakupan konteks, sementara perbedaan precision, urutan hasil, dan kualitas jawaban perlu dibaca sesuai tujuan setiap tahap. Temuan berlaku pada korpus, pertanyaan, dan konfigurasi eksperimen yang digunakan.