digilib@itb.ac.id +62 812 2508 8800

Abstrak - DEWANTORO TRIATMOJO
Terbatas  Irwan Sofiyan
» Gedung UPT Perpustakaan

Jawaban yang dihasilkan sistem Retrieval-Augmented Generation (RAG) bergantung pada kualitas dokumen yang digunakan sebagai sumber pengetahuan. Pada sistem RAG multidomain, dokumen dapat berasal dari sumber dengan cara akses dan struktur yang berbeda sehingga satu alur akuisisi dan ekstraksi tidak selalu dapat digunakan tanpa penyesuaian. Tugas akhir ini bertujuan mengembangkan arsitektur akuisisi dan ekstraksi dokumen berbasis plugin pada sistem OMNI-RAG agar penambahan sumber dan domain baru dapat dilakukan melalui plugin tanpa mengubah komponen inti maupun tahap pemrosesan berikutnya. Studi kasus akuisisi mencakup situs web peraturan BPK dan API Google Drive, sedangkan studi kasus ekstraksi mencakup dokumen peraturan perundang-undangan dan user manual produk NETGEAR. Arsitektur yang dikembangkan membedakan komponen inti (fungsi umum) dari plugin (fungsi khusus sumber atau domain). Pada tahap akuisisi, komponen inti memilih dan menjalankan scraper plugin yang sesuai, menerima entri serta isi berkas, kemudian memvalidasi tipe dan isi, menghitung hash, menangani deduplikasi, menyimpan dokumen, serta mencatat status. Dua scraper plugin yang digunakan adalah scraper plugin situs web peraturan BPK dan scraper plugin Google Drive. Masing-masing plugin menangani enumerasi dan pengunduhan sesuai dengan mekanisme sumbernya. Pada tahap ekstraksi, komponen inti memilih dan menjalankan parser plugin yang sesuai, memvalidasi hasilnya, menyimpannya sebagai dokumen kanonik berbentuk hierarki, lalu meneruskannya ke tahap chunking berikutnya melalui pipeline. Dua parser plugin yang digunakan adalah legal parser untuk dokumen peraturan dan generic outline parser untuk user manual produk. Legal parser memilih ekstraksi teks native atau OCR pada tingkat halaman, lalu membangun struktur berdasarkan penanda peraturan. Generic outline parser membangun struktur user manual produk dengan menggunakan document outline. Evaluasi akuisisi dibagi menjadi dua bagian sesuai dengan dua scraper plugin yang digunakan. Bagian pertama menguji scraper plugin situs web peraturan BPK melalui enam konfigurasi akuisisi. Enam konfigurasi tersebut masing-masing memproses 8.822 entri dan menghasilkan 8.745 dokumen baru. Throughput yang dihasilkan berada pada rentang 618,5–4.990,5 dokumen baru per jam. Konfigurasi akhir yang dipilih adalah konfigurasi dengan download_concurrency=5 dan jeda 1–3 detik. Konfigurasi tersebut menghasilkan throughput 2.444,2 dokumen baru per jam. Pada konfigurasi tersebut terdapat 15 kegagalan: 6 entri gagal karena tautan unduh mengembalikan HTTP 404 dan 9 entri gagal karena tautan unduh tidak tersedia. Konfigurasi baseline memiliki satu kegagalan tambahan akibat retry exhaustion yang diduga berkaitan dengan gangguan jaringan pada sisi klien. Kegavi galan pada satu entri tidak menghentikan pemrosesan entri lain maupun keseluruhan run. Bagian kedua menguji scraper plugin Google Drive melalui API. Pengujian ini memproses 11 entri dan menghasilkan 9 dokumen baru, melewati 1 entri duplikat dan 1 entri dengan tipe berkas yang tidak didukung, serta tidak menemukan kegagalan. Evaluasi ekstraksi dibagi menjadi dua bagian sesuai dengan dua parser plugin yang digunakan. Bagian pertama menguji legal parser pada dokumen peraturan. Pengujian dimulai dengan menentukan jalur ekstraksi setiap halaman: halaman bertipe VECTOR diarahkan ke jalur teks native, sedangkan halaman bertipe SCAN diarahkan ke jalur OCR. Ambang cakupan citra 0,50 dan teks native minimum 100 karakter menghasilkan akurasi classifier 98,8%, recall kelas SCAN 100,0%, precision kelas SCAN 97,1%, dan macro F1 98,8%. Selanjutnya, 4.459 dokumen bertipe VECTOR diproses dengan 48 profil parser teks native. Seluruh profil menghasilkan keluaran tanpa kegagalan terminal, sedangkan profil terbaik mencapai clean rate 72,1% dengan throughput 552 dokumen per menit. Jalur OCR diuji pada sampel 250 dokumen bertipe SCAN. GLM-OCR tanpa boxing model menghasilkan clean rate tertinggi, yaitu 69,2%, dengan failure rate 0,4%. Bagian kedua menguji generic outline parser pada sembilan user manual produk NETGEAR. Parser ini langsung menggunakan teks digital dan document outline untuk membentuk struktur. Seluruh 1.566 bookmark berhasil dicocokkan dengan judul bagian dan tidak ditemukan peringatan maupun kegagalan. Secara keseluruhan, komponen inti akuisisi dapat menjalankan dua scraper plugin melalui alur yang sama, sedangkan komponen inti ekstraksi dapat menjalankan dua parser plugin melalui kontrak yang sama. Kedua parser plugin menghasilkan dokumen kanonik dengan bentuk yang sama. Dokumen kanonik tersebut kemudian dapat diteruskan ke tahap chunking dalam pipeline tanpa bergantung pada sumber dokumen atau cara ekstraksinya.