Abstrak - DEWANTORO TRIATMOJO
Terbatas Irwan Sofiyan
» Gedung UPT Perpustakaan
Terbatas Irwan Sofiyan
» Gedung UPT Perpustakaan
Jawaban yang dihasilkan sistem Retrieval-Augmented Generation (RAG) bergantung pada
kualitas dokumen yang digunakan sebagai sumber pengetahuan. Pada sistem RAG multidomain,
dokumen dapat berasal dari sumber dengan cara akses dan struktur yang berbeda
sehingga satu alur akuisisi dan ekstraksi tidak selalu dapat digunakan tanpa penyesuaian.
Tugas akhir ini bertujuan mengembangkan arsitektur akuisisi dan ekstraksi dokumen berbasis
plugin pada sistem OMNI-RAG agar penambahan sumber dan domain baru dapat
dilakukan melalui plugin tanpa mengubah komponen inti maupun tahap pemrosesan berikutnya.
Studi kasus akuisisi mencakup situs web peraturan BPK dan API Google Drive,
sedangkan studi kasus ekstraksi mencakup dokumen peraturan perundang-undangan dan
user manual produk NETGEAR.
Arsitektur yang dikembangkan membedakan komponen inti (fungsi umum) dari plugin
(fungsi khusus sumber atau domain). Pada tahap akuisisi, komponen inti memilih dan menjalankan
scraper plugin yang sesuai, menerima entri serta isi berkas, kemudian memvalidasi
tipe dan isi, menghitung hash, menangani deduplikasi, menyimpan dokumen, serta mencatat
status. Dua scraper plugin yang digunakan adalah scraper plugin situs web peraturan
BPK dan scraper plugin Google Drive. Masing-masing plugin menangani enumerasi dan
pengunduhan sesuai dengan mekanisme sumbernya. Pada tahap ekstraksi, komponen inti
memilih dan menjalankan parser plugin yang sesuai, memvalidasi hasilnya, menyimpannya
sebagai dokumen kanonik berbentuk hierarki, lalu meneruskannya ke tahap chunking
berikutnya melalui pipeline. Dua parser plugin yang digunakan adalah legal parser untuk
dokumen peraturan dan generic outline parser untuk user manual produk. Legal parser
memilih ekstraksi teks native atau OCR pada tingkat halaman, lalu membangun struktur
berdasarkan penanda peraturan. Generic outline parser membangun struktur user manual
produk dengan menggunakan document outline.
Evaluasi akuisisi dibagi menjadi dua bagian sesuai dengan dua scraper plugin yang digunakan.
Bagian pertama menguji scraper plugin situs web peraturan BPK melalui enam
konfigurasi akuisisi. Enam konfigurasi tersebut masing-masing memproses 8.822 entri
dan menghasilkan 8.745 dokumen baru. Throughput yang dihasilkan berada pada rentang
618,5–4.990,5 dokumen baru per jam. Konfigurasi akhir yang dipilih adalah konfigurasi
dengan download_concurrency=5 dan jeda 1–3 detik. Konfigurasi tersebut menghasilkan
throughput 2.444,2 dokumen baru per jam. Pada konfigurasi tersebut terdapat 15 kegagalan:
6 entri gagal karena tautan unduh mengembalikan HTTP 404 dan 9 entri gagal karena
tautan unduh tidak tersedia. Konfigurasi baseline memiliki satu kegagalan tambahan akibat
retry exhaustion yang diduga berkaitan dengan gangguan jaringan pada sisi klien. Kegavi
galan pada satu entri tidak menghentikan pemrosesan entri lain maupun keseluruhan run.
Bagian kedua menguji scraper plugin Google Drive melalui API. Pengujian ini memproses
11 entri dan menghasilkan 9 dokumen baru, melewati 1 entri duplikat dan 1 entri dengan
tipe berkas yang tidak didukung, serta tidak menemukan kegagalan.
Evaluasi ekstraksi dibagi menjadi dua bagian sesuai dengan dua parser plugin yang digunakan.
Bagian pertama menguji legal parser pada dokumen peraturan. Pengujian dimulai
dengan menentukan jalur ekstraksi setiap halaman: halaman bertipe VECTOR diarahkan ke
jalur teks native, sedangkan halaman bertipe SCAN diarahkan ke jalur OCR. Ambang cakupan
citra 0,50 dan teks native minimum 100 karakter menghasilkan akurasi classifier 98,8%,
recall kelas SCAN 100,0%, precision kelas SCAN 97,1%, dan macro F1 98,8%. Selanjutnya,
4.459 dokumen bertipe VECTOR diproses dengan 48 profil parser teks native. Seluruh profil
menghasilkan keluaran tanpa kegagalan terminal, sedangkan profil terbaik mencapai clean
rate 72,1% dengan throughput 552 dokumen per menit. Jalur OCR diuji pada sampel 250
dokumen bertipe SCAN. GLM-OCR tanpa boxing model menghasilkan clean rate tertinggi,
yaitu 69,2%, dengan failure rate 0,4%. Bagian kedua menguji generic outline parser
pada sembilan user manual produk NETGEAR. Parser ini langsung menggunakan teks digital
dan document outline untuk membentuk struktur. Seluruh 1.566 bookmark berhasil
dicocokkan dengan judul bagian dan tidak ditemukan peringatan maupun kegagalan.
Secara keseluruhan, komponen inti akuisisi dapat menjalankan dua scraper plugin melalui
alur yang sama, sedangkan komponen inti ekstraksi dapat menjalankan dua parser plugin
melalui kontrak yang sama. Kedua parser plugin menghasilkan dokumen kanonik dengan
bentuk yang sama. Dokumen kanonik tersebut kemudian dapat diteruskan ke tahap chunking
dalam pipeline tanpa bergantung pada sumber dokumen atau cara ekstraksinya.
Perpustakaan Digital ITB