Analis bisnis berperan menjembatani pertanyaan pengambil keputusan dengan data
warehouse perusahaan, tetapi kapasitasnya terbatas, sementara sistem NL2SQL
yang ada berhenti pada terjemahan query tanpa sampai ke insight. Penerapan Large
Language Model (LLM) untuk analisis data juga masih memiliki keterbatasan, yaitu
risiko angka yang dikarang, definisi metrik internal yang tidak dikenali model, dan
tidak adanya pemeriksaan mutu sebelum jawaban sampai ke pengguna.
Penelitian ini merancang dan membangun Conversational Analyst, sistem multiagent
berbasis LLM yang mengubah pertanyaan natural language menjadi insight
bisnis utuh. Sebuah Planner mendekomposisi pertanyaan, empat agen pekerja
(SQL, RAG, browsing, dan visualisasi) bekerja di atas shared state, dan sebuah
Evaluator Agent menolak draf jawaban yang angkanya menyimpang dari data sebelum
sampai ke pengguna. Sistem dievaluasi end-to-end pada database production
ter-masking sebuah agen perjalanan di Indonesia (sekitar 1,57 juta baris invoice)
memakai 30 pertanyaan dwibahasa bertingkat kesulitan, dalam pengujian ablation
terhadap dua baseline, yaitu agen SQL murni dan agen tunggal monolitik dengan
tool yang sama, dinilai oleh LLM-as-judge berkerangka G-Eval pada lima dimensi
dengan verifikasi mandiri terhadap database.
Hasil evaluasi menunjukkan bahwa baseline SQL murni kolaps pada pertanyaan
yang membutuhkan pengetahuan internal (persetujuan 13%), menegaskan perlunya
kapabilitas di luar NL2SQL. Sistem usulan mencapai tingkat persetujuan yang sama
dengan baseline monolitik (57%) tetapi jauh lebih unggul pada data faithfulness
(rerata 4,87 berbanding 4,17? Wilcoxon p = 0,0005) dan tidak pernah mengarang
angka pada seluruh pertanyaan uji, dengan biaya sekitar 2,2 kali per jawaban disetujui.
Secara keseluruhan, verifikasi eksplisit lewat evaluator terdedikasi terbukti
menghilangkan mode kegagalan yang paling merugikan pada sistem penunjang keputusan,
yaitu jawaban yang meyakinkan dengan angka yang salah.
Perpustakaan Digital ITB