Hadis Shahih al-Bukhari memuat lebih dari tujuh ribu riwayat yang menjadi sumber hukum Islam kedua setelah Al-Qur'an, namun relasi implisit antara hadis, perawi, sanad, dan topik pembahasannya tersebar dan sulit ditelusuri secara manual. Tugas akhir ini membangun sebuah sistem tanya jawab (question answering) berbahasa Indonesia yang memadukan dua pendekatan representasi pengetahuan, yaitu Retrieval-Augmented Generation (RAG) berbasis pencarian vektor semantik dan graf pengetahuan ontologi yang diekstraksi secara otomatis menggunakan Large Language Model (LLM).
Data hadis dikumpulkan dari situs hadits.id melalui Scrapy, dibersihkan dan dinormalisasi menjadi 7.008 entri, kemudian diberi indeks vektor menggunakan model embedding text-embedding-3-large dan FAISS. Secara paralel, sebuah skema ontologi dengan tujuh tipe entitas (Hadis, Perawi, Sanad, Tokoh, Tempat, Topik, dan Konsep) beserta delapan tipe relasi diekstraksi dari setiap hadis menggunakan LangChain LLMGraphTransformer dengan model gpt-4.1-mini, lalu dimuat dan dideduplikasi ke basis data graf Neo4j. Pertanyaan pengguna dijawab dengan mengambil sepuluh hadis paling relevan melalui pencarian vektor, menyusunnya sebagai konteks bagi model gpt-3.5-turbo, lalu menampilkan jawaban beserta subgraf ontologi terkait secara interaktif melalui antarmuka Streamlit.
Evaluasi sistem menggunakan kerangka kerja RAGAS terhadap sebagian dari 85 pasangan tanya-jawab uji menunjukkan skor rata-rata Answer Relevancy 0,814 dan Context Precision 0,771, sementara Faithfulness (0,626) dan Context Recall (0,517) menunjukkan ruang perbaikan, khususnya pada strategi pengambilan konteks. Hasil ini menunjukkan kelayakan pendekatan dual-index, yaitu vektor dan graf, untuk eksplorasi korpus hadis secara semantik maupun struktural, sekaligus mengidentifikasi arah penyempurnaan lanjutan.
Perpustakaan Digital ITB