digilib@itb.ac.id +62 812 2508 8800

Abstrak - DIANA TRI HANDAYANI
Terbatas  Irwan Sofiyan
» Gedung UPT Perpustakaan

Ekstraksi entitas dari publikasi ilmiah kecerdasan artifisial diperlukan untuk memperoleh informasi terstruktur mengenai komponen yang digunakan dalam suatu sistem kecerdasan artifisial. Boxology Extended Annotation Model (BEAM) menyediakan skema untuk merepresentasikan komponen tersebut, tetapi ekstraksi komponen BEAM masih menghadapi tantangan berupa panjang dokumen, kompleksitas definisi entitas, dan kemiripan konteks antarentitas. Tugas akhir ini bertujuan untuk melakukan eksperimen Named Entity Recognition (NER) dengan pendekatan generatif dan diskriminatif untuk ekstraksi komponen BEAM. Data publikasi ilmiah dikumpulkan, diproses, dan diperoleh sebanyak 415 publikasi ilmiah untuk data latih, 10 publikasi ilmiah untuk data validasi, dan 20 publikasi ilmiah untuk data uji. Data latih diperoleh melalui proses automatic labeling menggunakan model gpt-oss-120b, sedangkan untuk data validasi dan data uji diperoleh melalui anotasi manual. Pendekatan generatif mencakup teknik prompting engineering, post-processing, dan fine-tuning beberapa model generatif, sedangkan pendekatan diskriminatif mencakup penggunaan model Transformer berbasis token classification dengan skema BIO-labeling. Pada pendekatan generatif, prompting dan post-processing menunjukkan pengaruh terhadap kualitas ekstraksi, sedangkan pada pendekatan fine-tuning, T5 pada versi t5-v1_1-base memberikan performa yang lebih baik dibandingkan model generatif pembanding yaitu Qwen3-8B-Base dan Llama-3.1-8B. Pada pendekatan diskriminatif, SciBERT memberikan performa yang lebih baik dibandingkan model pembanding yaitu DeBERTa dan XLM-RoBERTa. Hasil pengujian keseluruhan menunjukkan bahwa pendekatan prompting dan post-processing mampu menghasilkan ekstraksi entitas yang terbaik dibandingkan pendekatan lain. Kesalahan utama pada hasil ekstraksi berkaitan dengan penentuan batas entitas, ketidakseimbangan kelas, serta pembedaan kategori BEAM yang memiliki karakteristik semantik berdekatan.