Abstrak - M. Athaullah Daffa Kusuma M
Terbatas Irwan Sofiyan
» Gedung UPT Perpustakaan
Terbatas Irwan Sofiyan
» Gedung UPT Perpustakaan
Sistem monitoring produk e-commerce pada umumnya menyajikan tiap listing produk sebagai data yang berdiri sendiri, sedangkan pengguna membutuhkan informasi agregat pada tingkat produk seperti sebaran harga dari banyak penjual sekaligus. Penyatuan listing yang merujuk pada produk yang sama tersebut memerlukan product matching. Pada tugas akhir ini, dilakukan perbandingan pendekatan product matching berbasis teks beserta penerapannya pada sistem monitoring produk e-commerce di Indonesia.
Perbandingan dilakukan pada tingkat SKU, yaitu kombinasi antara satu listing produk dan salah satu variannya, dengan judul produk dan nama varian sebagai masukan. Dibandingkan tujuh pendekatan, yaitu pembobotan TF-IDF sebagai baseline serta arsitektur bi-encoder dan cross-encoder dengan model dasar IndoBERT dan mBERT. Dataset dibangun secara mandiri melalui web scraping pada marketplace Indonesia berupa 2.172 SKU dan 10.984 pasangan berlabel. Threshold keputusan ditentukan pada data validasi sebagai threshold terendah yang presisinya mencapai sekurang-kurangnya 0,85. Pendekatan terbaik kemudian diterapkan pada sistem monitoring berbasis web dengan penyatuan hasil pencocokan menjadi klaster menggunakan Extended Maximum Clique Clustering.
Berdasarkan hasil pengujian, didapati bahwa pendekatan cross-encoder dengan model dasar mBERT memiliki kinerja paling baik, yaitu skor F1
sebesar 0,808. Cakupan bahasa model dasar terbukti lebih menentukan kinerja dibandingkan pilihan arsitektur pencocokan. Penerapannya pada sistem monitoring membentuk 1.242 produk dari 2.082 SKU, di antaranya 360 produk beranggota lebih dari satu SKU dan 120 produk memuat penawaran lintas platform.
Perpustakaan Digital ITB