Graph Neural Network (GNN) merupakan pendekatan pembelajaran berbasis graf yang bertujuan mempelajari representasi simpul dengan memanfaatkan informasi fitur simpul dan hubungan antarsimpul. Salah satu arsitektur GNN yang banyak digunakan adalah GraphSAGE (Graph Sampling and Aggregation), yang mendukung pembelajaran induktif melalui mekanisme sampling tetangga dan agregasi informasi untuk membentuk representasi simpul berdasarkan lingkunganya. Penelitian terdahulu telah memanfaatkan informasi similarity berdasarkan kemiripan fitur simpul untuk mempertahankan relevansi informasi tetangga, serta diversity untuk memperoleh informasi yang lebih beragam. Namun, pemanfaatan kedua karakteristik tersebut dilakukan melalui dua proses sampling yang terpisah, sehingga melibatkan proses pemilihan tetangga secara terpisah. Kondisi tersebut menunjukkan bahwa informasi kemiripan diperlukan untuk mempertahankan relevansi, sementara informasi pembeda diperlukan untuk mengurangi redundansi dan mempertahankan keberagaman informasi. Oleh karena itu, penelitian ini bertujuan mengembangkan GraphSAGE dengan mempertimbangkan kedua karakteristik tersebut dalam pembentukan representasi simpul.
Penelitian ini mengusulkan modifikasi GraphSAGE melalui mekanisme Similarity-Dissimilarity Sampling dan Similarity-Dissimilarity Aggregator. Pada tahap sampling, kemiripan antara simpul target dan tetangga dihitung menggunakan cosine similarity, sedangkan dissimilarity diperoleh berdasarkan selisih nilai cosine similarity antartetangga. Kedua informasi tersebut kemudian dikombinasikan menjadi score pemilihan tetangga dengan memberikan bobot pada similarity dan dissimilarity,
ii
sehingga dapat mempertimbangkan relevansi dan keberagaman informasi dalam satu proses sampling. Selanjutnya, pada tahap agregasi, informasi similarity dan dissimilarity diberikan pembobotan berbasis softmax untuk menentukan kontribusi masing-masing informasi dalam pembentukan representasi simpul.
Evaluasi dilakukan pada tugas klasifikasi simpul menggunakan dataset PPI, PubMed, Citeseer, Chameleon, Squirrel, dan Texas. Hasil pengujian menunjukkan bahwa model usulan memperoleh nilai evaluasi sebesar 62,19% pada PPI, 87,80% pada PubMed, 71,47% pada Citeseer, 57,76% pada Chameleon, 41,52% pada Squirrel, dan 77,30% pada Texas. Model usulan menunjukkan peningkatan kinerja dibandingkan baseline pada lima dataset, sedangkan pada PubMed baseline memperoleh hasil yang lebih tinggi. Berdasarkan uji Wilcoxon Signed-Rank Test, perbedaan kinerja antara model usulan dan baseline signifikan secara statistik pada dataset Chameleon dan Squirrel. Hasil tersebut menunjukkan bahwa pemanfaatan informasi kemiripan dan ketidakmiripan pada mekanisme sampling dan agregasi berkontribusi dalam pembentukan representasi simpul pada GraphSAGE.
Perpustakaan Digital ITB