Kemampuan model generatif dalam menghasilkan kode membuat pemeriksaan asal-usul
kode semakin penting. Tantangannya bukan hanya membedakan kode manusia dan kode
hasil generasi mesin, tetapi juga mengidentifikasi famili generator yang belum diamati saat
pelatihan. Penelitian ini membahas persoalan tersebut pada SemEval-2026 Task 13 Subtask
B dengan sebelas kelas, yaitu kelas Human dan sepuluh famili generator.
Solusi yang dirancang menggunakan pipeline multi-view. View sanitized code diproses oleh
UniXcoder untuk mempertahankan struktur dan format kode, sedangkan view human-like
language diproses oleh DeBERTa untuk menangkap komentar, string, dan identifier. Token
stylometry ditambahkan untuk membawa informasi tersebut ke dalam masukan encoder.
Kedua encoder dilatih secara terpisah menggunakan Supervised Contrastive Learning, kemudian
digabungkan melalui Asymmetric Gated Fusion dan diklasifikasikan menggunakan
Sub-center ArcFace. Kualitas embedding dievaluasi dengan k-NN Macro-F1 pada validasi
normal dan Leave-One-Generator-Out (LOGO).
Pada embedding akhir, UniXcoder-Base-Nine dengan panjang input 1024 token menghasilkan
Macro-F1 multikelas 0,5223 pada validasi normal dan 0,3228 pada LOGO, sedangkan
DeBERTa-V3-Base dengan input 768 token menghasilkan 0,3769 dan 0,2686. Kedua
embedding lebih kuat untuk membedakan kode manusia dan kode AI daripada mengatribusikan
famili generator; visualisasiUMAP juga menunjukkan tumpang tindih antarfamili dan
penurunan recall pada generator yang ditahan. Sistem akhir mencapai Macro-F1 0,38054
pada data uji. Hasil ini menunjukkan bahwa kedua view memberikan informasi yang saling
melengkapi, tetapi generalisasi lintas generator masih menjadi tantangan utama.
Perpustakaan Digital ITB