digilib@itb.ac.id +62 812 2508 8800

ABSTRAK Farhan Nafis Rayhan
PUBLIC Open In Flipbook Esha Mustika Dewi

Kemampuan model generatif dalam menghasilkan kode membuat pemeriksaan asal-usul kode semakin penting. Tantangannya bukan hanya membedakan kode manusia dan kode hasil generasi mesin, tetapi juga mengidentifikasi famili generator yang belum diamati saat pelatihan. Penelitian ini membahas persoalan tersebut pada SemEval-2026 Task 13 Subtask B dengan sebelas kelas, yaitu kelas Human dan sepuluh famili generator. Solusi yang dirancang menggunakan pipeline multi-view. View sanitized code diproses oleh UniXcoder untuk mempertahankan struktur dan format kode, sedangkan view human-like language diproses oleh DeBERTa untuk menangkap komentar, string, dan identifier. Token stylometry ditambahkan untuk membawa informasi tersebut ke dalam masukan encoder. Kedua encoder dilatih secara terpisah menggunakan Supervised Contrastive Learning, kemudian digabungkan melalui Asymmetric Gated Fusion dan diklasifikasikan menggunakan Sub-center ArcFace. Kualitas embedding dievaluasi dengan k-NN Macro-F1 pada validasi normal dan Leave-One-Generator-Out (LOGO). Pada embedding akhir, UniXcoder-Base-Nine dengan panjang input 1024 token menghasilkan Macro-F1 multikelas 0,5223 pada validasi normal dan 0,3228 pada LOGO, sedangkan DeBERTa-V3-Base dengan input 768 token menghasilkan 0,3769 dan 0,2686. Kedua embedding lebih kuat untuk membedakan kode manusia dan kode AI daripada mengatribusikan famili generator; visualisasiUMAP juga menunjukkan tumpang tindih antarfamili dan penurunan recall pada generator yang ditahan. Sistem akhir mencapai Macro-F1 0,38054 pada data uji. Hasil ini menunjukkan bahwa kedua view memberikan informasi yang saling melengkapi, tetapi generalisasi lintas generator masih menjadi tantangan utama.