Perkembangan Large Language Models (LLMs) berbasis Transformer telah meningkatkan kualitas Neural Machine Translation (NMT), tetapi mesin penerjemah masih menghadapi permasalahan bias gender, terutama pada pasangan bahasa yang memiliki perbedaan sistem gramatikal seperti bahasa Indonesia dan bahasa Inggris. Bahasa Indonesia menggunakan bentuk yang relatif netral gender, seperti dia, beliau, dan akhiran -nya, sedangkan bahasa Inggris mengharuskan pemilihan bentuk bergender seperti he, she, his, atau her. Ketidakmampuan model dalam mempertahankan informasi gender yang sesuai konteks dapat menyebabkan kesalahan penerjemahan, perubahan makna, serta menghasilkan keluaran yang berpotensi memperkuat stereotype gender.
Sejumlah penelitian sebelumnya telah memanfaatkan cross-lingual representation alignment, contrastive learning, dan pendekatan language-agnostic representation untuk mengurangi bias pada sistem penerjemahan. Namun, masih terdapat keterbatasan dalam pengembangan mekanisme fine-tuning yang secara khusus mengarahkan representasi internal encoder agar informasi gender yang relevan tetap terjaga selama proses pembelajaran.
Penelitian ini bertujuan mengembangkan pendekatan fine-tuning Large Language Model berbasis Encoder-Decoder untuk mitigasi bias gender pada penerjemahan bahasa Indonesia–Inggris dengan mengintegrasikan Gender-Aware Semantic Alignment (GASA) sebagai mekanisme representation regularization. GASA memanfaatkan cosine similarity pada agregasi encoder hidden states untuk mengarahkan representasi semantik model agar lebih selaras terhadap informasi gender yang relevan tanpa mengubah arsitektur dasar model. Pendekatan tersebut diintegrasikan dengan Low-Rank Adaptation (LoRA) pada model mBART sehingga proses adaptasi dapat dilakukan secara efisien dengan memperbarui parameter berorde rendah.
Eksperimen menggunakan korpus paralel TED2020 bahasa Indonesia–Inggris sebanyak 165.059 pasangan kalimat, dengan 19.980 pasangan kalimat mengandung anotasi gender. Tahapan penelitian meliputi penyiapan dan anotasi data, tokenisasi, pembentukan pasangan data yang mempertahankan
informasi gender, fine-tuning model, integrasi LoRA dan GASA, serta evaluasi hasil penerjemahan. Proses pelatihan mengoptimalkan objective penerjemahan sekaligus mempertahankan keselarasan representasi melalui regularisasi GASA, sehingga informasi gender tidak hanya dipelajari pada keluaran decoder, tetapi juga dipertahankan pada representasi internal encoder.
Evaluasi dilakukan pada aspek kualitas terjemahan dan ketepatan representasi gender untuk memperoleh gambaran yang lebih komprehensif mengenai efektivitas pendekatan yang dikembangkan. Evaluasi dilakukan menggunakan dataset Saunders dengan membandingkan model zero-shot, fine-tuning konvensional, dan mBART + LoRA + GASA berdasarkan skor BLEU dan akurasi kata bergender. Hasil penelitian menunjukkan bahwa mBART + LoRA + GASA menghasilkan peningkatan skor BLEU sebesar 16,76 poin dibandingkan fine-tuning konvensional dan 10,23 poin dibandingkan model zero-shot. Pada evaluasi kata bergender, model tersebut meningkatkan akurasi sebesar 1,16 poin persentase dibandingkan fine-tuning konvensional dan 48,92 poin persentase dibandingkan model zero-shot sebagai baseline.
Hasil perbandingan menunjukkan bahwa integrasi GASA dalam proses fine-tuning tidak hanya meningkatkan kemampuan model dalam menghasilkan terjemahan yang lebih sesuai secara umum, tetapi juga meningkatkan ketepatan pemilihan kata bergender pada konteks bahasa Indonesia–Inggris. Kebaruan penelitian ini terletak pada penerapan representation regularization yang secara eksplisit mempertimbangkan informasi gender melalui keselarasan representasi encoder dalam skema fine-tuning LLM menggunakan LoRA. Pendekatan ini memberikan alternatif mitigasi bias gender yang tidak memerlukan perubahan arsitektur utama model dan dapat diintegrasikan ke dalam proses adaptasi parameter secara efisien.
Dengan demikian, penelitian ini memberikan kontribusi pada pengembangan metode fine-tuning LLM untuk penerjemahan yang lebih akurat, sensitif terhadap informasi gender, dan lebih adil, khususnya pada pasangan bahasa Indonesia–Inggris. Temuan ini juga memperlihatkan bahwa pengendalian representasi internal dapat menjadi strategi yang relevan untuk mengatasi bias pada model penerjemahan berbasis Transformer tanpa memerlukan perancangan ulang arsitektur secara menyeluruh.
Perpustakaan Digital ITB