Pembangkitan model Computer-Aided Design (CAD) parametrik 3D secara
otomatis dari instruksi bahasa alami (Text-to-CAD, disingkat Text2CAD)
berpotensi meningkatkan efisiensi dan produktivitas perancangan teknik secara
signifikan. Namun, penelitian-penelitian terdahulu masih menghadapi kendala
utama pada efisiensi representasi dan kapasitas pemodelan sekuens. Representasi
satu aliran, CADSequence, saat ini banyak digunakan oleh penelitian-penelitian
seperti model Text2CAD dan CADFusion. Representasi ini menggabungkan token
perintah (command) dan parameter numerik (arguments) ke dalam satu deret
sekuens linear yang sangat panjang sehingga membebani sumber daya komputasi.
Selain itu, penggabungan kedua jenis informasi heterogen tersebut dalam satu jalur
generasi menyulitkan model karena perlu menangkap relasi perintah dan
dependensi spasial parameter secara simultan. Oleh karena itu, penelitian ini
bertujuan untuk merancang representasi data alternatif serta arsitektur model
pembangkit sekuens CAD yang mampu menyelaraskan prediksi tipe perintah dan
parameter guna meningkatkan ketepatan struktural serta validitas geometris model
CAD hasil prediksi.
Sebagai solusi, penelitian ini mengusulkan representasi dua aliran DualSeq dan
arsitektur model pembangkit berbasis Encoder–Dual-Decoder. Representasi
DualSeq memisahkan sekuens perintah dan parameter numerik ke dalam dua aliran
keluaran yang berbeda secara deterministik. Pada arsitektur model, pretrained
encoder berbasis BERT yang dilengkapi modul Adaptive Layer digunakan untuk
memetakan pemahaman semantik teks deskripsi ke ruang laten domain CAD.
Representasi laten tersebut kemudian diteruskan ke dua decoder independen
(command decoder dan argument decoder) yang saling dihubungkan melalui
mekanisme interaksi silang coupled attention. Mekanisme ini memungkinkan
pertukaran konteks laten antarcabang sebelum distribusi token akhir dibangkitkan.
Pelatihan model dilakukan secara supervised fine-tuning (SFT) menggunakan
skema teacher forcing dengan fungsi objektif gabungan Cross-Entropy Loss untuk
perintah dan argumen diskrit.
Hasil eksperimen pada korpus Text2CAD membuktikan bahwa representasi
DualSeq berhasil mereduksi rata-rata panjang sekuens token sebesar 64,7% (rasio
kompresi rata-rata 0,362) dibandingkan representasi satu aliran CADSequence.
Model usulan berbasis dual-decoder dengan coupled attention berhasil mencapai
kinerja terbaik dengan skor kesesuaian struktural T2C-F1 sebesar 0,9413 pada data
validasi dan 0,9412 pada data uji, melampaui baseline Text2CAD secara signifikan
(0,6873 pada validasi dan 0,6855 pada uji). Model usulan ini juga menghasilkan
peningkatan pada akurasi perintah (CMD-F1 uji mencapai 0,4398 dibandingkan
baseline 0,3371) serta parameter numerik (ARG-F1 uji mencapai 0,6823
dibandingkan baseline 0,1799). Pada evaluasi bentuk 3D, model usulan berhasil
menekan median chamfer distance (CD) hingga 0,00149 (baseline 12,32737) serta
memangkas tingkat kegagalan rekonstruksi (invalidity rate) secara drastis menjadi
10,89% (dari baseline 46,57%). Kesimpulannya, pemisahan representasi melalui
DualSeq yang dipadukan dengan arsitektur dual-decoder dan mekanisme coupled
attention terbukti sangat efektif memangkas beban komputasi sekuens,
memperkuat koordinasi antara perintah dan parameter geometris, serta
menghasilkan rekonstruksi model 3D CAD parametrik yang akurat dan valid dari
deskripsi bahasa alami.
Perpustakaan Digital ITB