digilib@itb.ac.id +62 812 2508 8800

ABSTRAK Alif Amirudin
PUBLIC Open In Flipbook Esha Mustika Dewi

Pembangkitan model Computer-Aided Design (CAD) parametrik 3D secara otomatis dari instruksi bahasa alami (Text-to-CAD, disingkat Text2CAD) berpotensi meningkatkan efisiensi dan produktivitas perancangan teknik secara signifikan. Namun, penelitian-penelitian terdahulu masih menghadapi kendala utama pada efisiensi representasi dan kapasitas pemodelan sekuens. Representasi satu aliran, CADSequence, saat ini banyak digunakan oleh penelitian-penelitian seperti model Text2CAD dan CADFusion. Representasi ini menggabungkan token perintah (command) dan parameter numerik (arguments) ke dalam satu deret sekuens linear yang sangat panjang sehingga membebani sumber daya komputasi. Selain itu, penggabungan kedua jenis informasi heterogen tersebut dalam satu jalur generasi menyulitkan model karena perlu menangkap relasi perintah dan dependensi spasial parameter secara simultan. Oleh karena itu, penelitian ini bertujuan untuk merancang representasi data alternatif serta arsitektur model pembangkit sekuens CAD yang mampu menyelaraskan prediksi tipe perintah dan parameter guna meningkatkan ketepatan struktural serta validitas geometris model CAD hasil prediksi. Sebagai solusi, penelitian ini mengusulkan representasi dua aliran DualSeq dan arsitektur model pembangkit berbasis Encoder–Dual-Decoder. Representasi DualSeq memisahkan sekuens perintah dan parameter numerik ke dalam dua aliran keluaran yang berbeda secara deterministik. Pada arsitektur model, pretrained encoder berbasis BERT yang dilengkapi modul Adaptive Layer digunakan untuk memetakan pemahaman semantik teks deskripsi ke ruang laten domain CAD. Representasi laten tersebut kemudian diteruskan ke dua decoder independen (command decoder dan argument decoder) yang saling dihubungkan melalui mekanisme interaksi silang coupled attention. Mekanisme ini memungkinkan pertukaran konteks laten antarcabang sebelum distribusi token akhir dibangkitkan. Pelatihan model dilakukan secara supervised fine-tuning (SFT) menggunakan skema teacher forcing dengan fungsi objektif gabungan Cross-Entropy Loss untuk perintah dan argumen diskrit. Hasil eksperimen pada korpus Text2CAD membuktikan bahwa representasi DualSeq berhasil mereduksi rata-rata panjang sekuens token sebesar 64,7% (rasio kompresi rata-rata 0,362) dibandingkan representasi satu aliran CADSequence. Model usulan berbasis dual-decoder dengan coupled attention berhasil mencapai kinerja terbaik dengan skor kesesuaian struktural T2C-F1 sebesar 0,9413 pada data validasi dan 0,9412 pada data uji, melampaui baseline Text2CAD secara signifikan (0,6873 pada validasi dan 0,6855 pada uji). Model usulan ini juga menghasilkan peningkatan pada akurasi perintah (CMD-F1 uji mencapai 0,4398 dibandingkan baseline 0,3371) serta parameter numerik (ARG-F1 uji mencapai 0,6823 dibandingkan baseline 0,1799). Pada evaluasi bentuk 3D, model usulan berhasil menekan median chamfer distance (CD) hingga 0,00149 (baseline 12,32737) serta memangkas tingkat kegagalan rekonstruksi (invalidity rate) secara drastis menjadi 10,89% (dari baseline 46,57%). Kesimpulannya, pemisahan representasi melalui DualSeq yang dipadukan dengan arsitektur dual-decoder dan mekanisme coupled attention terbukti sangat efektif memangkas beban komputasi sekuens, memperkuat koordinasi antara perintah dan parameter geometris, serta menghasilkan rekonstruksi model 3D CAD parametrik yang akurat dan valid dari deskripsi bahasa alami.