digilib@itb.ac.id +62 812 2508 8800

ABSTRAK Handoko Supeno
PUBLIC Open In Flipbook Esha Mustika Dewi

Perkembangan kendaraan otonom menuntut sistem pengambilan keputusan yang mampu beroperasi secara aman dan andal pada lingkungan perkotaan yang dinamis. Pendekatan End-to-End Deep Reinforcement Learning (E2E DRL) menawarkan kemampuan untuk mempelajari kebijakan mengemudi secara langsung dari data sensor tanpa memerlukan perancangan aturan maupun pelabelan data secara manual. Meskipun demikian, pendekatan ini masih menghadapi berbagai tantangan, antara lain proses pelatihan yang rentan terjadinya kolaps performa, keterbatasan dalam memodelkan dinamika temporal, serta rendahnya kemampuan generalisasi pada lingkungan yang belum pernah ditemui sebelumnya. Disertasi ini memfokuskan penelitian pada pengembangan strategi End-to-End Deep Reinforcement Learning untuk meningkatkan performa pelatihan, representasi temporal, pemodelan ketidakpastian, dan kemampuan generalisasi kendaraan otonom. Penelitian dilaksanakan secara bertahap melalui tiga tahapan yang saling berkesinambungan. Pada Tahap Penelitian 1, dikembangkan arsitektur Deep Imitation Learning berbasis jaringan saraf konvolusional yang mengintegrasikan modul persepsi, pengolahan citra, dan kontrol kendaraan sebagai fondasi sistem pengemudian otonom berbasis kamera. Hasil penelitian menunjukkan bahwa agen yang dikembangkan mampu melakukan berbagai manuver mengemudi pada lingkungan perkotaan yang dinamis. Namun, hasil tersebut juga menunjukkan adanya keterbatasan pada pendekatan feedforward dalam mempertahankan kinerja ketika menghadapi kondisi lingkungan yang kompleks dan lingkungan yang belum pernah ditemui sebelumnya. Berdasarkan temuan tersebut, Tahap Penelitian 2 mengembangkan arsitektur Quantile Regression Deep Q-Network yang dipadukan dengan Liquid Time-Constant Neural Network (QRDQN-LTC). Integrasi Distributional Reinforcement Learning dan Continuous-Time Neural Networks memungkinkan agen memodelkan distribusi return sekaligus mempertahankan informasi temporal pada lingkungan perkotaaan yang dinamis. Hasil eksperimen pada simulator CARLA menunjukkan bahwa QRDQN-LTC juga dapat mencegah kolaps performa serta menghasilkan kemampuan generalisasi yang lebih baik dibandingkan DQN, QRDQN, dan DQN-LTC pada lingkungan yang belum pernah diamati sebelumnya. Selanjutnya, Tahap Penelitian 3 mengembangkan metode Implicit Quantile Network yang dikombinasikan dengan Closed-form Continuous-time Neural Network (IQN-CfC) sebagai penyempurnaan metodologis dari penelitian sebelumnya. Penggunaan implicit quantile representation memungkinkan pemodelan distribusi return yang lebih fleksibel, sedangkan CfC menyediakan representasi dinamika temporal yang lebih efisien melalui formulasi closed-form continuous-time. Evaluasi pada berbagai skenario lalu lintas di simulator CARLA menunjukkan bahwa metode yang diusulkan memperoleh collision rate terendah sebesar 10%, success rate tertinggi sebesar 85%, dan lane deviation terendah sebesar 0,37 m, sehingga mengungguli pendekatan imitation learning maupun reinforcement learning konvensional. Kebaruan penelitian ini terletak pada pengembangan strategi End-to-End Deep Reinforcement Learning yang mengintegrasikan pembelajaran distribusional dengan representasi temporal berbasis Continuous-Time Neural Networks secara bertahap, mulai dari QRDQN-LTC hingga IQN-CfC, untuk mencegah kolaps performa pelatihan dan kemampuan generalisasi kendaraan otonom. Kontribusi ilmiah penelitian ini mencakup pengembangan arsitektur pembelajaran yang lebih adaptif terhadap ketidakpastian dan dinamika lingkungan, serta metodologi pelatihan yang menghasilkan performa pengemudian lebih aman dan mampu beroperasi pada lingkungan baru tanpa pelatihan ulang secara ekstensif. Temuan penelitian ini diharapkan dapat memberikan kontribusi terhadap pengembangan sistem pengambilan keputusan kendaraan otonom berbasis End-to-End Deep Reinforcement Learning generasi berikutnya.