digilib@itb.ac.id +62 812 2508 8800

ABSTRAK Iqbal Najmul Achyar
PUBLIC Open In Flipbook Esha Mustika Dewi

Kendaraan otonom adalah kendaraan yang mampu melaksanakan sebagian atau seluruh tugas mengemudi, yang menurut standar SAE J3016 diklasifikasikan ke dalam enam tingkatan berdasarkan pembagian tanggung jawab antara pengemudi dan sistem. Mulai Level 3, tanggung jawab pemantauan lingkungan berpindah kepada sistem sehingga kegagalan persepsi tidak lagi memiliki lapisan koreksi manusia secara langsung. Penelitian ini mengambil konteks Level 3 dan Level 4, yaitu tingkatan tempat akurasi persepsi memiliki implikasi keselamatan langsung namun penerapannya masih realistis. Sistem kendaraan otonom umumnya dibangun secara modular melalui empat tahap berurutan, yaitu penginderaan, persepsi, perencanaan, dan penggerakan. Di antara komponen tahap persepsi, deteksi objek tiga dimensi menempati posisi menentukan karena menghasilkan representasi geometris yang menjadi dasar seluruh keputusan di hilirnya, dan pada praktik mutakhir diselesaikan melalui pendekatan pembelajaran mendalam. Kesalahan pada tahap ini merambat ke perencanaan lintasan dan pengendalian serta tidak dapat dikoreksi oleh modul di hilirnya. Sistem persepsi kendaraan otonom bergantung pada deteksi objek tiga dimensi, karena kesalahan pada tahap ini dapat merambat ke proses perencanaan dan pengendalian. Kamera dan LiDAR memiliki keunggulan dan keterbatasan yang saling melengkapi, sehingga penggabungan keduanya menjadi pendekatan yang umum digunakan. BEVFusion merupakan salah satu arsitektur yang memproyeksikan fitur kedua modalitas ke ruang tampak atas bersama (Bird’s-Eye View/BEV), sehingga informasi semantik kamera dan struktur geometris LiDAR dapat dimanfaatkan secara bersamaan. Namun, BEVFusion masih memiliki dua keterbatasan. Pertama, modul pengekstraksi fitur citra membangun konteks secara bertahap melalui kedalaman jaringan, sehingga cakupan efektifnya tumbuh lebih lambat daripada batas teoretis dan membatasi kekayaan informasi fitur citra serta akurasi estimasi kedalaman. Kedua, lapisan fusi menggabungkan kedua modalitas menggunakan kernel konvolusi yang seragam pada seluruh posisi spasial, padahal keandalan kamera dan LiDAR bervariasi antar-lokasi. Kerapatan titik LiDAR menurun terhadap kuadrat jarak, sedangkan ketidakpastian fitur kamera dipengaruhi distribusi kedalaman, sehingga bobot seragam tidak mampu menyesuaikan kondisi lokal. Penelitian ini bertujuan meningkatkan akurasi deteksi objek tiga dimensi dengan tetap mempertahankan kinerja waktu nyata. Penelitian dilakukan melalui dua modifikasi arsitektur yang diuji secara terpisah pada model dasar yang sama. Modifikasi pertama mengganti pengekstraksi fitur citra dengan arsitektur berbasis State Space Model yang mampu menangkap konteks ruang secara lebih luas dengan kompleksitas komputasi yang tetap efisien. Modifikasi kedua mengembangkan modul fusi berbasis gerbang yang menyesuaikan kontribusi kamera dan LiDAR berdasarkan keandalan masing-masing pada setiap lokasi. Kedua modifikasi dirancang dengan batas penurunan throughput inferensi tidak lebih dari lima persen agar peningkatan akurasi tetap sesuai dengan kebutuhan penerapan waktu nyata. Penelitian ini menggunakan pendekatan eksperimental dengan kondisi pengujian berbagai macam skenario Ketiga varian dilatih dan diuji menggunakan konfigurasi yang sama untuk memastikan perbandingan yang adil. Evaluasi dilakukan pada data validasi nuScenes menggunakan metrik deteksi standar, analisis kesalahan, kinerja tiap kategori objek, throughput inferensi, dan latensi setiap komponen. Pengujian tambahan dilakukan dengan menonaktifkan seluruh kamera untuk mengetahui ketahanan model ketika hanya mengandalkan LiDAR. Hasil penelitian menunjukkan bahwa kedua modifikasi berhasil meningkatkan akurasi deteksi dan memenuhi batas efisiensi yang ditetapkan. Penggantian pengekstraksi fitur citra meningkatkan NDS sebesar 0,60 poin dan mAP sebesar 1,35 poin, sedangkan modifikasi modul fusi meningkatkan keduanya sebesar 0,35 dan 0,59 poin. Peningkatan terutama terlihat pada objek yang berukuran kecil atau memiliki sedikit titik LiDAR. Penurunan throughput masing-masing hanya 1,87% dan 1,36%. Ketika seluruh kamera dinonaktifkan, varian dengan pengekstraksi fitur citra mengalami penurunan kinerja paling besar, sedangkan varian dengan modul fusi berbasis keandalan tetap memberikan hasil terbaik. Hasil ini menunjukkan bahwa kedua modifikasi memberikan karakter peningkatan yang berbeda dan modul fusi berbasis keandalan lebih tahan terhadap hilangnya informasi kamera. Kebaruan penelitian ini terletak pada penerapan State Space Model sebagai pengekstraksi fitur citra pada arsitektur fusi berbasis BEV serta pengembangan modul fusi yang mempertimbangkan keandalan kamera dan LiDAR secara lokal dengan biaya komputasi rendah. Pengujian kedua modifikasi secara terpisah juga memberikan bukti empiris mengenai karakter peningkatan masing-masing, yang sulit diamati ketika beberapa perubahan arsitektur diterapkan secara bersamaan. Penelitian ini memberikan kontribusi berupa bukti bahwa peningkatan akurasi dan ketahanan terhadap gangguan modalitas dapat dicapai melalui mekanisme fusi yang sederhana dan efisien tanpa mengorbankan kinerja waktu nyata.