Kendaraan otonom adalah kendaraan yang mampu melaksanakan sebagian atau
seluruh tugas mengemudi, yang menurut standar SAE J3016 diklasifikasikan ke
dalam enam tingkatan berdasarkan pembagian tanggung jawab antara pengemudi
dan sistem. Mulai Level 3, tanggung jawab pemantauan lingkungan berpindah
kepada sistem sehingga kegagalan persepsi tidak lagi memiliki lapisan koreksi
manusia secara langsung. Penelitian ini mengambil konteks Level 3 dan Level 4,
yaitu tingkatan tempat akurasi persepsi memiliki implikasi keselamatan langsung
namun penerapannya masih realistis. Sistem kendaraan otonom umumnya
dibangun secara modular melalui empat tahap berurutan, yaitu penginderaan,
persepsi, perencanaan, dan penggerakan. Di antara komponen tahap persepsi,
deteksi objek tiga dimensi menempati posisi menentukan karena menghasilkan
representasi geometris yang menjadi dasar seluruh keputusan di hilirnya, dan pada
praktik mutakhir diselesaikan melalui pendekatan pembelajaran mendalam.
Kesalahan pada tahap ini merambat ke perencanaan lintasan dan pengendalian serta
tidak dapat dikoreksi oleh modul di hilirnya.
Sistem persepsi kendaraan otonom bergantung pada deteksi objek tiga dimensi,
karena kesalahan pada tahap ini dapat merambat ke proses perencanaan dan
pengendalian. Kamera dan LiDAR memiliki keunggulan dan keterbatasan yang
saling melengkapi, sehingga penggabungan keduanya menjadi pendekatan yang
umum digunakan. BEVFusion merupakan salah satu arsitektur yang
memproyeksikan fitur kedua modalitas ke ruang tampak atas bersama (Bird’s-Eye
View/BEV), sehingga informasi semantik kamera dan struktur geometris LiDAR
dapat dimanfaatkan secara bersamaan. Namun, BEVFusion masih memiliki dua
keterbatasan. Pertama, modul pengekstraksi fitur citra membangun konteks secara
bertahap melalui kedalaman jaringan, sehingga cakupan efektifnya tumbuh lebih
lambat daripada batas teoretis dan membatasi kekayaan informasi fitur citra serta
akurasi estimasi kedalaman. Kedua, lapisan fusi menggabungkan kedua modalitas
menggunakan kernel konvolusi yang seragam pada seluruh posisi spasial, padahal
keandalan kamera dan LiDAR bervariasi antar-lokasi. Kerapatan titik LiDAR
menurun terhadap kuadrat jarak, sedangkan ketidakpastian fitur kamera
dipengaruhi distribusi kedalaman, sehingga bobot seragam tidak mampu
menyesuaikan kondisi lokal.
Penelitian ini bertujuan meningkatkan akurasi deteksi objek tiga dimensi dengan
tetap mempertahankan kinerja waktu nyata. Penelitian dilakukan melalui dua
modifikasi arsitektur yang diuji secara terpisah pada model dasar yang sama.
Modifikasi pertama mengganti pengekstraksi fitur citra dengan arsitektur berbasis
State Space Model yang mampu menangkap konteks ruang secara lebih luas dengan
kompleksitas komputasi yang tetap efisien. Modifikasi kedua mengembangkan
modul fusi berbasis gerbang yang menyesuaikan kontribusi kamera dan LiDAR
berdasarkan keandalan masing-masing pada setiap lokasi. Kedua modifikasi
dirancang dengan batas penurunan throughput inferensi tidak lebih dari lima persen
agar peningkatan akurasi tetap sesuai dengan kebutuhan penerapan waktu nyata.
Penelitian ini menggunakan pendekatan eksperimental dengan kondisi pengujian
berbagai macam skenario Ketiga varian dilatih dan diuji menggunakan konfigurasi
yang sama untuk memastikan perbandingan yang adil. Evaluasi dilakukan pada
data validasi nuScenes menggunakan metrik deteksi standar, analisis kesalahan,
kinerja tiap kategori objek, throughput inferensi, dan latensi setiap komponen.
Pengujian tambahan dilakukan dengan menonaktifkan seluruh kamera untuk
mengetahui ketahanan model ketika hanya mengandalkan LiDAR.
Hasil penelitian menunjukkan bahwa kedua modifikasi berhasil meningkatkan
akurasi deteksi dan memenuhi batas efisiensi yang ditetapkan. Penggantian
pengekstraksi fitur citra meningkatkan NDS sebesar 0,60 poin dan mAP sebesar
1,35 poin, sedangkan modifikasi modul fusi meningkatkan keduanya sebesar 0,35
dan 0,59 poin. Peningkatan terutama terlihat pada objek yang berukuran kecil atau
memiliki sedikit titik LiDAR. Penurunan throughput masing-masing hanya 1,87%
dan 1,36%. Ketika seluruh kamera dinonaktifkan, varian dengan pengekstraksi fitur
citra mengalami penurunan kinerja paling besar, sedangkan varian dengan modul
fusi berbasis keandalan tetap memberikan hasil terbaik. Hasil ini menunjukkan
bahwa kedua modifikasi memberikan karakter peningkatan yang berbeda dan
modul fusi berbasis keandalan lebih tahan terhadap hilangnya informasi kamera.
Kebaruan penelitian ini terletak pada penerapan State Space Model sebagai
pengekstraksi fitur citra pada arsitektur fusi berbasis BEV serta pengembangan
modul fusi yang mempertimbangkan keandalan kamera dan LiDAR secara lokal
dengan biaya komputasi rendah. Pengujian kedua modifikasi secara terpisah juga
memberikan bukti empiris mengenai karakter peningkatan masing-masing, yang
sulit diamati ketika beberapa perubahan arsitektur diterapkan secara bersamaan.
Penelitian ini memberikan kontribusi berupa bukti bahwa peningkatan akurasi dan
ketahanan terhadap gangguan modalitas dapat dicapai melalui mekanisme fusi yang
sederhana dan efisien tanpa mengorbankan kinerja waktu nyata.
Perpustakaan Digital ITB