Reinforcement Learning (RL) merupakan metode machine learning yang
mempelajari strategi pengambilan keputusan melalui mekanisme penguatan, yaitu
agen memperoleh umpan balik berupa reward dari setiap aksi yang dilakukan.
Proses pengambilan keputusan pada RL bersifat berurutan dan dimodelkan
menggunakan Markov Decision Process (MDP). Implementasi RL umumnya
memerlukan komputasi yang kompleks serta kapasitas memori yang besar akibat
tingginya jumlah iterasi berdasarkan kondisi (state) lingkungan. Kondisi tersebut
menyebabkan kebutuhan sumber daya dan konsumsi daya yang signifikan pada
platform berbasis CPU maupun GPU sehingga menjadi kendala pada penerapan
pada sistem edge computing yang memiliki keterbatasan sumber daya.
Penelitian ini mengusulkan arsitektur akselerator RL berbasis Deep Q-Network
(DQN) yang dioptimalkan untuk proses pelatihan (training) dan inferensi
(inference) pada sistem embedded. Arsitektur yang dikembangkan menerapkan
pendekatan hardware resource sharing dengan satu PE untuk meningkatkan
efisiensi pemanfaatan sumber daya hardware. Fungsi aktivasi sigmoid
diaproksimasi menggunakan metode piecewise linear (PWL) dengan 48 titik
sehingga menghasilkan tingkat galat yang rendah tanpa mengurangi akurasi
komputasi pada proses inferensi maupun pelatihan. Selain itu, arsitektur
menerapkan komputasi paralel antara Q-network dan target network untuk
meningkatkan kinerja proses pelatihan. Penggunaan policy generator dan on-chip
memory juga dioptimalkan melalui representasi setiap elemen experience replay
dalam format 8 bit sehingga satu pasangan experince replay, yaitu (????????, ????????, ????????????????,
????????) dapat disimpan dalam satu alamat BRAM berukuran 32 bit. Proses pengambilan
sampel experience replay dan pemilihan aksi pada policy generator menggunakan
pseudo-random number generator (PRNG) berbasis XORShift 32 bit.
Hasil implementasi menunjukkan bahwa arsitektur yang diusulkan hanya
memerlukan konsumsi daya 8 mW. Akselerator mencapai peningkatan kinerja 671
kali pada proses inferensi dan 287 kali pada proses pelatihan dibandingkan
implementasi berbasis perangkat lunak apabila latensi komunikasi AXI dan PYNQ
tidak diperhitungkan. Dengan mempertimbangkan latensi komunikasi tersebut,
percepatan yang diperoleh menjadi 1,2 kali dibandingkan prosesor Intel Core I7 dan
1,3 kali dibandingkan prosesor ARM Cortex-A53, serta konsumsi daya yang lebih
rendah pada platform FPGA Ultra96. Efisiensi area yang dicapai masing-masing
ii
sebesar 44,25 KIPS/1KLUTs dan 14,64 KIPS/1KLUTs untuk inferensi dan
pelatihan.
Pengembangan arsitektur paralel antara Q-network dan target network
meningkatkan kinerja pelatihan hingga mencapai 231,79 KIPS atau 1,3 kali lebih
tinggi dibandingkan arsitektur resource sharing yang melakukan komputasi kedua
neural network secara berurutan. Arsitektur tersebut menghasilkan efisiensi area
sebesar 31,76 KIPS/1KLUT untuk inferensi dan 10,02 KIPS/1KLUT untuk
pelatihan, serta efisiensi energi masing-masing sebesar 14,58 MIPS/W dan 4,812
MIPS/W. Peningkatan kinerja tersebut diperoleh dengan konsekuensi penambahan
penggunaan LUT sebesar 7.219 dan konsumsi daya SoC sebesar 88 mW pada
platform FPGA Ultra96. Dibandingkan implementasi berbasis software pada
prosesor Intel Core i9, akselerator yang diusulkan memberikan percepatan
komputasi sebesar 2,67 kali pada inferensi dan 4,01 kali pada pelatihan. Sementara
itu, dibandingkan prosesor ARM v8.2, akselerator memberikan percepatan masingmasing
sebesar 40,59 kali untuk inferensi dan 76,91 kali untuk pelatihan. Seluruh
pengukuran kinerja akselerator tersebut dilakukan tanpa memperhitungkan latensi
komunikasi AXI dan PYNQ.
Secara keseluruhan, arsitektur yang diusulkan mampu meningkatkan kinerja
komputasi sekaligus efisiensi sumber daya dan energi secara signifikan. Selain itu,
arsitektur menyediakan fleksibilitas konfigurasi mode inferensi dan pelatihan
melalui Processing System (PS), sehingga dapat dikembangkan lebih lanjut untuk
mendukung neural Network dengan jumlah layer yang lebih besar dan
permasalahan yang lebih kompleks. Dengan karakteristik tersebut, arsitektur yang
diusulkan berpotensi diterapkan pada berbagai agen cerdas di lingkungan nyata,
seperti sistem robotika dan sistem otonom.
Perpustakaan Digital ITB