digilib@itb.ac.id +62 812 2508 8800

ABSTRAK A Sumarudin
PUBLIC Open In Flipbook Esha Mustika Dewi

Reinforcement Learning (RL) merupakan metode machine learning yang mempelajari strategi pengambilan keputusan melalui mekanisme penguatan, yaitu agen memperoleh umpan balik berupa reward dari setiap aksi yang dilakukan. Proses pengambilan keputusan pada RL bersifat berurutan dan dimodelkan menggunakan Markov Decision Process (MDP). Implementasi RL umumnya memerlukan komputasi yang kompleks serta kapasitas memori yang besar akibat tingginya jumlah iterasi berdasarkan kondisi (state) lingkungan. Kondisi tersebut menyebabkan kebutuhan sumber daya dan konsumsi daya yang signifikan pada platform berbasis CPU maupun GPU sehingga menjadi kendala pada penerapan pada sistem edge computing yang memiliki keterbatasan sumber daya. Penelitian ini mengusulkan arsitektur akselerator RL berbasis Deep Q-Network (DQN) yang dioptimalkan untuk proses pelatihan (training) dan inferensi (inference) pada sistem embedded. Arsitektur yang dikembangkan menerapkan pendekatan hardware resource sharing dengan satu PE untuk meningkatkan efisiensi pemanfaatan sumber daya hardware. Fungsi aktivasi sigmoid diaproksimasi menggunakan metode piecewise linear (PWL) dengan 48 titik sehingga menghasilkan tingkat galat yang rendah tanpa mengurangi akurasi komputasi pada proses inferensi maupun pelatihan. Selain itu, arsitektur menerapkan komputasi paralel antara Q-network dan target network untuk meningkatkan kinerja proses pelatihan. Penggunaan policy generator dan on-chip memory juga dioptimalkan melalui representasi setiap elemen experience replay dalam format 8 bit sehingga satu pasangan experince replay, yaitu (????????, ????????, ????????????????, ????????) dapat disimpan dalam satu alamat BRAM berukuran 32 bit. Proses pengambilan sampel experience replay dan pemilihan aksi pada policy generator menggunakan pseudo-random number generator (PRNG) berbasis XORShift 32 bit. Hasil implementasi menunjukkan bahwa arsitektur yang diusulkan hanya memerlukan konsumsi daya 8 mW. Akselerator mencapai peningkatan kinerja 671 kali pada proses inferensi dan 287 kali pada proses pelatihan dibandingkan implementasi berbasis perangkat lunak apabila latensi komunikasi AXI dan PYNQ tidak diperhitungkan. Dengan mempertimbangkan latensi komunikasi tersebut, percepatan yang diperoleh menjadi 1,2 kali dibandingkan prosesor Intel Core I7 dan 1,3 kali dibandingkan prosesor ARM Cortex-A53, serta konsumsi daya yang lebih rendah pada platform FPGA Ultra96. Efisiensi area yang dicapai masing-masing ii sebesar 44,25 KIPS/1KLUTs dan 14,64 KIPS/1KLUTs untuk inferensi dan pelatihan. Pengembangan arsitektur paralel antara Q-network dan target network meningkatkan kinerja pelatihan hingga mencapai 231,79 KIPS atau 1,3 kali lebih tinggi dibandingkan arsitektur resource sharing yang melakukan komputasi kedua neural network secara berurutan. Arsitektur tersebut menghasilkan efisiensi area sebesar 31,76 KIPS/1KLUT untuk inferensi dan 10,02 KIPS/1KLUT untuk pelatihan, serta efisiensi energi masing-masing sebesar 14,58 MIPS/W dan 4,812 MIPS/W. Peningkatan kinerja tersebut diperoleh dengan konsekuensi penambahan penggunaan LUT sebesar 7.219 dan konsumsi daya SoC sebesar 88 mW pada platform FPGA Ultra96. Dibandingkan implementasi berbasis software pada prosesor Intel Core i9, akselerator yang diusulkan memberikan percepatan komputasi sebesar 2,67 kali pada inferensi dan 4,01 kali pada pelatihan. Sementara itu, dibandingkan prosesor ARM v8.2, akselerator memberikan percepatan masingmasing sebesar 40,59 kali untuk inferensi dan 76,91 kali untuk pelatihan. Seluruh pengukuran kinerja akselerator tersebut dilakukan tanpa memperhitungkan latensi komunikasi AXI dan PYNQ. Secara keseluruhan, arsitektur yang diusulkan mampu meningkatkan kinerja komputasi sekaligus efisiensi sumber daya dan energi secara signifikan. Selain itu, arsitektur menyediakan fleksibilitas konfigurasi mode inferensi dan pelatihan melalui Processing System (PS), sehingga dapat dikembangkan lebih lanjut untuk mendukung neural Network dengan jumlah layer yang lebih besar dan permasalahan yang lebih kompleks. Dengan karakteristik tersebut, arsitektur yang diusulkan berpotensi diterapkan pada berbagai agen cerdas di lingkungan nyata, seperti sistem robotika dan sistem otonom.