Ketimpangan utilisasi SPKLU bersifat persisten dan didominasi oleh distribusi antarstasiun yang berdekatan dan setara secara infrastruktur, mengindikasikan perilaku pengguna sebagai penyebab utama. Pendekatan rekomendasi pada literatur memperlakukan kepatuhan pengguna sebagai konstanta statis, padahal kepercayaan yang menentukan penerimaan rekomendasi berkembang dari akumulasi pengalaman. Sistem yang mengabaikannya secara aktif merusak kondisi yang dibutuhkan untuk mewujudkan pemerataan. Penelitian ini mengembangkan P-MASTER, agen rekomendasi berbasis agen reinforcement learning yang memodelkan keputusan pengguna sebagai campuran preferensi personal dan rekomendasi sistem yang dimediasi oleh kepercayaan dinamis, diintegrasikan dengan mekanisme atensi antar-stasiun dan dilatih menggunakan Proximal Policy Optimization dengan penyeimbang reward majemuk berbasis Gap-Ratio. Hasil menunjukkan ketiga tujuan kinerja tercapai relatif terhadap MASTER: koefisien Gini utilisasi berkurang 0,99% (0,0299 menja di 0,0200), probabilitas penerimaan rekomendasi naik dari 0,6686 menjadi 0,7188, dan laju erosi kepercayaan melambat hampir dua kali lipat, dengan kontribusi kedua mekanisme bersifat komplementer non-aditif yang dikonfirmasi melalui rancangan faktorial 2×2 dan analisis dekomposisi kepatuhan
Perpustakaan Digital ITB