Di Indonesia, regulator mengawasi sekitar 250 Penyedia Jasa Pembayaran (PJP)
berizin yang tergabung dalam Asosiasi Sistem Pembayaran Indonesia.
Berdasarkan hasil evaluasi bersama Financial Action Task Force (FATF) pada
2023, fungsi pengawasan tersebut ditangani oleh pegawai yang terbatas
jumlahnya. Pada saat yang sama, volume transfer dana secara daring telah
meningkat hingga empat belas kali lipat sejak 2022. Kondisi ini menempatkan
regulator pada persoalan yang juga dihadapi banyak otoritas pengawas di
berbagai negara: kemampuan pengawasan selalu terbatas, sehingga tidak
mungkin seluruh perusahaan yang berada di bawah kewenangannya dipantau
secara terus-menerus. PBI No. 10 Tahun 2025 merespons tantangan tersebut
dengan memperkenalkan tahapan sanksi yang berjenjang serta pengelompokan
PJP berdasarkan tingkat risiko. Penelitian ini bertujuan mencari kombinasi yang
paling tepat dari tiga instrumen pengawasan, yaitu proporsi pemeriksaan (proporsi
PJP yang diperiksa pada setiap siklus), insentif atas kepatuhan, dan sanksi atas
pelanggaran, dalam kondisi kapasitas pengawasan yang terbatas serta
karakteristik PJP yang beragam dan semakin cermat merespons kebijakan
pengawasan.
Penelitian ini menggunakan simulasi berbasis agen yang disesuaikan dengan
populasi 250 PJP sebagaimana yang diawasi oleh Bank Indonesia. Setiap PJP
dapat memilih satu dari empat tindakan, mulai dari patuh sepenuhnya hingga
melakukan pelanggaran secara sengaja. Interaksi antara PJP dan pengawas
berlangsung dalam siklus berulang dengan pemeriksaan secara acak, peningkatan
intensitas pengawasan terhadap pelanggar yang terdeteksi, serta kecenderungan
munculnya perilaku moral hazard pada PJP yang tidak terpantau.
Dengan menggunakan struktur dasar yang sama, penelitian ini membangun lima
skenario model secara bertahap dan terkendali. Skenario pertama hanya
menggunakan pengawasan (W). Skenario kedua menggabungkan pengawasan
dengan insentif kepatuhan yang proporsional (W-I). Skenario ketiga menggabungkan pengawasan dengan sanksi pelanggaran yang proporsional (W-
P). Skenario keempat menggunakan insentif dan sanksi secara bersamaan (W-IP).
Sementara itu, skenario terakhir (W-IP RL) tetap menggunakan kedua instrumen
tersebut, tetapi mengganti mekanisme pembelajaran reaktif dengan Q-learning
yang mempertimbangkan konsekuensi jangka panjang. Dalam skenario ini, PJP
memperkirakan manfaat jangka panjang dari kepatuhan, kemudian menentukan
tindakannya berdasarkan perkiraan tersebut. Desain model seperti ini
memungkinkan setiap perbedaan hasil ditelusuri pada satu komponen kebijakan
tertentu.
Penelitian ini menghasilkan tiga temuan utama. Pertama, pengawasan tanpa
instrumen tambahan ternyata mampu meningkatkan kepatuhan, yaitu dari 51
persen pada proporsi pemeriksaan terendah (q=0.30) hingga 87 persen pada
tingkat tertinggi (q=0.9). Namun, tambahan manfaat dari peningkatan proporsi
pemeriksaan semakin mengecil. Dengan kata lain, tambahan kapasitas
pemeriksaan memberikan dampak terbesar ketika kemampuan pengawasan masih
sangat terbatas. Kedua, ketika insentif dan sanksi diberi nilai maksimum yang
sama, pemberian insentif selalu lebih efektif daripada pemberian sanksi di seluruh
jenjang proporsi pemeriksaan. Setelah insentif diterapkan, penambahan sanksi
hampir tidak efektif. Temuan bahwa insentif lebih efektif daripada hukuman ini
berkaitan dengan mekanisme loss aversion dan berbeda dari pandangan klasik
teori deterrence, yang beranggapan bahwa sanksi yang cukup besar akan
menjamin kepatuhan. Ketiga, PJP yang belajar secara strategis mencapai tingkat
kepatuhan sekitar 97 persen pada seluruh tingkat cakupan pemeriksaan yang diuji.
Hasil ini memutus hubungan antara tingkat kepatuhan dan proporsi pengawasan
yang masih terlihat dalam skenario pembelajaran reaktif. Uji ketahanan
menunjukkan bahwa tingkat kepatuhan tersebut lebih dipengaruhi oleh arah
struktur imbal hasil daripada besar kecilnya nilai imbal hasil. Dengan demikian,
angka 97 persen lebih tepat dipahami sebagai indikasi arah dampak kebijakan.
Bagi otoritas yang menjalankan PBI No. 10 Tahun 2025, implikasi kebijakannya
adalah: ketika kemampuan pengawasan terbatas, desain struktur insentif—
terutama dengan menjadikan kepatuhan sebagai pilihan yang lebih
menguntungkan bagi PJP—lebih efektif daripada sekadar meningkatkan intensitas
pemeriksaan atau memperbesar sanksi. Kemampuan PJP untuk beradaptasi secara
strategis dapat mengurangi kebutuhan untuk meningkatkan proporsi PJP yang
diperiksa. Namun, proses adaptasi tersebut memerlukan waktu. Oleh karena itu,
tingkat kepatuhan pada tahap awal penerapan regulasi baru sebaiknya dinilai
berdasarkan proses pembelajarannya. Studi ini unik karena membandingkan
pembelajaran reaktif dan strategis dalam satu kerangka model.
Kata kunci: kepatuhan regulasi; penyedia jasa pembayaran; insentif kepatuhan;
pemodelan berbasis agen; pembelajaran penguatan; Indonesia.
Perpustakaan Digital ITB