digilib@itb.ac.id +62 812 2508 8800

Di Indonesia, regulator mengawasi sekitar 250 Penyedia Jasa Pembayaran (PJP) berizin yang tergabung dalam Asosiasi Sistem Pembayaran Indonesia. Berdasarkan hasil evaluasi bersama Financial Action Task Force (FATF) pada 2023, fungsi pengawasan tersebut ditangani oleh pegawai yang terbatas jumlahnya. Pada saat yang sama, volume transfer dana secara daring telah meningkat hingga empat belas kali lipat sejak 2022. Kondisi ini menempatkan regulator pada persoalan yang juga dihadapi banyak otoritas pengawas di berbagai negara: kemampuan pengawasan selalu terbatas, sehingga tidak mungkin seluruh perusahaan yang berada di bawah kewenangannya dipantau secara terus-menerus. PBI No. 10 Tahun 2025 merespons tantangan tersebut dengan memperkenalkan tahapan sanksi yang berjenjang serta pengelompokan PJP berdasarkan tingkat risiko. Penelitian ini bertujuan mencari kombinasi yang paling tepat dari tiga instrumen pengawasan, yaitu proporsi pemeriksaan (proporsi PJP yang diperiksa pada setiap siklus), insentif atas kepatuhan, dan sanksi atas pelanggaran, dalam kondisi kapasitas pengawasan yang terbatas serta karakteristik PJP yang beragam dan semakin cermat merespons kebijakan pengawasan. Penelitian ini menggunakan simulasi berbasis agen yang disesuaikan dengan populasi 250 PJP sebagaimana yang diawasi oleh Bank Indonesia. Setiap PJP dapat memilih satu dari empat tindakan, mulai dari patuh sepenuhnya hingga melakukan pelanggaran secara sengaja. Interaksi antara PJP dan pengawas berlangsung dalam siklus berulang dengan pemeriksaan secara acak, peningkatan intensitas pengawasan terhadap pelanggar yang terdeteksi, serta kecenderungan munculnya perilaku moral hazard pada PJP yang tidak terpantau. Dengan menggunakan struktur dasar yang sama, penelitian ini membangun lima skenario model secara bertahap dan terkendali. Skenario pertama hanya menggunakan pengawasan (W). Skenario kedua menggabungkan pengawasan dengan insentif kepatuhan yang proporsional (W-I). Skenario ketiga menggabungkan pengawasan dengan sanksi pelanggaran yang proporsional (W- P). Skenario keempat menggunakan insentif dan sanksi secara bersamaan (W-IP). Sementara itu, skenario terakhir (W-IP RL) tetap menggunakan kedua instrumen tersebut, tetapi mengganti mekanisme pembelajaran reaktif dengan Q-learning yang mempertimbangkan konsekuensi jangka panjang. Dalam skenario ini, PJP memperkirakan manfaat jangka panjang dari kepatuhan, kemudian menentukan tindakannya berdasarkan perkiraan tersebut. Desain model seperti ini memungkinkan setiap perbedaan hasil ditelusuri pada satu komponen kebijakan tertentu. Penelitian ini menghasilkan tiga temuan utama. Pertama, pengawasan tanpa instrumen tambahan ternyata mampu meningkatkan kepatuhan, yaitu dari 51 persen pada proporsi pemeriksaan terendah (q=0.30) hingga 87 persen pada tingkat tertinggi (q=0.9). Namun, tambahan manfaat dari peningkatan proporsi pemeriksaan semakin mengecil. Dengan kata lain, tambahan kapasitas pemeriksaan memberikan dampak terbesar ketika kemampuan pengawasan masih sangat terbatas. Kedua, ketika insentif dan sanksi diberi nilai maksimum yang sama, pemberian insentif selalu lebih efektif daripada pemberian sanksi di seluruh jenjang proporsi pemeriksaan. Setelah insentif diterapkan, penambahan sanksi hampir tidak efektif. Temuan bahwa insentif lebih efektif daripada hukuman ini berkaitan dengan mekanisme loss aversion dan berbeda dari pandangan klasik teori deterrence, yang beranggapan bahwa sanksi yang cukup besar akan menjamin kepatuhan. Ketiga, PJP yang belajar secara strategis mencapai tingkat kepatuhan sekitar 97 persen pada seluruh tingkat cakupan pemeriksaan yang diuji. Hasil ini memutus hubungan antara tingkat kepatuhan dan proporsi pengawasan yang masih terlihat dalam skenario pembelajaran reaktif. Uji ketahanan menunjukkan bahwa tingkat kepatuhan tersebut lebih dipengaruhi oleh arah struktur imbal hasil daripada besar kecilnya nilai imbal hasil. Dengan demikian, angka 97 persen lebih tepat dipahami sebagai indikasi arah dampak kebijakan. Bagi otoritas yang menjalankan PBI No. 10 Tahun 2025, implikasi kebijakannya adalah: ketika kemampuan pengawasan terbatas, desain struktur insentif— terutama dengan menjadikan kepatuhan sebagai pilihan yang lebih menguntungkan bagi PJP—lebih efektif daripada sekadar meningkatkan intensitas pemeriksaan atau memperbesar sanksi. Kemampuan PJP untuk beradaptasi secara strategis dapat mengurangi kebutuhan untuk meningkatkan proporsi PJP yang diperiksa. Namun, proses adaptasi tersebut memerlukan waktu. Oleh karena itu, tingkat kepatuhan pada tahap awal penerapan regulasi baru sebaiknya dinilai berdasarkan proses pembelajarannya. Studi ini unik karena membandingkan pembelajaran reaktif dan strategis dalam satu kerangka model. Kata kunci: kepatuhan regulasi; penyedia jasa pembayaran; insentif kepatuhan; pemodelan berbasis agen; pembelajaran penguatan; Indonesia.