Manajemen aset dan liabilitas pada institusi asuransi jiwa dan dana pensiun menghadapi
tantangan duration mismatch antara aset dan kewajiban jangka panjang, sementara
strategi imunisasi konvensional duration matching Redington bersandar pada asumsi
pergeseran paralel kurva imbal hasil yang sering tidak terpenuhi pada kondisi pasar
ekstrem. Penelitian ini mengkaji penerapan Deep Reinforcement Learning (DRL)
sebagai strategi imunisasi adaptif pada portofolio obligasi pemerintah Indonesia berbagai
tenor, dengan membandingkan algoritma Proximal Policy Optimization (PPO) dan Soft
Actor-Critic (SAC) terhadap tiga strategi baseline: imunisasi Redington, Buy-and-Hold,
dan Equal Weight. Lingkungan simulasi dirancang berbasis kerangka Gymnasium
dengan fungsi reward yang mengintegrasikan surplus return, penalti duration mismatch
kuadratik, insentif funding ratio, dan biaya transaksi; model Long Short-Term Memory
(LSTM) dikembangkan sebagai penyedia informasi pasar bagi agen dan mencapai
RMSE 0,2314 persen poin serta MAPE 2,79%; liabilitas dimodelkan sebagai arus kas
deterministik. Kedua agen dievaluasi pada lima skenario pasar—normal, kenaikan
suku bunga (+100 bps), penurunan suku bunga (?100 bps), lonjakan liabilitas (+20%),
dan krisis gabungan. Hasil eksperimen menunjukkan SAC unggul secara signifikan
atas seluruh strategi lain (Cohen’s d = 0,605–1,700; p < 0,001, uji Mann-Whitney U
lintas episode evaluasi) sekaligus menjaga duration gap rata-rata terkecil yang konsisten
(?0,21 tahun) di semua skenario, sedangkan PPO menunjukkan konvergensi awal yang
cepat namun osilasi persisten dengan performa agregat setara imunisasi Redington
(p = 0,406; d = 0,013). Keunggulan Redington dalam risk-adjusted return justru
gagal pada skenario krisis gabungan, mengonfirmasi keterbatasan imunisasi statis ketika
imbal hasil dan liabilitas bergerak secara simultan. Penelitian ini berkontribusi pada
kerangka lingkungan simulasi ALM berbasis DRL yang dapat diperluas, bukti empiris
keunggulan SAC atas PPO pada domain obligasi pemerintah Indonesia, serta kuantifikasi batas kemampuan imunisasi konvensional—dengan catatan bahwa hasil bersumber
dari pelatihan random seed tunggal sehingga verifikasi lintas seed diperlukan sebelum
keunggulan tersebut dinyatakan sebagai sifat algoritma secara umum.
Perpustakaan Digital ITB