digilib@itb.ac.id +62 812 2508 8800

2026 AXL NAKATA ABSTRAK
PUBLIC Open In Flipbook Dwi Ary Fuziastuti

Manajemen aset dan liabilitas pada institusi asuransi jiwa dan dana pensiun menghadapi tantangan duration mismatch antara aset dan kewajiban jangka panjang, sementara strategi imunisasi konvensional duration matching Redington bersandar pada asumsi pergeseran paralel kurva imbal hasil yang sering tidak terpenuhi pada kondisi pasar ekstrem. Penelitian ini mengkaji penerapan Deep Reinforcement Learning (DRL) sebagai strategi imunisasi adaptif pada portofolio obligasi pemerintah Indonesia berbagai tenor, dengan membandingkan algoritma Proximal Policy Optimization (PPO) dan Soft Actor-Critic (SAC) terhadap tiga strategi baseline: imunisasi Redington, Buy-and-Hold, dan Equal Weight. Lingkungan simulasi dirancang berbasis kerangka Gymnasium dengan fungsi reward yang mengintegrasikan surplus return, penalti duration mismatch kuadratik, insentif funding ratio, dan biaya transaksi; model Long Short-Term Memory (LSTM) dikembangkan sebagai penyedia informasi pasar bagi agen dan mencapai RMSE 0,2314 persen poin serta MAPE 2,79%; liabilitas dimodelkan sebagai arus kas deterministik. Kedua agen dievaluasi pada lima skenario pasar—normal, kenaikan suku bunga (+100 bps), penurunan suku bunga (?100 bps), lonjakan liabilitas (+20%), dan krisis gabungan. Hasil eksperimen menunjukkan SAC unggul secara signifikan atas seluruh strategi lain (Cohen’s d = 0,605–1,700; p < 0,001, uji Mann-Whitney U lintas episode evaluasi) sekaligus menjaga duration gap rata-rata terkecil yang konsisten (?0,21 tahun) di semua skenario, sedangkan PPO menunjukkan konvergensi awal yang cepat namun osilasi persisten dengan performa agregat setara imunisasi Redington (p = 0,406; d = 0,013). Keunggulan Redington dalam risk-adjusted return justru gagal pada skenario krisis gabungan, mengonfirmasi keterbatasan imunisasi statis ketika imbal hasil dan liabilitas bergerak secara simultan. Penelitian ini berkontribusi pada kerangka lingkungan simulasi ALM berbasis DRL yang dapat diperluas, bukti empiris keunggulan SAC atas PPO pada domain obligasi pemerintah Indonesia, serta kuantifikasi batas kemampuan imunisasi konvensional—dengan catatan bahwa hasil bersumber dari pelatihan random seed tunggal sehingga verifikasi lintas seed diperlukan sebelum keunggulan tersebut dinyatakan sebagai sifat algoritma secara umum.