Abstrak - David Dewanto
Terbatas Irwan Sofiyan
» Gedung UPT Perpustakaan
Terbatas Irwan Sofiyan
» Gedung UPT Perpustakaan
Sebagian besar penelitian Deep Reinforcement Learning (DRL) untuk perdagangan
kripto berhenti pada backtesting? integrasi data multifaktor, manajemen risiko
end-to-end, dan validasi eksekusi pasar nyata masih jarang. Penelitian ini mengimplementasikan,
mengevaluasi, dan menggelar model multiagen DRL hierarkis dua
tingkat dengan pengendali risiko setiap aset untuk perdagangan real-time BTC/USD,
ETH/USD, dan SOL/USD. Mengikuti metodologi CRISP-DM, sistem memadukan
indikator teknikal, metrik on-chain, dan sentimen berita yang dinilai DeepSeek
V4 Pro? sembilan subagen prediksi arah PPO/DQN/QRDQN di tingkat 1 (tiga
aset × tiga timeframe) menyuplai tiga agen ukuran posisi PPO/TD3/SAC di tingkat
2. Model dilatih dan diuji pada data Agustus 2017–Januari 2026 dengan pembagian
kronologis 60%/20%/20%, biaya transaksi 4,5 bps di dalam fungsi imbal hasil,
dan seleksi seed berbasis validasi robust. Validitas diuji dengan Probabilistic Sharpe
Ratio (PSR), Deflated Sharpe Ratio (DSR), Probability of Backtest Overfitting
(PBO), walk-forward, dan uji Ledoit-Wolf. Ensemble subagen BTC 5 menit mencapai
Sharpe Ratio 2,14 (PSR 0,9996? PBO 0,0167). Pada periode uji tingkat 2 Mei
2024–Januari 2026, ensemble BTC mencapai Sharpe net 2,80 dengan Maximum
Drawdown (MDD) ?10,2%, unggul secara signifikan atas buy-and-hold (Sharpe
0,31? Ledoit-Wolf p = 0,009? DSR 1,00? 8/8 walk-forward positif)? ensemble ETH
mencapai 1,35 (MDD ?35,0%? buy-and-hold ?0,13)? ensemble SOL, pada periode
uji terpendek sejak Desember 2024, mencapai 1,21 (MDD ?27,7%) saat pasar
turun 39% (buy-and-hold ?0,17). Ketiga ensemble memenuhi keempat kriteria keberhasilan:
Sharpe ? 1, MDD < 40%, Win Rate ? 45%, dan imbal hasil kumulatif
positif? SOL memenuhinya namun belum lolos gerbang signifikansi statistik 0,95
(PSR 0,90? DSR 0,84), dan tidak satu pun algoritma tunggalnya yang memenuhi
keempat kriteria. Penggelaran pilot di mainnet Hyperliquid (174 siklus keputusan,
64 eksekusi pesanan riil) memvalidasi faktor eksekusi nyata: gesekan terealisasi sekitar
3,6 bps, di bawah asumsi biaya 4,5 bps. Ensemble tiga algoritma memberikan
kinerja risk-adjusted terbaik pada ketiga aset.
Perpustakaan Digital ITB