digilib@itb.ac.id +62 812 2508 8800

Abstrak - David Dewanto
Terbatas  Irwan Sofiyan
» Gedung UPT Perpustakaan

Sebagian besar penelitian Deep Reinforcement Learning (DRL) untuk perdagangan kripto berhenti pada backtesting? integrasi data multifaktor, manajemen risiko end-to-end, dan validasi eksekusi pasar nyata masih jarang. Penelitian ini mengimplementasikan, mengevaluasi, dan menggelar model multiagen DRL hierarkis dua tingkat dengan pengendali risiko setiap aset untuk perdagangan real-time BTC/USD, ETH/USD, dan SOL/USD. Mengikuti metodologi CRISP-DM, sistem memadukan indikator teknikal, metrik on-chain, dan sentimen berita yang dinilai DeepSeek V4 Pro? sembilan subagen prediksi arah PPO/DQN/QRDQN di tingkat 1 (tiga aset × tiga timeframe) menyuplai tiga agen ukuran posisi PPO/TD3/SAC di tingkat 2. Model dilatih dan diuji pada data Agustus 2017–Januari 2026 dengan pembagian kronologis 60%/20%/20%, biaya transaksi 4,5 bps di dalam fungsi imbal hasil, dan seleksi seed berbasis validasi robust. Validitas diuji dengan Probabilistic Sharpe Ratio (PSR), Deflated Sharpe Ratio (DSR), Probability of Backtest Overfitting (PBO), walk-forward, dan uji Ledoit-Wolf. Ensemble subagen BTC 5 menit mencapai Sharpe Ratio 2,14 (PSR 0,9996? PBO 0,0167). Pada periode uji tingkat 2 Mei 2024–Januari 2026, ensemble BTC mencapai Sharpe net 2,80 dengan Maximum Drawdown (MDD) ?10,2%, unggul secara signifikan atas buy-and-hold (Sharpe 0,31? Ledoit-Wolf p = 0,009? DSR 1,00? 8/8 walk-forward positif)? ensemble ETH mencapai 1,35 (MDD ?35,0%? buy-and-hold ?0,13)? ensemble SOL, pada periode uji terpendek sejak Desember 2024, mencapai 1,21 (MDD ?27,7%) saat pasar turun 39% (buy-and-hold ?0,17). Ketiga ensemble memenuhi keempat kriteria keberhasilan: Sharpe ? 1, MDD < 40%, Win Rate ? 45%, dan imbal hasil kumulatif positif? SOL memenuhinya namun belum lolos gerbang signifikansi statistik 0,95 (PSR 0,90? DSR 0,84), dan tidak satu pun algoritma tunggalnya yang memenuhi keempat kriteria. Penggelaran pilot di mainnet Hyperliquid (174 siklus keputusan, 64 eksekusi pesanan riil) memvalidasi faktor eksekusi nyata: gesekan terealisasi sekitar 3,6 bps, di bawah asumsi biaya 4,5 bps. Ensemble tiga algoritma memberikan kinerja risk-adjusted terbaik pada ketiga aset.