Konsumsi energi pada Base Transceiver Station (BTS) merupakan salah satu komponen
penting dalam konsumsi energi jaringan seluler karena BTS harus tetap beroperasi untuk
memenuhi kebutuhan layanan meskipun tingkat trafik dan kebutuhan sumber daya jaringan
mengalami perubahan. Salah satu pendekatan yang dapat digunakan untuk meningkatkan
efisiensi energi adalah penerapan sleep mode, yaitu menonaktifkan BTS pada kondisi tertentu
ketika kapasitasnya tidak sepenuhnya diperlukan. Namun, keputusan untuk mengaktifkan sleep
mode memiliki konsekuensi terhadap kualitas layanan karena penonaktifan BTS dapat
meningkatkan risiko terjadinya pelanggaran Quality of Service (QoS). Permasalahan tersebut
menjadikan pengambilan keputusan sleep mode sebagai proses yang perlu mempertimbangkan
keseimbangan antara penghematan energi dan perlindungan kualitas layanan. Penelitian ini
bertujuan untuk menganalisis pengaruh representasi state space berbasis multi-Key
Performance Indicator (KPI) serta membandingkan karakteristik beberapa algoritma Tabular
Reinforcement Learning dalam penerapan pengambilan keputusan QoS-aware sleep mode
pada BTS.
Penelitian ini menggunakan data historis KPI (Key Performance Index) jaringan 4G LTE
sebagai dasar pembentukan kondisi lingkungan pembelajaran. Representasi state space
dievaluasi menggunakan tiga konfigurasi, yaitu 3 KPI, 4 KPI, dan 5 KPI, untuk
mengidentifikasi pengaruh tingkat kompleksitas representasi kondisi jaringan terhadap
karakteristik kebijakan yang dipelajari. Setiap konfigurasi diuji menggunakan empat algoritma
Tabular Reinforcement Learning, yaitu Monte Carlo, Q-Learning, SARSA, dan Expected
SARSA. Keputusan agen terdiri atas dua aksi, yaitu mempertahankan BTS dalam kondisi aktif
atau mengaktifkan sleep mode. Pengaruh batas toleransi kualitas layanan dievaluasi melalui
variasi QoS threshold berdasarkan E-RAB Drop Ratio. Eksperimen dilakukan menggunakan
berbagai random seed untuk mengevaluasi konsistensi hasil pembelajaran. Kinerja algoritma
dievaluasi berdasarkan Energy Saving dan QoS Violation, sedangkan CO? Reduction
digunakan untuk menggambarkan implikasi lingkungan dari energi yang berhasil dihemat.
Selain analisis deskriptif menggunakan nilai rata-rata dan standard deviation, perbedaan
performa antaralgoritma pada konfigurasi acuan dianalisis menggunakan Wilcoxon Signed-
Rank Test dengan koreksi Holm serta effect size untuk mengevaluasi signifikansi dan besarnya
perbedaan performa antaralgoritma.
Hasil eksperimen menunjukkan bahwa peningkatan jumlah KPI pada state space tidak
menghasilkan peningkatan Energy Saving secara monoton. Konfigurasi 3 KPI dapat
menghasilkan penghematan energi yang lebih tinggi pada beberapa kondisi, sedangkan
konfigurasi 5 KPI menunjukkan karakteristik performa algoritma Temporal Difference yang
lebih berdekatan pada metrik utama. Berdasarkan pertimbangan tersebut, konfigurasi 5 KPI
digunakan sebagai konfigurasi acuan untuk analisis selanjutnya. Pada konfigurasi tersebut,
Monte Carlo menghasilkan rata-rata Energy Saving sebesar 34,70% dengan QoS Violation
sebesar 16,53%, sedangkan Q-Learning, SARSA, dan Expected SARSA menghasilkan Energy
Saving masing-masing sebesar 50,92%, 50,91%, dan 51,08%, dengan QoS Violation masingmasing
sebesar 21,63%, 21,69%, dan 21,64%. Hasil tersebut menunjukkan adanya
karakteristik trade-off yang konsisten, yaitu peningkatan penghematan energi diikuti oleh
peningkatan risiko pelanggaran QoS. Monte Carlo cenderung menghasilkan kebijakan yang
lebih konservatif, sedangkan algoritma Temporal Difference mampu memperoleh
penghematan energi yang lebih tinggi dengan konsekuensi QoS yang lebih besar. Expected
SARSA menghasilkan rata-rata Energy Saving tertinggi, tetapi perbedaannya terhadap QLearning
dan SARSA relatif kecil. Dari sisi konsistensi, Expected SARSA memiliki rata-rata
standard deviation Energy Saving terendah, yaitu 1,75 percentage point (PP), sedangkan QLearning
menghasilkan rata-rata standard deviation QoS Violation terendah, yaitu 0,72
percentage point. Pada agregasi eksperimen konfigurasi 5 KPI, Expected SARSA
menghasilkan estimasi CO? Reduction sebesar 42,74 kgCO?e/hari. Hasil penelitian
menunjukkan bahwa representasi multi-KPI memberikan pengaruh terhadap karakteristik
kebijakan yang dipelajari, sementara pemilihan algoritma perlu mempertimbangkan efisiensi
energi, kualitas layanan, konsistensi, serta signifikansi statistik secara bersamaan. Temuan ini
juga menunjukkan bahwa peningkatan kompleksitas representasi kondisi jaringan tidak secara
otomatis menghasilkan karakteristik kebijakan yang lebih baik, sehingga pemilihan state space
perlu disesuaikan dengan tujuan dan kebutuhan evaluasi sistem.
Perpustakaan Digital ITB