digilib@itb.ac.id +62 812 2508 8800

Konsumsi energi pada Base Transceiver Station (BTS) merupakan salah satu komponen penting dalam konsumsi energi jaringan seluler karena BTS harus tetap beroperasi untuk memenuhi kebutuhan layanan meskipun tingkat trafik dan kebutuhan sumber daya jaringan mengalami perubahan. Salah satu pendekatan yang dapat digunakan untuk meningkatkan efisiensi energi adalah penerapan sleep mode, yaitu menonaktifkan BTS pada kondisi tertentu ketika kapasitasnya tidak sepenuhnya diperlukan. Namun, keputusan untuk mengaktifkan sleep mode memiliki konsekuensi terhadap kualitas layanan karena penonaktifan BTS dapat meningkatkan risiko terjadinya pelanggaran Quality of Service (QoS). Permasalahan tersebut menjadikan pengambilan keputusan sleep mode sebagai proses yang perlu mempertimbangkan keseimbangan antara penghematan energi dan perlindungan kualitas layanan. Penelitian ini bertujuan untuk menganalisis pengaruh representasi state space berbasis multi-Key Performance Indicator (KPI) serta membandingkan karakteristik beberapa algoritma Tabular Reinforcement Learning dalam penerapan pengambilan keputusan QoS-aware sleep mode pada BTS. Penelitian ini menggunakan data historis KPI (Key Performance Index) jaringan 4G LTE sebagai dasar pembentukan kondisi lingkungan pembelajaran. Representasi state space dievaluasi menggunakan tiga konfigurasi, yaitu 3 KPI, 4 KPI, dan 5 KPI, untuk mengidentifikasi pengaruh tingkat kompleksitas representasi kondisi jaringan terhadap karakteristik kebijakan yang dipelajari. Setiap konfigurasi diuji menggunakan empat algoritma Tabular Reinforcement Learning, yaitu Monte Carlo, Q-Learning, SARSA, dan Expected SARSA. Keputusan agen terdiri atas dua aksi, yaitu mempertahankan BTS dalam kondisi aktif atau mengaktifkan sleep mode. Pengaruh batas toleransi kualitas layanan dievaluasi melalui variasi QoS threshold berdasarkan E-RAB Drop Ratio. Eksperimen dilakukan menggunakan berbagai random seed untuk mengevaluasi konsistensi hasil pembelajaran. Kinerja algoritma dievaluasi berdasarkan Energy Saving dan QoS Violation, sedangkan CO? Reduction digunakan untuk menggambarkan implikasi lingkungan dari energi yang berhasil dihemat. Selain analisis deskriptif menggunakan nilai rata-rata dan standard deviation, perbedaan performa antaralgoritma pada konfigurasi acuan dianalisis menggunakan Wilcoxon Signed- Rank Test dengan koreksi Holm serta effect size untuk mengevaluasi signifikansi dan besarnya perbedaan performa antaralgoritma. Hasil eksperimen menunjukkan bahwa peningkatan jumlah KPI pada state space tidak menghasilkan peningkatan Energy Saving secara monoton. Konfigurasi 3 KPI dapat menghasilkan penghematan energi yang lebih tinggi pada beberapa kondisi, sedangkan konfigurasi 5 KPI menunjukkan karakteristik performa algoritma Temporal Difference yang lebih berdekatan pada metrik utama. Berdasarkan pertimbangan tersebut, konfigurasi 5 KPI digunakan sebagai konfigurasi acuan untuk analisis selanjutnya. Pada konfigurasi tersebut, Monte Carlo menghasilkan rata-rata Energy Saving sebesar 34,70% dengan QoS Violation sebesar 16,53%, sedangkan Q-Learning, SARSA, dan Expected SARSA menghasilkan Energy Saving masing-masing sebesar 50,92%, 50,91%, dan 51,08%, dengan QoS Violation masingmasing sebesar 21,63%, 21,69%, dan 21,64%. Hasil tersebut menunjukkan adanya karakteristik trade-off yang konsisten, yaitu peningkatan penghematan energi diikuti oleh peningkatan risiko pelanggaran QoS. Monte Carlo cenderung menghasilkan kebijakan yang lebih konservatif, sedangkan algoritma Temporal Difference mampu memperoleh penghematan energi yang lebih tinggi dengan konsekuensi QoS yang lebih besar. Expected SARSA menghasilkan rata-rata Energy Saving tertinggi, tetapi perbedaannya terhadap QLearning dan SARSA relatif kecil. Dari sisi konsistensi, Expected SARSA memiliki rata-rata standard deviation Energy Saving terendah, yaitu 1,75 percentage point (PP), sedangkan QLearning menghasilkan rata-rata standard deviation QoS Violation terendah, yaitu 0,72 percentage point. Pada agregasi eksperimen konfigurasi 5 KPI, Expected SARSA menghasilkan estimasi CO? Reduction sebesar 42,74 kgCO?e/hari. Hasil penelitian menunjukkan bahwa representasi multi-KPI memberikan pengaruh terhadap karakteristik kebijakan yang dipelajari, sementara pemilihan algoritma perlu mempertimbangkan efisiensi energi, kualitas layanan, konsistensi, serta signifikansi statistik secara bersamaan. Temuan ini juga menunjukkan bahwa peningkatan kompleksitas representasi kondisi jaringan tidak secara otomatis menghasilkan karakteristik kebijakan yang lebih baik, sehingga pemilihan state space perlu disesuaikan dengan tujuan dan kebutuhan evaluasi sistem.