Churn pelanggan adalah kondisi saat pelanggan tidak lagi menggunakan layanan atau produk perusahaan. Di dunia telekomunikasi, pelanggan yang akan melakukan churn dapat dilihat dari intensitas dan kecenderungan penggunaan panggilan telepon. Jumlah pelanggan churn hanya sekitar 7,9% dibandingkan dengan pelanggan aktif. Perbandingan yang jauh ini menyebabkan data yang tidak seimbang antara satu kategori dengan kategori yang lain. Dominasi suatu kategori ini akan menjadi masalah dalam proses klasifikasi karena hasil klasifikasi akan lebih cenderung dipengaruhi oleh kategori mayoritas. Untuk mengatasi permasalahan ini, kami menggunakan metode Synthetic Minority Over Sampling (SMOTE) untuk menyeimbangkan data.
Permasalahan prediksi churn lainnya adalah karakteristik data yang memiliki dimensi tinggi. Tidak semua dimensi memiliki efek positif pada hasil klasifikasi. Untuk beberapa kasus, kinerja klasifikasi akan lebih baik jika menggunakan variabel relevan yang dipilih. Masalah dimensi yang tinggi dapat diatasi dengan pemilihan fitur yang tepat. Dalam penelitian ini kami menggunakan random forest dengan 10-fold cross-validation sebagai resampling dan validasi eksternal. Kami memperoleh akurasi 90,13%, presisi sebesar 86,29%, recall sebesar 95,41% dan 90,62% rasio f-measure. Metode yang kami usulkan memiliki hasil prediksi yang baik dan dapat digunakan untuk memprediksi calon pelanggan churn.
Perpustakaan Digital ITB