digilib@itb.ac.id +62 812 2508 8800

ABSTRAK Hasta Pratama
PUBLIC Open In Flipbook Esha Mustika Dewi

Data berskala besar, tidak berlabel, multivariat, dan bertipe campuran menimbulkan tiga tantangan utama, yaitu seleksi fitur tanpa supervisi, evaluasi internal berbasis seluruh pasangan dengan kompleksitas ????(????2), dan penentuan jumlah klaster yang umumnya mengasumsikan ???? tetap. Disertasi ini mengembangkan kerangka pembelajaran tak terawasi adaptif yang mengintegrasikan tiga komponen metodologis. Pertama, AUFS-Samba (Adaptive Unsupervised Feature Selection using Simulated Annealing and Multi-Armed Bandit) menemukan subset fitur yang ringkas dan rendah redundansi serta memperkuat struktur klaster intrinsik melalui eksplorasi berbasis entropy-corrected k-Most Similar Neighborhood Correlation (kMSNC*) dan optimasi simulated annealing. Pada delapan dataset benchmark UCI, AUFS-Samba memperoleh nilai Silhouette-Gower yang lebih tinggi daripada metode pembanding dengan uji Wilcoxon signed-rank ???? < 0,05. Kedua, Landmark Silhouette (L-Sil) dan Landmark Neighborhood Consistency (LNC*) menyediakan evaluasi berbasis landmark dengan kompleksitas ????(????3/2). L-Sil mempertahankan konsistensi peringkat yang kuat terhadap Silhouette-Gower penuh, dengan korelasi Spearman sekitar 0,882 dan galat terkalibrasi sekitar 0,0138. Ketiga, MixClust mengembangkan arsitektur kendali adaptif untuk menentukan jumlah klaster dan memilih algoritma antara k-prototypes dan HAC-Gower berdasarkan ruang fitur aktif. Pada sebelas dataset benchmark, MixClust memperoleh kinerja lebih tinggi daripada lima metode pembanding dengan ???? < 0,01 dan ukuran efek ???? > 0,89. Integrasi ketiga komponen dengan penggunaan ulang struktur landmark menghasilkan percepatan evaluasi hingga 105 kali. Penerapan pada Susenas 2020 yang mencakup 334.229 rumah tangga menghasilkan ????? = 2 secara konsisten pada empat dari lima seed, dengan LNC* antara 0,688 dan 0,693, serta membentuk dua arketipe empiris rumah tangga yang dapat dibedakan dan diinterpretasikan berdasarkan fitur aktif. Seluruh komponen diimplementasikan dalam paket Python terbuka dan dirancang untuk diterapkan pada data bertipe campuran tak berlabel di luar konteks survei rumah tangga.