Data berskala besar, tidak berlabel, multivariat, dan bertipe campuran menimbulkan
tiga tantangan utama, yaitu seleksi fitur tanpa supervisi, evaluasi internal berbasis
seluruh pasangan dengan kompleksitas ????(????2), dan penentuan jumlah klaster yang
umumnya mengasumsikan ???? tetap. Disertasi ini mengembangkan kerangka
pembelajaran tak terawasi adaptif yang mengintegrasikan tiga komponen
metodologis. Pertama, AUFS-Samba (Adaptive Unsupervised Feature Selection
using Simulated Annealing and Multi-Armed Bandit) menemukan subset fitur yang
ringkas dan rendah redundansi serta memperkuat struktur klaster intrinsik melalui
eksplorasi berbasis entropy-corrected k-Most Similar Neighborhood Correlation
(kMSNC*) dan optimasi simulated annealing. Pada delapan dataset benchmark
UCI, AUFS-Samba memperoleh nilai Silhouette-Gower yang lebih tinggi daripada
metode pembanding dengan uji Wilcoxon signed-rank ???? < 0,05. Kedua, Landmark
Silhouette (L-Sil) dan Landmark Neighborhood Consistency (LNC*) menyediakan
evaluasi berbasis landmark dengan kompleksitas ????(????3/2). L-Sil mempertahankan
konsistensi peringkat yang kuat terhadap Silhouette-Gower penuh, dengan korelasi
Spearman sekitar 0,882 dan galat terkalibrasi sekitar 0,0138. Ketiga, MixClust
mengembangkan arsitektur kendali adaptif untuk menentukan jumlah klaster dan
memilih algoritma antara k-prototypes dan HAC-Gower berdasarkan ruang fitur
aktif. Pada sebelas dataset benchmark, MixClust memperoleh kinerja lebih tinggi
daripada lima metode pembanding dengan ???? < 0,01 dan ukuran efek ???? > 0,89.
Integrasi ketiga komponen dengan penggunaan ulang struktur landmark
menghasilkan percepatan evaluasi hingga 105 kali. Penerapan pada Susenas 2020
yang mencakup 334.229 rumah tangga menghasilkan ????? = 2 secara konsisten pada
empat dari lima seed, dengan LNC* antara 0,688 dan 0,693, serta membentuk dua
arketipe empiris rumah tangga yang dapat dibedakan dan diinterpretasikan
berdasarkan fitur aktif. Seluruh komponen diimplementasikan dalam paket Python
terbuka dan dirancang untuk diterapkan pada data bertipe campuran tak berlabel di
luar konteks survei rumah tangga.
Perpustakaan Digital ITB