Studi Perbandingan Metode Penggerombolan Menggunakan Principal Component Analysis , t-Distributed Stochastic Neighbor Embedding, dan Uniform Manifold Approximation and Projection
Date
2026Jenis/Type
TesisSubtype
ThesesAuthor
Utami, Arien Citha
Erfiani
Notodiputro, Khairil Anwar
Metadata
Show full item recordAbstract
Industri otomotif Indonesia termasuk dalam tiga pasar terbesar di Asia Tenggara dengan persaingan kuat dari berbagai merek asal Jepang, Korea, dan China sehingga analisis persepsi konsumen penting bagi perusahaan untuk menyusun strategi segmentasi dan komunikasi pemasaran yang tepat sasaran. Segmentasi konsumen berbasis data memungkinkan identifikasi kelompok yang memiliki pola persepsi serupa secara akurat dan sistematis. Penelitian mengenai penggerombolan pada data otomotif sudah banyak dilakukan dan umumnya menggunakan reduksi dimensi linear seperti Principal Component Analysis (PCA). Pendekatan ini belum mampu menangkap struktur nonlinear dalam data hasil survei otomotif. Kualitas segmentasi yang dihasilkan cenderung kurang optimal dan tidak mencerminkan kompleksitas pola persepsi konsumen.
t-Distributed Stochastic Neighbor Embedding (t-SNE) dan Uniform Manifold Approximation and Projection (UMAP) adalah dua teknik reduksi dimensi nonlinear yang dirancang untuk mempertahankan struktur data berdimensi tinggi ke dalam representasi berdimensi rendah. t-SNE meminimalkan perbedaan distribusi probabilitas jarak antar titik pada ruang asli dan hasil reduksi sehingga mempertahankan struktur lokal sekaligus menghasilkan visualisasi gerombol yang terpisah jelas. UMAP menggunakan pendekatan aproksimasi manifold berbasis topologi untuk mempertahankan struktur lokal dan global secara bersamaan.
Penelitian ini bertujuan membandingkan kinerja tiga algoritma penggerombolan yakni k-means, hierarchical ward, dan DBSCAN pada empat kondisi reduksi dimensi yaitu tanpa reduksi dimensi, PCA, t-SNE, dan UMAP menggunakan data simulasi dengan tiga tingkat ketumpangtindihan dan data empiris hasil survei otomotif. Data simulasi dibangkitkan dari sebaran normal peubah ganda dengan tiga gerombol dan 1000 observasi per gerombol dalam ruang berdimensi 100, dirancang untuk merepresentasikan kondisi tanpa ketumpangtindihan, ketumpangtindihan 20%, dan ketumpangtindihan 50%. Data empiris terdiri dari 1500 responden di Jakarta, Surabaya, dan Medan pada segmen sosial ekonomi atas dengan peubah citra merek, personifikasi merek, dan nilai emosional terhadap 14 merek dan 30 model kendaraan yang menghasilkan 1180 peubah setelah prapemrosesan.
Studi simulasi menunjukkan bahwa tanpa reduksi dimensi, metode k-means dan DBSCAN menghasilkan kinerja sebanding dan mengungguli hierarchical ward pada ketiga skenario. Setelah reduksi dimensi dilakukan, UMAP secara konsisten menghasilkan kinerja terbaik pada ketiga algoritma di seluruh skenario dengan penurunan Silhouette Score (SS) hanya 0,003 dari skenario tanpa ketumpangtindihan ke skenario ketumpangtindihan 50% menunjukkan ketahanan tertinggi terhadap perubahan tingkat ketumpangtindihan. DBSCAN sebaliknya menunjukkan ketidakstabilan yang konsisten dengan nilai SS negatif setelah reduksi dimensi diterapkan.
Eksplorasi data empiris menunjukkan bahwa BR10 mendominasi ketiga dimensi asosiasi merek secara konsisten, diikuti oleh BR2 dan BR7 dengan profil yang berbeda. Hasil penggerombolan tanpa reduksi dimensi menghasilkan SS tertinggi hanya 0,070, meningkat secara nyata setelah reduksi dimensi dilakukan. Kombinasi UMAP dengan k-means merupakan kombinasi optimal dengan SS sebesar 0,555, CHI sebesar 2381,598, dan DBI sebesar 0,615. Penelitian ini menegaskan bahwa pemilihan metode reduksi dimensi memberikan pengaruh yang lebih besar terhadap kualitas penggerombolan dibandingkan dengan pemilihan algoritma penggerombolan dan UMAP terbukti menjadi pilihan paling sesuai untuk data hasil survei berdimensi tinggi dengan struktur yang kompleks.

