| dc.contributor.advisor | Syafitri, Utami Dyah | |
| dc.contributor.advisor | Suhaeni, Cici | |
| dc.contributor.author | KAMILA, SABRINA ADNIN | |
| dc.date.accessioned | 2026-08-14T06:21:35Z | |
| dc.date.available | 2026-08-14T06:21:35Z | |
| dc.date.issued | 2026 | |
| dc.identifier.uri | http://repository.ipb.ac.id/handle/123456789/178748 | |
| dc.description.abstract | Media sosial X menjadi ruang penting bagi wacana publik mengenai reputasi perguruan tinggi termasuk IPB University. Latent Dirichlet Allocation (LDA) merupakan metode topic modeling klasik yang banyak digunakan namun performanya menurun pada teks pendek dan informal seperti cuitan karena pola kemunculan bersama kata menjadi jarang. BERTopic hadir sebagai metode topic modeling berbasis transformer yang mengatasi keterbatasan tersebut melalui representasi semantik kontekstual. Meskipun demikian kinerja BERTopic sangat bergantung pada konfigurasi hyperparameter komponen klasterisasinya yaitu Hierarchical Density-Based Spatial Clustering of Applications with Noise (HDBSCAN). Konfigurasi default HDBSCAN dapat menghasilkan proporsi outlier yang tinggi dan koherensi topik yang rendah. Interaksi antara strategi preprocessing teks dan perilaku klasterisasi HDBSCAN juga belum banyak dikaji secara sistematis terutama untuk teks media sosial berbahasa Indonesia yang memiliki karakteristik linguistik khas.
Penelitian ini bertujuan mengevaluasi performa BERTopic yang telah dioptimalkan dibandingkan dengan BERTopic berkonfigurasi default dan LDA. Penelitian ini juga menganalisis pengaruh interaksi antara strategi preprocessing dan konfigurasi hyperparameter HDBSCAN terhadap kualitas dan struktur topik serta mengidentifikasi tema dominan dalam wacana publik mengenai reputasi IPB University di media sosial X. Data penelitian berupa 21.298 cuitan berbahasa Indonesia yang dikumpulkan pada periode Agustus 2023 hingga Agustus 2025. Data tersebut diolah melalui tiga skenario preprocessing yang berbeda dalam penanganan token numerik karakter tunggal dan penggabungan kata majemuk. Setiap skenario dimodelkan menggunakan LDA dan BERTopic dengan optimasi BERTopic dilakukan melalui grid search atas 126 kombinasi hyperparameter HDBSCAN pada setiap skenario. Pemilihan model terbaik menggabungkan evaluasi kuantitatif berupa topic coherence topic uniqueness document coverage dan factuality dengan pemeriksaan kualitatif terhadap intertopic distance map.
Hasil penelitian menunjukkan bahwa pengaruh hyperparameter HDBSCAN terhadap kualitas topik tidak seragam pada seluruh skenario preprocessing. Di antara keempat hyperparameter yang diuji cluster_selection_method terbukti paling berpengaruh terutama dalam menekan rasio outlier. Metode eom secara konsisten menghasilkan rasio outlier yang lebih rendah dibandingkan metode leaf dan perbedaan ini terbukti signifikan secara statistik berdasarkan uji Wilcoxon signed-rank berpasangan pada seluruh skenario. Sementara itu cluster_selection_epsilon tidak menunjukkan pengaruh yang berarti terhadap topic coherence. Konfigurasi hyperparameter optimal juga berbeda pada setiap skenario preprocessing bahkan metode cluster_selection_method terbaik berbalik pada skenario yang menerapkan penggabungan kata akibat pergeseran ruang embedding.
Optimasi hyperparameter HDBSCAN melalui grid search meningkatkan topic coherence BERTopic sebesar 0,148 hingga 0,251 dibandingkan konfigurasi default disertai berkurangnya jumlah topik sehingga lebih mudah diinterpretasikan. BERTopic teroptimasi juga secara konsisten menghasilkan topic coherence yang lebih tinggi daripada LDA pada seluruh skenario sedangkan LDA justru unggul pada topic uniqueness dan document coverage. Kedua model sama-sama menghasilkan nilai factuality sebesar 1,000 pada seluruh skenario. Secara kualitatif BERTopic membentuk topik yang lebih terpisah dengan batas tema yang lebih jelas sementara LDA mampu mencakup proporsi dokumen yang lebih besar.
Penelitian ini berhasil memetakan enam tema dominan dalam wacana publik mengenai IPB University, yaitu penerimaan mahasiswa baru, ekspresi emosional calon mahasiswa dan mahasiswa baru, kehidupan akademik dan identitas kampus, biaya pendidikan, fasilitas dan infrastruktur kampus, serta peran IPB University dalam sektor pertanian dan ketahanan pangan. Penerimaan mahasiswa baru merupakan tema paling dominan yang konsisten muncul pada seluruh skenario sedangkan beberapa tema lain menunjukkan sensitivitas terhadap strategi preprocessing yang diterapkan. Hasil penelitian ini memberikan kerangka optimasi BERTopic yang dapat direplikasi untuk analisis wacana media sosial berbahasa Indonesia sekaligus memberikan gambaran bagi IPB University dalam menyusun strategi komunikasi dan pengelolaan reputasi yang lebih berbasis data. | |
| dc.description.abstract | Social media platform X has become an important space for public discourse on university reputation including that of IPB University. Latent Dirichlet Allocation (LDA) is a widely used classical topic modeling method yet its performance declines on short and informal texts such as tweets because word co-occurrence patterns become sparse. BERTopic emerged as a transformer-based topic modeling method that addresses this limitation through contextual semantic representation. Its performance nevertheless depends heavily on the hyperparameter configuration of its clustering component namely Hierarchical Density-Based Spatial Clustering of Applications with Noise (HDBSCAN). A default HDBSCAN configuration can produce a high proportion of outliers and low topic coherence. The interaction between text preprocessing strategies and HDBSCAN clustering behavior has also not been widely studied systematically particularly for Indonesian-language social media text with distinctive linguistic characteristics.
This study aims to evaluate the performance of optimized BERTopic compared to default-configuration BERTopic and LDA. It also analyzes the interaction between preprocessing strategies and HDBSCAN hyperparameter configurations on topic quality and structure and identifies dominant themes in public discourse about IPB University's reputation on X. The dataset consisted of 21,298 Indonesian-language tweets collected from August 2023 to August 2025. The data were processed through three preprocessing scenarios that differed in their treatment of numeric tokens single characters and compound word merging. Each scenario was modeled using both LDA and BERTopic with BERTopic optimization performed through a grid search over 126 HDBSCAN hyperparameter combinations per scenario. The best model was selected by combining quantitative evaluation comprising topic coherence topic uniqueness document coverage and factuality with qualitative inspection of the intertopic distance map.
The results show that the influence of HDBSCAN hyperparameters on topic quality is not uniform across preprocessing scenarios. Among the four hyperparameters tested cluster_selection_method proved the most influential particularly in reducing the outlier ratio. The eom method consistently produced a lower outlier ratio than the leaf method and this difference was statistically significant based on a paired Wilcoxon signed-rank test across all scenarios. Meanwhile cluster_selection_epsilon showed no meaningful effect on topic coherence. The optimal hyperparameter configuration also differed across preprocessing scenarios and the best cluster_selection_method even reversed in the scenario applying word merging due to a shift in the embedding space.
Optimizing HDBSCAN hyperparameters through grid search increased BERTopic's topic coherence by 0.148 to 0.251 compared to the default configuration accompanied by a reduced number of topics that were easier to interpret. Optimized BERTopic also consistently achieved higher topic coherence than LDA across all scenarios while LDA outperformed BERTopic in topic uniqueness and document coverage. Both models achieved a factuality score of 1.000 across all scenarios. Qualitatively BERTopic produced more clearly separated topics with sharper thematic boundaries while LDA covered a larger proportion of documents.
The study successfully identified six dominant themes in public discourse surrounding IPB University, namely student admissions, the emotional expressions of prospective and newly admitted students, academic life and campus identity, tuition fees, campus facilities and infrastructure, and the role of IPB University in the agriculture and food security sectors. Student admissions emerged as the most dominant theme, consistently appearing across all preprocessing scenarios, while several other themes demonstrated sensitivity to the preprocessing strategies employed. These findings provide a replicable BERTopic optimization framework for analyzing Indonesian-language social media discourse and offer valuable insights for IPB University in developing more data-driven communication and reputation management strategies. | |
| dc.description.sponsorship | | |
| dc.language.iso | id | |
| dc.publisher | IPB University | id |
| dc.title | Metode LDA dan BERTopic dengan Optimasi Hyperparameter HDBSCAN pada Wacana Publik IPB University di X | id |
| dc.title.alternative | Methods with HDBSCAN Hyperparameter Optimization on Public Discourse about IPB University on X | |
| dc.type | Tesis | |
| dc.subject.keyword | BERTopic | id |
| dc.subject.keyword | HDBSCAN | id |
| dc.subject.keyword | hyperparameter | id |
| dc.subject.keyword | LDA | id |
| dc.subject.keyword | topic modeling | id |
| dc.subtype | Theses | |