Show simple item record

dc.contributor.advisorAfendi, Farit Mochamad
dc.contributor.advisorFitrianto, Anwar
dc.contributor.authorYusran, Muhammad
dc.date.accessioned2026-08-14T06:22:08Z
dc.date.available2026-08-14T06:22:08Z
dc.date.issued2026
dc.identifier.urihttp://repository.ipb.ac.id/handle/123456789/178768
dc.description.abstractPerkembangan pesat layanan keuangan digital di Indonesia mendorong meningkatnya penggunaan dompet digital seperti GoPay. Ulasan pengguna yang tersedia pada platform Google Play Store mengandung informasi penting berupa opini dan pengalaman pengguna yang dapat dimanfaatkan untuk memahami persepsi publik terhadap kualitas layanan. Analisis sentimen menjadi pendekatan yang relevan untuk mengekstraksi informasi tersebut secara sistematis. Namun, data ulasan pengguna umumnya memiliki distribusi yang tidak seimbang, dengan dominasi kelas sentimen positif, sedangkan kelas netral dan negatif memiliki proporsi yang jauh lebih kecil. Ketidakseimbangan ini menyebabkan model klasifikasi cenderung bias terhadap kelas mayoritas, sehingga performa pada kelas minoritas menjadi kurang optimal. Selain ketidakseimbangan jumlah data, perbedaan karakteristik linguistik antar kelas sentimen juga menjadi tantangan tersendiri. Kelas sentimen positif umumnya memiliki ekspresi yang eksplisit dan evaluatif, sedangkan kelas sentimen negatif cenderung memuat deskripsi masalah yang lebih rinci dan kontekstual. Sebaliknya, kelas sentimen netral memiliki karakteristik yang lebih ambigu, dengan teks yang singkat, tentatif, dan minim ekspresi emosional. Variasi bahasa yang terbatas pada kelas ini menyebabkan model kesulitan dalam mengenali pola yang konsisten, sehingga kelas netral menjadi yang paling sulit diklasifikasikan. Oleh karena itu, diperlukan pendekatan yang tidak hanya meningkatkan jumlah data, tetapi juga mampu memperkaya representasi linguistik kelas minoritas tanpa menyimpang dari karakteristik aslinya. Penelitian ini bertujuan untuk mengevaluasi kualitas data hasil augmentasi berbasis GPT-4o serta mengkaji pengaruhnya terhadap peningkatan representasi kelas minoritas dan performa klasifikasi sentimen multikelas. Selain itu, penelitian ini juga bertujuan untuk membandingkan performa model IndoBERT-LoRA dan model hybrid IndoBERT–CNN–BiLSTM, serta menganalisis stabilitas dan ketidakpastian performa model menggunakan pendekatan bootstrapping. Metode penelitian meliputi pengumpulan data ulasan GoPay dari Google Play Store, pelabelan sentimen secara manual ke dalam tiga kelas, serta preprocessing teks dalam dua tahap. Augmentasi data dilakukan menggunakan GPT-4o melalui dua pendekatan, yaitu prompt-based dan fine-tuning. Data sintetis yang dihasilkan dievaluasi menggunakan metrik novelty, diversity, dan duplication untuk memastikan kualitasnya sebelum digunakan dalam pelatihan model. Pemodelan klasifikasi dilakukan menggunakan IndoBERT-LoRA dan model hybrid IndoBERT–CNN–BiLSTM. Evaluasi performa dilakukan menggunakan metrik accuracy, precision, dan recall berbasis macro-average. Analisis lanjutan dilakukan menggunakan bootstrapping untuk memperoleh distribusi metrik performa dan selang kepercayaan. Hasil eksplorasi menunjukkan bahwa data memiliki ketidakseimbangan yang signifikan, dengan kelas netral sebagai kelas dengan proporsi paling kecil dan variasi linguistik paling terbatas. Dari sisi semantik, kelas netral didominasi oleh teks pendek dan bersifat tentatif, sehingga menyulitkan model dalam membedakan kelas tersebut dari kelas lainnya. Hasil augmentasi menunjukkan bahwa kedua pendekatan mampu mempertahankan karakteristik utama masing-masing kelas. Namun, pendekatan fine-tuning menghasilkan data sintetis yang lebih natural, lebih kaya secara linguistik, serta memiliki tingkat duplikasi yang lebih rendah dibandingkan prompt-based, khususnya pada kelas netral yang cenderung memiliki pola bahasa berulang. Pada skenario tanpa augmentasi, kedua model menunjukkan performa yang tinggi secara umum, tetapi mengalami keterbatasan dalam mengenali kelas netral. IndoBERT-LoRA menunjukkan nilai recall yang rendah pada kelas netral, yang mengindikasikan bahwa sebagian besar data netral tidak teridentifikasi dengan baik. Model hybrid IndoBERT–CNN–BiLSTM menunjukkan performa yang lebih baik dalam menangani kelas netral, namun peningkatan tersebut belum sepenuhnya optimal. Setelah penerapan augmentasi, terjadi peningkatan yang signifikan pada kemampuan model dalam mengenali kelas minoritas, yang terutama tercermin pada peningkatan nilai recall. Pendekatan prompt-based menghasilkan peningkatan performa yang relatif stabil dengan keseimbangan antara precision dan recall yang lebih terjaga. Sebaliknya, pendekatan fine-tuning memberikan peningkatan yang lebih kuat pada recall kelas netral, yang menunjukkan bahwa model menjadi lebih sensitif terhadap data yang sebelumnya sulit dikenali. Namun, peningkatan ini disertai dengan penurunan precision, yang menunjukkan adanya trade-off antara sensitivitas dan ketepatan prediksi. Hal ini mengindikasikan bahwa augmentasi yang lebih agresif mampu meningkatkan cakupan klasifikasi, tetapi juga meningkatkan risiko kesalahan klasifikasi antar kelas. Analisis menggunakan bootstrapping menunjukkan bahwa peningkatan performa pada skenario augmentasi bersifat konsisten dan bukan disebabkan oleh fluktuasi acak. Hal ini ditunjukkan oleh pergeseran distribusi metrik performa ke arah nilai yang lebih tinggi serta selang kepercayaan yang lebih sempit dibandingkan baseline. Selain itu, analisis probabilitas prediksi menunjukkan bahwa pendekatan fine-tuning mampu meningkatkan tingkat keyakinan model dalam mengklasifikasikan data, khususnya pada kelas netral. Distribusi probabilitas yang lebih terpusat menunjukkan bahwa model tidak hanya menjadi lebih akurat, tetapi juga lebih konsisten dalam memberikan prediksi. Secara keseluruhan, penelitian ini menunjukkan bahwa augmentasi data berbasis GPT-4o efektif dalam meningkatkan kualitas data sintetis, memperbaiki ketidakseimbangan kelas, serta meningkatkan performa dan stabilitas model klasifikasi sentimen multikelas. Pendekatan fine-tuning memberikan kontribusi yang lebih signifikan dalam meningkatkan sensitivitas terhadap kelas minoritas, khususnya kelas netral, meskipun disertai dengan trade-off pada precision. Temuan ini menegaskan bahwa integrasi augmentasi berbasis large language model dengan model klasifikasi berbasis transformer dan arsitektur hybrid dapat menjadi pendekatan yang efektif dalam mengatasi permasalahan klasifikasi sentimen pada data yang tidak seimbang.
dc.description.abstractThe rapid development of digital financial services in Indonesia has led to the increasing use of digital wallets such as GoPay. User reviews available on the Google Play Store contain valuable information in the form of opinions and user experiences, which can be utilized to understand public perceptions of service quality. Sentiment analysis serves as a relevant approach to systematically extract such information. However, user review data generally exhibit an imbalanced distribution, where positive sentiment dominates, while neutral and negative sentiments are significantly underrepresented. This imbalance causes classification models to be biased toward the majority class, resulting in suboptimal performance on minority classes. In addition to data imbalance, differences in linguistic characteristics across sentiment classes present further challenges. Positive sentiment is typically expressed explicitly and evaluatively, while negative sentiment often contains more detailed and contextual descriptions of problems. In contrast, neutral sentiment is more ambiguous, characterized by short, tentative expressions with minimal emotional content. The limited linguistic variation in this class makes it difficult for models to learn consistent patterns, rendering the neutral class the most challenging to classify. Therefore, an approach is required that not only increases the quantity of data but also enriches the linguistic representation of minority classes without deviating from their inherent characteristics. This study aims to evaluate the quality of synthetic data generated through GPT-4o-based augmentation and to examine its impact on improving the representation of minority classes and the performance of multiclass sentiment classification. In addition, this study compares the performance of IndoBERT-LoRA and a hybrid IndoBERT–CNN–BiLSTM model, while also analyzing the stability and uncertainty of model performance using a bootstrapping approach. The research methodology includes collecting GoPay user reviews from the Google Play Store, manually labeling sentiments into three classes, and performing text preprocessing in two stages. Data augmentation is conducted using GPT-4o through two approaches, namely prompt-based and fine-tuning. The generated synthetic data are evaluated using novelty, diversity, and duplication metrics to ensure quality before being used for model training. The classification models employed are IndoBERT-LoRA and the hybrid IndoBERT–CNN–BiLSTM. Model performance is evaluated using accuracy, precision and recall based on macro-average metrics. Further analysis is conducted using bootstrapping to obtain the distribution of performance metrics and their confidence intervals. The exploratory analysis reveals a significant class imbalance, with the neutral class having the smallest proportion and the most limited linguistic variation. Semantically, neutral reviews are dominated by short and tentative expressions, making it difficult for models to distinguish them from other classes. The augmentation results show that both approaches are able to preserve the core characteristics of each sentiment class. However, the fine-tuning approach produces more natural and linguistically rich synthetic data with lower duplication rates compared to the prompt-based approach, particularly for the neutral class, which tends to exhibit repetitive language patterns. Under the baseline scenario without augmentation, both models achieve high overall performance but struggle to accurately identify the neutral class. IndoBERT-LoRA exhibits low recall for neutral sentiment, indicating that many neutral instances are misclassified. The hybrid IndoBERT–CNN–BiLSTM model demonstrates better performance in handling the neutral class, although the improvement remains limited. After applying data augmentation, both models show significant improvements in recognizing minority classes, particularly reflected in increased recall values. The prompt-based approach yields relatively stable performance improvements while maintaining a better balance between precision and recall. In contrast, the fine-tuning approach leads to a more substantial increase in recall for the neutral class, indicating improved sensitivity to previously difficult instances. However, this improvement is accompanied by a decrease in precision, highlighting a trade-off between sensitivity and predictive accuracy. This suggests that more aggressive augmentation enhances class coverage but also increases the risk of misclassification across classes. The bootstrapping analysis demonstrates that the performance improvements observed under augmentation scenarios are consistent and not due to random fluctuations. This is indicated by the shift of performance metric distributions toward higher values and narrower confidence intervals compared to the baseline. Furthermore, the analysis of prediction probabilities shows that the fine-tuning approach improves the model’s confidence in classification, particularly for the neutral class. The more concentrated probability distributions indicate that the model becomes not only more accurate but also more consistent in its predictions. Overall, this study demonstrates that GPT-4o-based data augmentation is effective in improving the quality of synthetic data, addressing class imbalance, and enhancing both the performance and stability of multiclass sentiment classification models. The fine-tuning approach provides a more substantial contribution in improving sensitivity toward minority classes, especially the neutral class, albeit with a trade-off in precision. These findings highlight that integrating large language model-based augmentation with transformer-based and hybrid deep learning architectures constitutes an effective approach for addressing sentiment classification challenges in imbalanced datasets.
dc.description.sponsorshipLembaga Pengelola Dana Pendidikan
dc.language.isoid
dc.publisherIPB Universityid
dc.titlePendekatan Augmentasi Data Berbasis GPT-4o untuk Klasifikasi Sentimen Multikelas pada Model IndoBERT-LoRA dan Hybrid IndoBERT-CNN-BiLSTMid
dc.title.alternative
dc.typeTesis
dc.subject.keywordaugmentasi dataid
dc.subject.keywordGPT-4oid
dc.subject.keywordIndoBERTid
dc.subject.keywordketidakseimbangan kelasid
dc.subject.keywordklasifikasi sentimenid
dc.subtypeTheses


Files in this item

Thumbnail
Thumbnail
Thumbnail

This item appears in the following Collection(s)

Show simple item record