Klasifikasi Data Publikasi Ilmiah Dosen Sains Data, Matematika, dan Informatika IPB Menggunakan Support Vector Machine
Abstract
Dengan data publikasi yang semakin banyak dan tersebar di internet, penelitian yang menggunakan domain-specific dataset semakin banyak ditemukan. Penelitian tersebut memiliki tujuan yang lebih sempit dengan ruang lingkup yang lebih terbatas untuk membantu menghasilkan kesimpulan yang menyesuaikan kebutuhan dan konteks yang lebih sempit. Penelitian ini meniru penelitian berikut dengan skala yang lebih sempit berupa pelatihan model klasifikasi label pada dataset publikasi dosen Sekolah Sains Data, Matematika, dan Informatika (SSMI) IPB. Dataset berisikan karya publikasi dari dosen fakultas tersebut serta data publikasi yang mensitasi karya tersebut. Penelitian berikut akan melakukan pembagian data dengan metode holdout yang dimodifikasi berupa Stratified Shuffle Split untuk mencegah tidak seimbangnya pembagian data training dan testing dikarenakan label yang akan diklasifikasi adalah bidang kepakaran dosen pemilik karya publikasi tersebut. Hasil performa model klasifikasi akan menggunakan pendekatan macro-average dan direpresentasikan dalam confusion matrix. With the ever-increasing volume of publication data available online, research utilizing domain-specific datasets has become more prevalent. Such research targets specific objectives within a focused scope to yield conclusions tailored to particular needs and contexts. This study replicates existing research on a more focused scale by training a label classification model using a dataset of publications by faculty members from the School of Data Science, Mathematics, and Informatics (SSMI) at IPB. The dataset comprises publications authored by these faculty members as well as data on publications citing those works. To address potential imbalances between training and testing sets, the study employs a modified holdout method known as Stratified Shuffle Split for data partitioning. Model performance is evaluated using a macro-averaging approach and visualized via a confusion matrix.
Collections
- UF - Computer Science [194]

