Pengembangan Metode Adaptive Neighborhood Representative Plus (ANR?) untuk Peningkatan Performa Deteksi Outlier
Date
2026Jenis/Type
TesisSubtype
ThesesAuthor
Abdullah, Adib Roisilmi
Fitrianto, Anwar
Erfiani
Metadata
Show full item recordAbstract
Deteksi outlier bertujuan mengidentifikasi objek yang memiliki pola berbeda dari
mayoritas pengamatan. Metode berbasis k-nearest neighbors mampu menangkap
struktur ketetanggaan antarobjek, tetapi kinerjanya sensitif terhadap pemilihan nilai
. Metode yang hanya menggunakan skor individual juga dapat mengabaikan
informasi pada tingkat kelompok. Penelitian ini bertujuan mengembangkan
Adaptive Neighborhood Representative Plus (ANR?) melalui integrasi K-Finder
based on Neighborhood Consistency (KFC) dan Neighborhood Representative Plus
(NR?). Kinerja ANR? kemudian dievaluasi menggunakan data referensi. Metode
tersebut selanjutnya diterapkan pada data SUSENAS Maret 2024 Provinsi Jawa
Barat.
ANR? menggunakan KFC untuk memilih nilai k secara adaptif berdasarkan
konsistensi struktur ketetanggaan. Objek representative dibentuk melalui iterative
medoid-shift. Skor ANR? diperoleh dengan menggabungkan skor lokal setiap objek
dan skor global dari objek representative. Kinerja metode dievaluasi pada 14
dataset referensi menggunakan AUC-ROC dan dibandingkan dengan KFCS serta
NR? rujukan. KNN digunakan sebagai detektor utama, sedangkan LOF, ODIN, dan
MOD+ digunakan untuk menilai konsistensi hasil antardetektor. Weighted ANR?
juga dianalisis sebagai oracle upper bound untuk menilai potensi pembobotan skor
lokal dan global.
Evaluasi pada delapan dataset yang dapat dibandingkan menunjukkan rata-rata
AUC ANR? sebesar 0,733 dibandingkan 0,680 pada KFCS rujukan. ANR?
menghasilkan AUC lebih tinggi pada enam dari delapan dataset tersebut.
Perbandingan dengan NR? rujukan menunjukkan rata-rata AUC ANR? sebesar
0,831 dan NR? sebesar 0,812 pada sebelas dataset. ANR? menghasilkan AUC lebih
tinggi pada lima dataset. Weighted ANR? menghasilkan rata-rata AUC 0,798
dibandingkan 0,775 pada ANR? utama di 14 dataset. Hasil tersebut menunjukkan
bahwa kontribusi skor lokal dan global berbeda pada setiap dataset sehingga
perbedaan kinerja ANR? tetap bergantung pada karakteristik data.
ANR? selanjutnya diterapkan pada 26.012 rumah tangga SUSENAS Maret 2024
Provinsi Jawa Barat. Analisis menggunakan lima peubah, yaitu pengeluaran
makanan per kapita, pengeluaran nonmakanan per kapita, konsumsi kalori per
kapita, konsumsi protein per kapita, dan jumlah anggota rumah tangga. Seluruh
peubah kemudian distandardisasi menggunakan z-score sebelum pembentukan
struktur neighborhood. Pemilihan k menghasilkan nilai 10 untuk KNN, 21 untuk
LOF, 52 untuk ODIN, dan 20 untuk MOD+. KNN sebagai detektor utama
membentuk 2.055 objek representative melalui delapan iterasi.
Penerapan Two-Stage Thresholding pada skor ANR?-KNN menghasilkan ambang
akhir sebesar 1,790 dan mengidentifikasi 1.932 rumah tangga atau 7,43% sebagai
kandidat outlier. Kandidat tersebut terdiri atas 1.538 Global-like atau 79,61%, 320
Local-like atau 16,56%, dan 74 Collective-like atau 3,83%, sedangkan kategori
Others tidak ditemukan. Perbandingan antardetektor menunjukkan kesesuaian
terbesar antara KNN dan MOD+ dengan indeks Jaccard sebesar 0,806 dan korelasi
peringkat Spearman sebesar 0,978. Sebanyak 603 rumah tangga memperoleh
dukungan sedikitnya tiga detektor dan 75 di antaranya ditetapkan sebagai kandidat
oleh seluruh empat detektor.
Profil kandidat menunjukkan bahwa perbedaan terhadap nonkandidat terutama
terdapat pada dimensi pengeluaran. Rata-rata pengeluaran nonmakanan dan
makanan per kapita kandidat masing-masing mencapai 6,520 dan 2,838 kali rata-
rata nonkandidat. Rasio rata-rata konsumsi protein, jumlah anggota rumah tangga,
dan konsumsi kalori masing-masing sebesar 1,510, 0,824, dan 1,315. Perbedaan
pada konsumsi gizi dan ukuran rumah tangga relatif lebih kecil. Hasil tersebut
menunjukkan bahwa kandidat terbentuk dari kombinasi karakteristik dalam ruang
multivariat. Kandidat tersebut tidak dapat dijelaskan oleh satu peubah secara
terpisah.
Hasil penelitian menunjukkan bahwa ANR? dapat mengintegrasikan pemilihan
neighborhood adaptif dengan informasi keterpencilan pada tingkat objek dan objek
representative. Metode ini menunjukkan kinerja pemeringkatan outlier yang secara
rata-rata lebih tinggi pada data referensi, meskipun tidak pada seluruh struktur data.
Penerapan pada SUSENAS menunjukkan bahwa ANR? dapat digunakan sebagai
kerangka screening untuk memprioritaskan rumah tangga dengan pola multivariat
yang tidak biasa. Kandidat yang diperoleh dari data tanpa label tetap memerlukan
penelaahan substantif dan tidak dapat langsung diperlakukan sebagai outlier
terverifikasi.

