Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Pembandingan Pendekatan Klasik, Berbasis Transformer, dan RAG dengan LLM untuk Triage Bug Otomatis

Perbandingan terkontrol pada dataset Eclipse menunjukkan TF-IDF jarang dengan XGBoost (76,47% top-1) masih mengungguli E5 yang telah disetel halus (72,49%) dan generator LLM yang diperkaya pengambilan (36,81%) untuk penugasan pengembang
Márk Lajkó; Balázs Nagy; László Vidács· International Conference on Software and Data Technologies· 2026· DOI 10.5220/0015235300004088

Masalah inti

Triage bug otomatis — penugasan laporan isu yang masuk kepada pengembang yang paling mungkin menyelesaikannya — adalah hambatan berulang dalam pemeliharaan perangkat lunak. Triage manual menghabiskan waktu insinyur senior yang substansial, dan kesalahan rute memperpanjang siklus perbaikan, meningkatkan kedalaman antrean, serta menunda rilis. Makalah oleh Márk Lajkó, Balázs Nagy, dan László Vidács, yang dipresentasikan pada International Conference on Software and Data Technologies (SCDT 2026), membingkai masalah ini sebagai tugas klasifikasi teks terawasi: laporan bug adalah masukan, dan pengembang yang bertanggung jawab adalah labelnya. Para penulis memposisikan pekerjaan mereka di tengah lanskap yang berubah cepat di mana model bahasa besar (LLM) sering diasumsikan menggantikan *pipeline* rekayasa fitur klasik. Pertanyaan motivasi mereka sengaja bersifat empiris daripada arsitektural: di seluruh tolok ukur umum, apakah *encoder* transformer, *prompting* LLM terdepan, dan generasi yang diperkaya pengambilan (RAG) benar-benar mengungguli pembelajar istilah jarang yang disetel dengan baik untuk rekomendasi pengembang? Untuk menjawabnya, mereka menjalankan satu tolok ukur terkontrol

Inovasi

Tolok ukur ini menghasilkan urutan yang jelas yang memotong asumsi generasi tentang kecanggihan model. Angka-angka utama dirangkum di bawah ini.

| Pendekatan | Konfigurasi | Akurasi Top-1 |
|---|---|---|
| TF-IDF + XGBoost | Fitur jarang klasik, pohon *boosted* | **76,47%** |
| *Encoder* E5 | Disetel penuh (model *deep learning* terbaik) | **72,49%** |
| *Encoder* E5 | *Embedding* beku + kepala MLP (*transformer* beku terbaik) | 47,63% |
| RAG dengan generator LLM | Generasi yang diperkaya pengambilan | 36,81% |

Tiga temuan mendominasi. Pertama, *pipeline* TF-IDF + XGBoost klasik tetap menjadi sistem berkinerja terbaik tunggal pada dataset Eclipse, dengan akurasi top-1 76,47%. Kedua, kesenjangan antara penggunaan transformer beku dan disetel halus jauh lebih besar daripada kesenjangan antara transformer terbaik dan *baseline* klasik: E5 sebagai sumber *embedding* beku hanya mencapai 47,63%, dan penyetelan penuh mengangkatnya sekitar 25 poin akurasi menjadi 72,49% — hasil *deep learning* terkuat yang diketahui penulis untuk tugas ini, namun masih sedikit di bawah *baseline* jarang. Ketiga, konkatenasi fitur hibrida, di mana *embedding* dari model transformer kuat ditambahkan ke re

Triage bug otomatis — penugasan laporan isu yang masuk kepada pengembang yang paling mungkin menyelesaikannya — adalah hambatan berulang dalam pemeliharaan perangkat lunak. Triage manual menghabiskan waktu insinyur senior yang substansial, dan kesalahan rute memperpanjang siklus perbaikan, meningkatkan kedalaman antrean, serta menunda rilis. Makalah oleh Márk Lajkó, Balázs Nagy, dan László Vidács, yang dipresentasikan pada International Conference on Software and Data Technologies (SCDT 2026), membingkai masalah ini sebagai tugas klasifikasi teks terawasi: laporan bug adalah masukan, dan pengembang yang bertanggung jawab adalah labelnya. Para penulis memposisikan pekerjaan mereka di tengah lanskap yang berubah cepat di mana model bahasa besar (LLM) sering diasumsikan menggantikan *pipeline* rekayasa fitur klasik. Pertanyaan motivasi mereka sengaja bersifat empiris daripada arsitektural: di seluruh tolok ukur umum, apakah *encoder* transformer, *prompting* LLM terdepan, dan generasi yang diperkaya pengambilan (RAG) benar-benar mengungguli pembelajar istilah jarang yang disetel dengan baik untuk rekomendasi pengembang? Untuk menjawabnya, mereka menjalankan satu tolok ukur terkontrol pada dataset Eclipse, menjaga pembagian data tetap sambil menyapu keluarga model, strategi *embedding*, dan rezim *prompting*. Taksonomi pendekatan yang dibandingkan mencakup tiga generasi praktik: (i) fitur leksikal jarang dengan pengklasifikasi *gradient-boosted* atau probabilistik, (ii) representasi transformer padat yang digunakan baik beku atau disetel penuh, dan (iii) *pipeline* berpusat LLM dengan peningkatan pengambilan dan *prompting* beberapa contoh. Dengan melaporkan akurasi top-1 sebagai metrik utama, studi ini menghasilkan hasil utama yang berlawanan dengan intuisi: pendekatan klasik menang, tetapi hanya sedikit mengungguli *encoder* modern yang disetel penuh.
Studi ini disusun sebagai tolok ukur terkontrol pada dataset pelacakan isu Eclipse, dengan identitas pengembang sebagai kelas target dan teks laporan bug mentah sebagai prediktor. Kontribusi metodologis adalah luasnya cakupan model di bawah protokol evaluasi bersama.

Mengapa penting

Hasilnya mengundang pembacaan cermat tentang *mengapa* model leksikal jarang tetap kompetitif pada triage bug. Penugasan pengembang sangat bergantung pada bukti leksikal tingkat permukaan: nama komponen, pengidentifikasi *stack-trace*, jalur file, simbol API, dan jargon spesifik produk muncul hampir secara verbatim dalam laporan isu dan berulang di seluruh laporan historis yang ditugaskan kepada insinyur yang sama. TF-IDF menangkap sinyal ini dengan tepat dan tidak memerlukan adaptasi, sementara *encoder* padat yang dilatih pada korpus tujuan umum mengompres token langka berkapasitas tinggi tersebut menjadi *embedding* yang halus secara semantik tetapi tumpul secara leksikal. Penyetelan penuh sebagian mengembalikan keuntungan dengan mengkhususkan representasi ke kosakata Eclipse dan distribusi label, menjelaskan peningkatan besar dari 47,63% menjadi 72,49%, tetapi tidak sepenuhnya menutup kesenjangan dengan *ensemble* pohon *boosted*. Bahwa konkatenasi hibrida merugikan kinerja konsisten dengan pembacaan ini: setelah fitur leksikal kuat tersedia, vektor padat yang dikonkatenasi sebagian besar menduplikasi bukti yang ada sambil meningkatkan dimensionalitas dan tingkat kebisingan efektif untuk pembelajar pohon. Hasil RAG mengisolasi mode kegagalan yang berbeda. Karena generasi dikondisikan pada contoh yang diambil, batas atas *pipeline* ditentukan oleh apakah *retriever* menampilkan isu-isu yang sebelumnya ditangani oleh pengembang yang benar. Ketika pengambilan melewatkan tetangga tersebut, generator tidak dapat memulihkan label terlepas dari skala atau kualitas mengikuti instruksinya, itulah sebabnya kualitas pengambilan mendominasi angka 36,81%. Dekomposisi ini selaras dengan gambaran empiris yang lebih luas: hambatannya adalah representasi riwayat spesifik pengembang, bukan kefasihan model bahasa. Secara praktis, studi ini menentang penggantian *pipeline* jarang secara refleks dengan arsitektur berpusat LLM dalam alat pemeliharaan; opsi termurah, tercepat, dan paling dapat diinterpretasikan juga kebetulan yang paling akurat, dan tidak membebankan biaya waktu inferensi dari model berparameter miliaran.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…