Editorial Ilmu Komputer & AI
TriCalRAG: Tolok Ukur Tiga Strategi Berbasis Retrieval-Augmented untuk Analisis Akar Masalah Berbasis LLM On-Premise di AIOps
Masalah inti
Inovasi
Hasilnya menunjukkan bahwa RAG tidak hanya meningkatkan rata-rata sebesar 0,10โ0,27 dibandingkan prompting zero-shot, tetapi yang lebih penting, secara substansial menstabilkan kalibrasi model. Prompting zero-shot mendorong kedua model ke perilaku yang hampir degeneratif, memprediksi "anomali" pada hingga 100% insiden di beberapa dataset. Sebaliknya, RAG menjaga tingkat prediksi positif tetap dekat dengan keseimbangan kelas sebenarnya pada mayoritas konfigurasi. Mistral-Small mencapai rata-rata makro yang lebih tinggi daripada Qwen2.5-14B (0,644 vs. 0,560) tetapi menunjukkan kegagalan kalibrasi pada lebih banyak konfigurasi (7 vs. 5 dari 12), sementara berjalan pada sekitar setengah throughput. Ini menunjukkan bahwa pilihan model yang lebih baik bergantung pada apakah penerapan memprioritaskan akurasi puncak atau perilaku yang dapat diprediksi di berbagai kondisi prompting. Ablasi menunjukkan bahwa batching meningkatkan throughput 41 kali pada satu kartu dan kuantisasi 4-bit mengurangi latensi sebesar 20% tanpa kehilangan akurasi yang terukur. Tabel berikut merangkum temuan utama:
| Model | Strategi | Rata-rata | Kegagalan Kalibrasi | Throughput (relatif) |
|-------|-----
Mengapa penting
Temuan ini menyoroti trade-off kritis dalam RCA berbasis LLM on-premise: meskipun Mistral-Small mencapai puncak yang lebih tinggi, tingkat kegagalan kalibrasinya yang lebih tinggi membuatnya kurang andal di berbagai kondisi prompting. Qwen2.5-14B, meskipun rata-ratanya lebih rendah, menunjukkan kalibrasi yang lebih stabil, sehingga mungkin lebih disukai untuk penerapan yang membutuhkan perilaku konsisten. Peningkatan substansial dalam stabilitas kalibrasi dengan RAG merupakan kontribusi kunci, karena meredam perilaku hampir degeneratif yang diamati pada prompting zero-shot. Hasil ablasi menunjukkan bahwa batching dan kuantisasi dapat meningkatkan throughput secara signifikan dan mengurangi latensi tanpa mengorbankan akurasi, membuat penerapan on-premise lebih layak. Namun, studi ini terbatas pada dua model dan empat dataset; penelitian selanjutnya harus mengeksplorasi rentang model dan jenis log yang lebih luas. Rilis harness tolok ukur dan kode evaluasi mendukung reproduktibilitas dan penelitian lebih lanjut. Secara keseluruhan, TriCalRAG menyediakan kerangka kerja yang ketat untuk mengevaluasi RCA berbasis LLM on-premise, menekankan pentingnya kalibrasi di samping akurasi. Trade-off antara akurasi dan stabilitas kalibrasi dapat diformalkan sebagai masalah optimisasi multi-objektif:
dengan dan memberi bobot pada kepentingan relatif akurasi dan kalibrasi, dan merepresentasikan konfigurasi model dan strategi prompting.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ