Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

TriCalRAG: Tolok Ukur Tiga Strategi Berbasis Retrieval-Augmented untuk Analisis Akar Masalah Berbasis LLM On-Premise di AIOps

Mengevaluasi LLM berbobot terbuka yang dilayani secara lokal melalui vLLM terhadap DeepLog pada empat dataset log, dengan prompting zero-shot, few-shot, dan RAG
Rohit Patel; Susil Kumar Mohanty; Jeenal Chaudharyยท 2026ยท DOI 10.48550/arXiv.2609.14762

Masalah inti

Large language model (LLM) yang dihosting di cloud semakin banyak digunakan untuk analisis akar masalah (RCA) dalam pipeline AIOps, tetapi menghadirkan risiko privasi data, latensi jaringan, dan biaya per kueri yang memburuk seiring volume log produksi. Hal ini mendorong penerapan on-premise untuk LLM berbobot terbuka. TriCalRAG menjawab hal ini dengan menyediakan tolok ukur yang mengevaluasi LLM berbobot terbuka yang dilayani secara lokal melalui vLLM pada satu GPU workstation berkapasitas memori tinggi (NVIDIA RTX PRO 6000, 96GB) terhadap detektor anomali log klasik berbasis LSTM (DeepLog). Tolok ukur ini mencakup empat dataset log nyata yang tersedia publik: BGL, HDFS, Thunderbird, dan OpenStack. Studi ini mengevaluasi dua model berbobot terbuka (Qwen2.5-14B, Mistral-Small) dengan tiga strategi prompting: zero-shot, few-shot, dan retrieval-augmented generation (RAG) atas riwayat insiden berlabel. Metrik yang dilaporkan mencakup akurasi, precision/recall, dan dengan interval kepercayaan bootstrap 95% pada 3 random seed, bersama dengan throughput dan jejak VRAM. Pertanyaan penelitian utamanya adalah apakah RAG dapat meningkatkan akurasi sekaligus stabilitas kalibrasi untuk RCA

Inovasi

Hasilnya menunjukkan bahwa RAG tidak hanya meningkatkan rata-rata sebesar 0,10โ€“0,27 dibandingkan prompting zero-shot, tetapi yang lebih penting, secara substansial menstabilkan kalibrasi model. Prompting zero-shot mendorong kedua model ke perilaku yang hampir degeneratif, memprediksi "anomali" pada hingga 100% insiden di beberapa dataset. Sebaliknya, RAG menjaga tingkat prediksi positif tetap dekat dengan keseimbangan kelas sebenarnya pada mayoritas konfigurasi. Mistral-Small mencapai rata-rata makro yang lebih tinggi daripada Qwen2.5-14B (0,644 vs. 0,560) tetapi menunjukkan kegagalan kalibrasi pada lebih banyak konfigurasi (7 vs. 5 dari 12), sementara berjalan pada sekitar setengah throughput. Ini menunjukkan bahwa pilihan model yang lebih baik bergantung pada apakah penerapan memprioritaskan akurasi puncak atau perilaku yang dapat diprediksi di berbagai kondisi prompting. Ablasi menunjukkan bahwa batching meningkatkan throughput 41 kali pada satu kartu dan kuantisasi 4-bit mengurangi latensi sebesar 20% tanpa kehilangan akurasi yang terukur. Tabel berikut merangkum temuan utama:

| Model | Strategi | Rata-rata | Kegagalan Kalibrasi | Throughput (relatif) |
|-------|-----

Large language model (LLM) yang dihosting di cloud semakin banyak digunakan untuk analisis akar masalah (RCA) dalam pipeline AIOps, tetapi menghadirkan risiko privasi data, latensi jaringan, dan biaya per kueri yang memburuk seiring volume log produksi. Hal ini mendorong penerapan on-premise untuk LLM berbobot terbuka. TriCalRAG menjawab hal ini dengan menyediakan tolok ukur yang mengevaluasi LLM berbobot terbuka yang dilayani secara lokal melalui vLLM pada satu GPU workstation berkapasitas memori tinggi (NVIDIA RTX PRO 6000, 96GB) terhadap detektor anomali log klasik berbasis LSTM (DeepLog). Tolok ukur ini mencakup empat dataset log nyata yang tersedia publik: BGL, HDFS, Thunderbird, dan OpenStack. Studi ini mengevaluasi dua model berbobot terbuka (Qwen2.5-14B, Mistral-Small) dengan tiga strategi prompting: zero-shot, few-shot, dan retrieval-augmented generation (RAG) atas riwayat insiden berlabel. Metrik yang dilaporkan mencakup akurasi, precision/recall, dan dengan interval kepercayaan bootstrap 95% pada 3 random seed, bersama dengan throughput dan jejak VRAM. Pertanyaan penelitian utamanya adalah apakah RAG dapat meningkatkan akurasi sekaligus stabilitas kalibrasi untuk RCA berbasis LLM on-premise, dan bagaimana pilihan model berinteraksi dengan prioritas penerapan seperti akurasi puncak versus perilaku yang dapat diprediksi.
Tolok ukur TriCalRAG dirancang untuk membandingkan strategi prompting dan model secara sistematis dalam kondisi terkendali. Pengaturan eksperimen menggunakan satu GPU NVIDIA RTX PRO 6000 dengan memori 96GB, melayani model berbobot terbuka secara lokal melalui vLLM. Dua model dievaluasi: Qwen2.5-14B dan Mistral-Small. Tiga strategi prompting diterapkan: zero-shot, few-shot, dan retrieval-augmented generation (RAG) atas riwayat insiden berlabel. Strategi RAG mengambil insiden masa lalu yang serupa dari riwayat berlabel untuk memperkaya prompt. Baseline-nya adalah DeepLog, detektor anomali log klasik berbasis LSTM. Empat dataset log nyata yang tersedia publik digunakan: BGL, HDFS, Thunderbird, dan OpenStack. Metrik evaluasi mencakup akurasi, precision, recall, dan skor , dengan interval kepercayaan bootstrap 95% yang dihitung pada 3 random seed. Selain itu, throughput (kueri per detik) dan jejak VRAM diukur. Ablasi mempelajari pengaruh batching dan kuantisasi 4-bit terhadap throughput dan latensi. Harness tolok ukur, pembagian dataset, dan kode evaluasi dirilis untuk mendukung penelitian AIOps on-premise yang dapat direproduksi. Arsitektur keseluruhannya dapat direpresentasikan sebagai berikut:

Mengapa penting

Temuan ini menyoroti trade-off kritis dalam RCA berbasis LLM on-premise: meskipun Mistral-Small mencapai puncak yang lebih tinggi, tingkat kegagalan kalibrasinya yang lebih tinggi membuatnya kurang andal di berbagai kondisi prompting. Qwen2.5-14B, meskipun rata-ratanya lebih rendah, menunjukkan kalibrasi yang lebih stabil, sehingga mungkin lebih disukai untuk penerapan yang membutuhkan perilaku konsisten. Peningkatan substansial dalam stabilitas kalibrasi dengan RAG merupakan kontribusi kunci, karena meredam perilaku hampir degeneratif yang diamati pada prompting zero-shot. Hasil ablasi menunjukkan bahwa batching dan kuantisasi dapat meningkatkan throughput secara signifikan dan mengurangi latensi tanpa mengorbankan akurasi, membuat penerapan on-premise lebih layak. Namun, studi ini terbatas pada dua model dan empat dataset; penelitian selanjutnya harus mengeksplorasi rentang model dan jenis log yang lebih luas. Rilis harness tolok ukur dan kode evaluasi mendukung reproduktibilitas dan penelitian lebih lanjut. Secara keseluruhan, TriCalRAG menyediakan kerangka kerja yang ketat untuk mengevaluasi RCA berbasis LLM on-premise, menekankan pentingnya kalibrasi di samping akurasi. Trade-off antara akurasi dan stabilitas kalibrasi dapat diformalkan sebagai masalah optimisasi multi-objektif:

dengan dan memberi bobot pada kepentingan relatif akurasi dan kalibrasi, dan merepresentasikan konfigurasi model dan strategi prompting.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ