Editorial ilmu komputer
Audit Keandalan Berbasis Pengujian untuk Prediksi Hasil Awal Berbasis Trajektori pada Agen LLM: Transfer Kalibrasi Spesifik Target Bertahan dalam Satu Benchmark
Masalah inti
Inovasi
Audit ini memanfaatkan trajektori SWE-bench Verified publik dan pipeline prediksi hasil awal dual-head yang dibekukan, yang mengeluarkan prediksi terpisah untuk hasil SUCCESS dan FAILURE. Analisis utamanya adalah audit kalibrasi leave-one-agent-out: untuk setiap agen target, prediktor dilatih pada semua agen lain dan dievaluasi pada agen yang disisihkan. Untuk mengendalikan efek prediktor bersama, kontrol leave-two-agents-out juga dilakukan. Koreksi prior oracle menyesuaikan perbedaan laju dasar. Baterai ketangguhan menguji kestabilan temuan pada variasi kohort pelatihan, resampling tugas, separuh tugas, resampling jackknife, dan ambang keputusan. Kriteria heterogenitas yang telah diregistrasi sebelumnya menilai apakah perbedaan corrected-gap berpasangan tersebar luas. Selain itu, analisis TerminalBench dengan scaffold tetap berfungsi sebagai uji batas untuk replikasi lintas benchmark. Metrik kuncinya adalah corrected gap, yang didefinisikan sebagai selisih antara keyakinan prediksi dan akurasi teramati, dengan galat transfer kalibrasi ditandai oleh gap tak nol yang bertahan. Secara formal, untuk agen target dan head
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten memberโฆ