Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

Audit Keandalan Berbasis Pengujian untuk Prediksi Hasil Awal Berbasis Trajektori pada Agen LLM: Transfer Kalibrasi Spesifik Target Bertahan dalam Satu Benchmark

Audit kalibrasi leave-one-agent-out menunjukkan bahwa kegagalan transfer kalibrasi tidak luas tetapi terkonsentrasi pada kombinasi agen target/head tertentu, tanpa replikasi lintas benchmark yang terbukti.
YanZe Caoยท 2026ยท DOI 10.48550/arXiv.2609.25647

Masalah inti

Prediksi hasil awal dari trajektori agen dapat menurunkan biaya evaluasi dengan menghentikan proses begitu hasilnya cukup dapat diprediksi, asalkan keyakinan prediktor terkalibrasi dengan baik. Kalibrasi terancam ketika prediktor diterapkan pada agen yang tidak pernah menjadi data latihnya, namun masih belum jelas apakah kegagalan transfer semacam itu tersebar luas di seluruh sistem agen atau terkonsentrasi pada kombinasi agen target/head tertentu. Penelitian ini melakukan audit keandalan berbasis pengujian menggunakan trajektori SWE-bench Verified publik dan pipeline prediksi hasil awal dual-head yang dibekukan. Hipotesis utamanya adalah galat transfer kalibrasi mungkin bersifat spesifik target alih-alih luas, dan galat tersebut mungkin tidak tereplikasi lintas benchmark. Studi ini memakai audit kalibrasi leave-one-agent-out, kontrol leave-two-agents-out dengan prediktor bersama, koreksi prior oracle, dan baterai ketangguhan atas kohort pelatihan, resampling tugas, separuh tugas, jackknife, serta ambang batas. Analisis TerminalBench dengan scaffold tetap berfungsi sebagai uji batas yang telah diregistrasi sebelumnya untuk menilai replikasi lintas benchmark.

Inovasi

Heterogenitas berpasangan prediktor-sama yang luas tidak didukung. Median perbedaan corrected-gap berpasangan adalah 0.0180 untuk head SUCCESS (45 pasangan) dan 0.0385 untuk head FAILURE (35 pasangan). Kriteria heterogenitas yang telah diregistrasi sebelumnya tidak terpenuhi pada kedua head, yang menunjukkan bahwa galat transfer kalibrasi tidak tersebar luas di seluruh pasangan agen. Namun, dua kombinasi spesifik menunjukkan galat transfer kalibrasi yang bertahan: gpt-5-mini/SUCCESS dan claude-opus-4.6/FAILURE, dengan median corrected gap masing-masing 0.1377 dan 0.1107. Galat ini tidak menunjukkan pembalikan tanda pada kontrol yang dibekukan mana pun, termasuk kontrol leave-two-agents-out dan koreksi prior oracle. Baterai ketangguhan mengonfirmasi persistensi galat spesifik target ini pada kohort pelatihan, resampling tugas, separuh tugas, jackknife, dan ambang batas. Pada uji batas TerminalBench, target keberhasilan menghasilkan nol keputusan (INDETERMINATE), dan target kegagalan tidak memenuhi kriteria persistensi yang telah diregistrasi sebelumnya, sehingga gagal membuktikan replikasi lintas benchmark. Diagram Mermaid berikut merangkum alur audit:
Prediksi hasil awal dari trajektori agen dapat menurunkan biaya evaluasi dengan menghentikan proses begitu hasilnya cukup dapat diprediksi, asalkan keyakinan prediktor terkalibrasi dengan baik. Kalibrasi terancam ketika prediktor diterapkan pada agen yang tidak pernah menjadi data latihnya, namun masih belum jelas apakah kegagalan transfer semacam itu tersebar luas di seluruh sistem agen atau terkonsentrasi pada kombinasi agen target/head tertentu. Penelitian ini melakukan audit keandalan berbasis pengujian menggunakan trajektori SWE-bench Verified publik dan pipeline prediksi hasil awal dual-head yang dibekukan. Hipotesis utamanya adalah galat transfer kalibrasi mungkin bersifat spesifik target alih-alih luas, dan galat tersebut mungkin tidak tereplikasi lintas benchmark. Studi ini memakai audit kalibrasi leave-one-agent-out, kontrol leave-two-agents-out dengan prediktor bersama, koreksi prior oracle, dan baterai ketangguhan atas kohort pelatihan, resampling tugas, separuh tugas, jackknife, serta ambang batas. Analisis TerminalBench dengan scaffold tetap berfungsi sebagai uji batas yang telah diregistrasi sebelumnya untuk menilai replikasi lintas benchmark.

Audit ini memanfaatkan trajektori SWE-bench Verified publik dan pipeline prediksi hasil awal dual-head yang dibekukan, yang mengeluarkan prediksi terpisah untuk hasil SUCCESS dan FAILURE. Analisis utamanya adalah audit kalibrasi leave-one-agent-out: untuk setiap agen target, prediktor dilatih pada semua agen lain dan dievaluasi pada agen yang disisihkan. Untuk mengendalikan efek prediktor bersama, kontrol leave-two-agents-out juga dilakukan. Koreksi prior oracle menyesuaikan perbedaan laju dasar. Baterai ketangguhan menguji kestabilan temuan pada variasi kohort pelatihan, resampling tugas, separuh tugas, resampling jackknife, dan ambang keputusan. Kriteria heterogenitas yang telah diregistrasi sebelumnya menilai apakah perbedaan corrected-gap berpasangan tersebar luas. Selain itu, analisis TerminalBench dengan scaffold tetap berfungsi sebagai uji batas untuk replikasi lintas benchmark. Metrik kuncinya adalah corrected gap, yang didefinisikan sebagai selisih antara keyakinan prediksi dan akurasi teramati, dengan galat transfer kalibrasi ditandai oleh gap tak nol yang bertahan. Secara formal, untuk agen target dan head

, corrected gap adalah
, dengan
adalah probabilitas prediksi dan adalah hasil sebenarnya. Audit menilai apakah berbeda secara signifikan dari nol setelah koreksi.

Mengapa penting

Temuan ini menunjukkan bahwa galat transfer kalibrasi spesifik target yang kuat dapat ada dalam satu lingkungan yang dibekukan, tetapi bukti tersebut tidak membuktikan bahwa galat itu intrinsik pada model atau umum lintas benchmark. Tidak adanya heterogenitas luas menunjukkan bahwa kegagalan transfer kalibrasi bukan sifat universal prediktor, melainkan terkonsentrasi pada kombinasi agen/head tertentu. Galat yang bertahan untuk gpt-5-mini/SUCCESS dan claude-opus-4.6/FAILURE menunjukkan bahwa target tertentu mungkin memerlukan kalibrasi yang disesuaikan atau data pelatihan tambahan. Kegagalan replikasi pada TerminalBench menyoroti pentingnya validasi spesifik benchmark dan memperingatkan agar tidak mengasumsikan generalisasi lintas benchmark. Uji batas yang telah diregistrasi sebelumnya menghasilkan hasil INDETERMINATE untuk target keberhasilan, artinya tidak ada keputusan yang dibuat, dan target kegagalan tidak memenuhi kriteria persistensi. Hal ini menegaskan perlunya penelitian lebih lanjut untuk menentukan apakah galat semacam itu intrinsik pada model atau muncul dari faktor spesifik lingkungan. Secara praktis, hasil ini menyiratkan bahwa pipeline prediksi hasil awal harus diaudit per agen target dan head, dan transfer kalibrasi tidak boleh diasumsikan tanpa pengujian eksplisit. Batasan studi ini mencakup penggunaan satu benchmark untuk audit utama dan sifat prediktor yang dibekukan, yang mungkin tidak mencerminkan model yang dilatih ulang. Penelitian selanjutnya harus mengeksplorasi replikasi lintas benchmark dengan kumpulan agen yang lebih besar dan lebih beragam.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ