Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Gagal-Cepat, Restart-Cerdas: Prediksi Kegagalan Dini dan Restart untuk Tugas Agentik SWE

Pengendali dua tahap yang memprediksi kegagalan lintasan dari prefiks yang teramati dan memulihkan melalui restart dengan kebijakan yang sama plus overlay diff repositori opsional
Chenyu Wang; Yunbo Lyu; Junda He; Zhou Yang; Chenxing Zhong; Yaniv Harel; David Loยท 2026ยท DOI 10.48550/arXiv.2608.03222

Masalah inti

Agen software engineering (SWE) menyelesaikan isu tingkat repositori melalui lintasan panjang yang biayanya bertambah seiring akumulasi konteks. Penulis mengamati bahwa eksekusi yang gagal cenderung lebih panjang dan menunjukkan eksplorasi berulang atau looping, yang mengindikasikan sebagian kegagalan dapat dideteksi sebelum lintasan selesai. Hal ini menimbulkan ketegangan: penghentian dini dapat menghentikan lintasan yang sebenarnya akan berhasil, sementara lintasan yang tidak berhasil mungkin masih menyimpan suntingan repositori berguna yang layak dipertahankan.

Untuk mengatasi hal ini, makalah ini menyajikan **FailFast-RestartSmart**, pengendali dua tahap untuk satu lintasan aktif. Tahap pertama, **FailFast**, adalah monitor ringan 0.6B yang dilatih dengan supervisi terminal dan dense fail-to-pass untuk memprediksi kegagalan dari prefiks yang teramati tanpa akses ke logit kebijakan atau hidden state. Tahap kedua, **RestartSmart**, dipicu saat alarm dan meluncurkan rollout baru dengan kebijakan yang sama tanpa riwayat prompt sebelumnya, menawarkan diff repositori yang terputus sebagai overlay opsional yang dapat diperiksa, diterapkan, atau dibuang oleh agen. Pertanyaan penelitia

Inovasi

Pada SWE-bench Verified, monitor FailFast yang dilatih hanya pada lintasan Qwen3.6-27B ditransfer ke tiga kebijakan lain, termasuk model closed-API. Pada target tingkat false-positive 5%, sistem menghemat **14,6%โ€“20,4%** token eksekusi. Khusus pada Qwen3.6-27B, penghematan 20,4% melampaui 12,5% yang dicapai adaptasi AgentStop per langkah milik penulis.

Pada target tingkat false-positive 25%, RestartSmart menaikkan resolusi Qwen3.6-27B dari **66,6% menjadi 71,8%**, sedangkan cold restart hanya mencapai **66,8%**. Selisih ini menunjukkan overlay diff repositori opsional berkontribusi secara berarti di luar sekadar memulai ulang dari nol.

Hasil transfer ini penting karena monitor tidak pernah mengamati logit kebijakan atau hidden state; ia hanya mengandalkan prefiks yang teramati. Hal ini mendukung klaim bahwa sinyal kegagalan hadir pada perilaku permukaan lintasan dan dapat dipelajari oleh model kecil yang menggeneralisasi lintas kebijakan.

Agen software engineering (SWE) menyelesaikan isu tingkat repositori melalui lintasan panjang yang biayanya bertambah seiring akumulasi konteks. Penulis mengamati bahwa eksekusi yang gagal cenderung lebih panjang dan menunjukkan eksplorasi berulang atau looping, yang mengindikasikan sebagian kegagalan dapat dideteksi sebelum lintasan selesai. Hal ini menimbulkan ketegangan: penghentian dini dapat menghentikan lintasan yang sebenarnya akan berhasil, sementara lintasan yang tidak berhasil mungkin masih menyimpan suntingan repositori berguna yang layak dipertahankan.
Untuk mengatasi hal ini, makalah ini menyajikan **FailFast-RestartSmart**, pengendali dua tahap untuk satu lintasan aktif. Tahap pertama, **FailFast**, adalah monitor ringan 0.6B yang dilatih dengan supervisi terminal dan dense fail-to-pass untuk memprediksi kegagalan dari prefiks yang teramati tanpa akses ke logit kebijakan atau hidden state. Tahap kedua, **RestartSmart**, dipicu saat alarm dan meluncurkan rollout baru dengan kebijakan yang sama tanpa riwayat prompt sebelumnya, menawarkan diff repositori yang terputus sebagai overlay opsional yang dapat diperiksa, diterapkan, atau dibuang oleh agen. Pertanyaan penelitian utamanya adalah apakah penghentian dini dapat dibuat aman dan menguntungkan bila dipasangkan dengan pemulihan sekuensial berkebijakan sama.

Mengapa penting

Hasil mendukung penghentian dini dengan pemulihan sekuensial berkebijakan sama. Dua pilihan desain tampak sentral. Pertama, ketergantungan monitor pada prefiks yang teramati alih-alih sinyal kebijakan internal memungkinkan transfer lintas kebijakan, termasuk ke model closed-API. Kedua, overlay diff opsional memungkinkan RestartSmart mempertahankan suntingan repositori berguna tanpa mewarisi konteks terakumulasi yang membuat lintasan awal mahal.

Perbandingan dengan cold restart memberi pelajaran: pada FPR 25%, cold restart mencapai resolusi 66,8% sementara RestartSmart mencapai 71,8%, yang mengindikasikan overlay bukan sekadar kemudahan melainkan kontributor substantif bagi kualitas pemulihan. Perbandingan dengan AgentStop per langkah menunjukkan monitor kegagalan khusus dapat mengungguli heuristik penghentian tingkat langkah dalam penghematan token.

Trade-off utamanya adalah tingkat false-positive. Pada FPR 5% sistem menghemat token tetapi tidak melaporkan kenaikan resolusi; pada FPR 25% sistem meningkatkan resolusi. Ini menyiratkan titik operasi yang dapat disetel bergantung pada apakah penerapan memprioritaskan biaya atau tingkat keberhasilan. Batasan mencakup evaluasi pada satu benchmark dan kebutuhan mengalibrasi ambang per kebijakan. Pekerjaan selanjutnya dapat mengeksplorasi ambang adaptif, pemulihan multi-lintasan, dan benchmark yang lebih luas.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ