Editorial ilmu komputer
PatchBench: Mengevaluasi Agen AI untuk Penambalan Kerentanan
Masalah inti
Inovasi
Pada 11 agen mutakhir, termasuk tiga agen AIxCC teratas, validasi hanya-PoC yang asli menggelembungkan tingkat penyelesaian tugas penambalan agen sebesar 1,83 secara rata-rata. Ini berarti ketika tambalan divalidasi hanya dengan memeriksa apakah PoC masih memicu crash, agen tampak menyelesaikan 83% lebih banyak tugas daripada yang sebenarnya ketika kebenaran akar masalah disyaratkan. Hasil ini mengungkap keterbatasan utama agen penambalan saat ini. Secara spesifik:
- 25% tambalan agen menunjukkan kemiripan substansial dengan tambalan pengembang historis, yang menunjukkan penghafalan.
- Agen sering menambal pada jejak tumpukan crash untuk menekan crash, alih-alih memperbaiki akar masalah.
- Validasi hanya-PoC menggelembungkan tingkat penyelesaian sebesar 1,83 secara rata-rata.
Temuan ini berlaku pada beragam agen, termasuk agen dari kompetisi AIxCC, yang menunjukkan bahwa masalah ini bersifat sistemik. Tolok ukur ini menunjukkan bahwa praktik evaluasi saat ini tidak memadai untuk mengukur kemampuan perbaikan kerentanan yang sebenarnya.
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten memberโฆ