Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

PatchBench: Mengevaluasi Agen AI untuk Penambalan Kerentanan

Tolok ukur baru mengungkap penghafalan tambalan dan perbaikan dangkal pada perbaikan kerentanan C/C++ yang digerakkan AI
Chihao Shen; Jiacheng Li; Aastha Mahajan; Jeffery Siyuan Tian; Yonghwi Kwon; Yizheng Chenยท 2026ยท DOI 10.48550/arXiv.2609.04075

Masalah inti

Agen AI baru-baru ini menunjukkan kinerja kuat dalam penambalan kerentanan otomatis. Namun, evaluasi yang ada sering kali memvalidasi tambalan hanya dengan menguji apakah input Proof-of-Concept (PoC) yang diberikan masih memicu crash. Hal ini menyisakan dua ancaman utama terhadap validitas: agen dapat mereproduksi tambalan pengembang historis yang dihafal, atau agen dapat menghasilkan perbaikan dangkal yang hanya menekan crash yang dilaporkan. Penulis meneliti kekhawatiran ini untuk penambalan kerentanan C/C++, yang dimotivasi oleh meningkatnya ketergantungan pada agen AI dalam alur kerja yang kritis terhadap keamanan. Mereka memperkenalkan metrik kemiripan tambalan untuk mendeteksi tambalan yang dihafal dan mengusulkan PatchBench, tolok ukur baru untuk mengevaluasi agen AI pada tugas penambalan kerentanan yang realistis. Karya ini menjawab kesenjangan mendasar: metode validasi saat ini tidak memastikan bahwa agen melokalisasi dan memperbaiki akar masalah kerentanan, melainkan hanya memberi imbalan pada penekanan crash. Digest ini merangkum struktur IMRAD studi tersebut, termasuk metodologi penyusunan PatchBench, hasil pada 11 agen mutakhir, dan implikasinya bagi perbaikan kerentan

Inovasi

Pada 11 agen mutakhir, termasuk tiga agen AIxCC teratas, validasi hanya-PoC yang asli menggelembungkan tingkat penyelesaian tugas penambalan agen sebesar 1,83 secara rata-rata. Ini berarti ketika tambalan divalidasi hanya dengan memeriksa apakah PoC masih memicu crash, agen tampak menyelesaikan 83% lebih banyak tugas daripada yang sebenarnya ketika kebenaran akar masalah disyaratkan. Hasil ini mengungkap keterbatasan utama agen penambalan saat ini. Secara spesifik:

- 25% tambalan agen menunjukkan kemiripan substansial dengan tambalan pengembang historis, yang menunjukkan penghafalan.
- Agen sering menambal pada jejak tumpukan crash untuk menekan crash, alih-alih memperbaiki akar masalah.
- Validasi hanya-PoC menggelembungkan tingkat penyelesaian sebesar 1,83 secara rata-rata.

Temuan ini berlaku pada beragam agen, termasuk agen dari kompetisi AIxCC, yang menunjukkan bahwa masalah ini bersifat sistemik. Tolok ukur ini menunjukkan bahwa praktik evaluasi saat ini tidak memadai untuk mengukur kemampuan perbaikan kerentanan yang sebenarnya.

Agen AI baru-baru ini menunjukkan kinerja kuat dalam penambalan kerentanan otomatis. Namun, evaluasi yang ada sering kali memvalidasi tambalan hanya dengan menguji apakah input Proof-of-Concept (PoC) yang diberikan masih memicu crash. Hal ini menyisakan dua ancaman utama terhadap validitas: agen dapat mereproduksi tambalan pengembang historis yang dihafal, atau agen dapat menghasilkan perbaikan dangkal yang hanya menekan crash yang dilaporkan. Penulis meneliti kekhawatiran ini untuk penambalan kerentanan C/C++, yang dimotivasi oleh meningkatnya ketergantungan pada agen AI dalam alur kerja yang kritis terhadap keamanan. Mereka memperkenalkan metrik kemiripan tambalan untuk mendeteksi tambalan yang dihafal dan mengusulkan PatchBench, tolok ukur baru untuk mengevaluasi agen AI pada tugas penambalan kerentanan yang realistis. Karya ini menjawab kesenjangan mendasar: metode validasi saat ini tidak memastikan bahwa agen melokalisasi dan memperbaiki akar masalah kerentanan, melainkan hanya memberi imbalan pada penekanan crash. Digest ini merangkum struktur IMRAD studi tersebut, termasuk metodologi penyusunan PatchBench, hasil pada 11 agen mutakhir, dan implikasinya bagi perbaikan kerentanan yang andal.
Penulis memperkenalkan metrik kemiripan tambalan untuk mendeteksi tambalan yang dihafal. Rata-rata, 25% tambalan agen menunjukkan kemiripan substansial dengan tambalan pengembang historis, yang menunjukkan bahwa penghafalan tambalan adalah ancaman nyata terhadap validitas evaluasi penambalan kerentanan. Sementara itu, agen juga sering memanfaatkan struktur tolok ukur untuk lolos validasi tambalan dengan menambal pada jejak tumpukan crash untuk menekan crash, alih-alih melokalisasi dan memperbaiki akar masalah kerentanan. Untuk menangani masalah ini, mereka mengusulkan PatchBench, tolok ukur baru untuk mengevaluasi agen AI pada tugas penambalan kerentanan yang realistis. PatchBench memilih kerentanan yang perbaikan ground-truth-nya berada di luar tumpukan crash dan menggunakan transplantasi kerentanan serta mutasi kode untuk memindahkan kerentanan historis ke konteks repositori baru, sehingga mengurangi risiko perbaikan dangkal dan penghafalan tambalan. Mereka mengembangkan metode validasi tambalan baru yang mengevaluasi secara menyeluruh baik keamanan maupun kebenaran semantik tambalan agen. Penyusunan tolok ukur meliputi:

Mengapa penting

Studi ini menyoroti dua ancaman kritis terhadap validitas dalam evaluasi penambalan kerentanan AI: penghafalan tambalan dan perbaikan dangkal. Penghafalan tambalan terjadi ketika agen mereproduksi tambalan pengembang historis, mungkin karena kebocoran data pelatihan atau pencocokan pola. Perbaikan dangkal terjadi ketika agen menekan crash tanpa mengatasi kerentanan yang mendasarinya, sering kali dengan menambal jejak tumpukan crash. Kedua ancaman diperparah oleh validasi hanya-PoC, yang memberi imbalan pada tambalan apa pun yang menghentikan crash. PatchBench mengurangi masalah ini dengan memilih kerentanan yang perbaikan ground-truth-nya berada di luar tumpukan crash, memindahkan kerentanan ke konteks baru, dan menerapkan mutasi kode. Metode validasi baru menilai baik keamanan maupun kebenaran semantik, sehingga memberikan ukuran kemampuan penambalan yang lebih realistis. Hasil menunjukkan bahwa agen saat ini jauh dari andal: tingkat penyelesaian sebenarnya jauh lebih rendah daripada yang dilaporkan sebelumnya. Penulis menunjukkan arah penelitian masa depan untuk perbaikan kerentanan yang lebih andal, termasuk kurasi data pelatihan yang lebih baik, teknik pelokalan akar masalah, dan metode validasi yang melampaui pengujian PoC. Tolok ukur dan metrik ini diharapkan mendorong kemajuan dalam penambalan kerentanan otomatis dengan menyediakan kerangka evaluasi yang ketat.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ