Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

Verifikasi Neuro-Formal: Penalaran Program Formal yang Agnostik Bahasa dan Berbasis Agen

Membawa pembuktian yang diperiksa mesin ke bahasa arus utama melalui agen pengodean AI dan transformasi bertahap yang buta tujuan
Shuvendu K. Lahiriยท 2026ยท DOI 10.48550/arXiv.2608.21516

Masalah inti

Verifikasi formal menawarkan jaminan kebenaran terkuat untuk perangkat lunak, dan bahasa yang sadar verifikasi dapat menghasilkan pembuktian yang sound dan diperiksa mesin. Agen pengodean AI terkini telah menurunkan biaya penyusunan pembuktian semacam itu secara tajam. Namun hanya sedikit pengembang arus utama yang merasakan manfaatnya: sebagian besar memakai bahasa tanpa dukungan verifikasi formal, dan pemformalan properti serta pemodelan lingkungan eksekusi menuntut keahlian metode formal. Akibatnya, pembuktian tetap terbatas pada segelintir artefak ternama, sementara perangkat lunak produksi dibuktikan terutama melalui tinjauan dan pengujian.

Makalah ini memperkenalkan **verifikasi neuro-formal (NFV)**, yang membawa otomatisasi ini ke bahasa arus utama. Gagasan intinya adalah membuat agen pengodean AI memformalkan masalah verifikasi tingkat sumber menjadi kewajiban pembuktian dalam bahasa yang sadar verifikasi, yang kemudian diselesaikan oleh verifier sound yang mapan dengan bantuan pencarian pembuktian berbasis agen. NFV bertujuan membuat verifikasi formal dapat diakses oleh pengembang yang memakai bahasa seperti Python, tanpa menuntut keahlian mendalam dalam metode formal.

T

Inovasi

Penulis menjalankan eksperimen dengan model frontier terkini pada dataset berimbang berisi solusi Python yang benar dan yang cacat. Dataset dirancang untuk menguji kemampuan membuktikan program yang benar sekaligus menemukan contoh penyangkal untuk program yang cacat.

Hasil utama:

- **NFV dengan Dafny** menyelesaikan 57% dari seluruh entri secara benar, dengan presisi 92% di antara putusannya. Artinya, ketika menghasilkan putusan (pembuktian atau contoh penyangkal), putusan itu benar 92% dari waktu.
- **NFV dengan backend CBMC** menghasilkan contoh penyangkal untuk 63% program cacat, pada presisi 90%. Ini menunjukkan efektivitas dalam penemuan bug.
- **Baseline LLM-as-judge** hanya mencapai presisi 72% sambil menjawab setiap entri tanpa artefak yang dapat diperiksa. Ini menegaskan nilai bukti yang diperiksa mesin.
- **Kombinasi agen-verifier tanpa tahapan** membuktikan 98% dari program yang benar maupun yang diketahui cacat, dengan presisi hanya 50%. Ini menunjukkan bahwa tanpa tahapan, agen cenderung menghasilkan pemformalan yang terlalu permisif, sehingga memunculkan pembuktian yang tidak sound.

Hasil ini menegaskan bahwa pembuktian maupun tahapan sama-sama menguntungkan penal

Verifikasi formal menawarkan jaminan kebenaran terkuat untuk perangkat lunak, dan bahasa yang sadar verifikasi dapat menghasilkan pembuktian yang sound dan diperiksa mesin. Agen pengodean AI terkini telah menurunkan biaya penyusunan pembuktian semacam itu secara tajam. Namun hanya sedikit pengembang arus utama yang merasakan manfaatnya: sebagian besar memakai bahasa tanpa dukungan verifikasi formal, dan pemformalan properti serta pemodelan lingkungan eksekusi menuntut keahlian metode formal. Akibatnya, pembuktian tetap terbatas pada segelintir artefak ternama, sementara perangkat lunak produksi dibuktikan terutama melalui tinjauan dan pengujian.
Makalah ini memperkenalkan **verifikasi neuro-formal (NFV)**, yang membawa otomatisasi ini ke bahasa arus utama. Gagasan intinya adalah membuat agen pengodean AI memformalkan masalah verifikasi tingkat sumber menjadi kewajiban pembuktian dalam bahasa yang sadar verifikasi, yang kemudian diselesaikan oleh verifier sound yang mapan dengan bantuan pencarian pembuktian berbasis agen. NFV bertujuan membuat verifikasi formal dapat diakses oleh pengembang yang memakai bahasa seperti Python, tanpa menuntut keahlian mendalam dalam metode formal.

Mengapa penting

Hasil menunjukkan bahwa verifikasi neuro-formal dapat membawa verifikasi formal ke bahasa arus utama dengan memanfaatkan agen pengodean AI. Wawasan kuncinya adalah bahwa meskipun langkah pemformalan tidak sound, penggunaan bukti yang diperiksa mesin dan transformasi bertahap menghasilkan akurasi empiris yang tinggi. Pertukaran ini dapat diterima untuk banyak skenario praktis di mana biaya keahlian metode formal terlalu mahal.

Perbandingan dengan baseline LLM-as-judge sangat mencolok: meskipun LLM-as-judge menjawab setiap entri, presisinya hanya 72%, dan ia tidak menyediakan artefak yang dapat diperiksa. Sebaliknya, NFV dengan Dafny mencapai presisi 92%, artinya putusannya jauh lebih dapat dipercaya. Kombinasi agen-verifier tanpa tahapan, yang membuktikan 98% program benar maupun cacat, menggambarkan bahaya membiarkan agen melihat tujuan pembuktian selama pemformalan: agen dapat dengan mudah menghasilkan pemformalan yang tidak setia pada sumber, sehingga memunculkan pembuktian yang tidak sound. Tahapan meredam hal ini dengan memaksa agen berkomitmen pada suatu pemformalan sebelum mengetahui tujuannya.

Pendekatan ini agnostik bahasa dalam arti bahasa sumbernya dapat berupa bahasa arus utama apa pun, asalkan agen AI dapat memformalkannya ke bahasa yang sadar verifikasi. Pilihan verifier backend (Dafny, CBMC) memengaruhi jenis putusan: Dafny lebih umum dan dapat membuktikan kebenaran, sedangkan CBMC dikhususkan untuk penemuan bug melalui bounded model checking. Penulis mencatat bahwa NFV mengoptimalkan akurasi empiris alih-alih kesoundan ujung ke ujung, yang merupakan pilihan desain sengaja agar pendekatan ini praktis.

Pekerjaan mendatang dapat mengeksplorasi perbaikan langkah pemformalan, integrasi lebih banyak verifier, dan perluasan ke properti serta bahasa lain. Kandidat taksonomi (Architecture, Cybersecurity, Network, Cryptography) menunjukkan domain aplikasi potensial di mana verifikasi formal sangat kritis. Misalnya, dalam kriptografi, pembuktian tidak adanya kebocoran side-channel atau kebenaran fungsional protokol dapat memperoleh manfaat dari NFV. Dalam keamanan siber, verifikasi kebijakan kontrol akses atau keamanan memori dapat diotomatiskan. Pendekatan ini juga dapat diterapkan pada verifikasi protokol jaringan.

Singkatnya, NFV merupakan langkah menjanjikan menuju demokratisasi verifikasi formal dengan menggabungkan kekuatan agen AI dan verifier sound, sembari mengelola risiko salah pemformalan secara hati-hati melalui tahapan dan bukti yang diperiksa mesin.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ