Editorial Ilmu Komputer & AI
Kerangka Kerja dan Tolok Ukur untuk Pengujian Agentic Berbasis Kode dalam Pengembangan Web
Masalah inti
Inovasi
Penulis mengevaluasi beberapa VLM arus utama pada tolok ukur CATTest menggunakan kerangka kerja CATJudge. Hasilnya menunjukkan bahwa semua model yang dievaluasi berkinerja buruk, dengan tingkat penemuan bug yang rendah. Misalnya, GPT-4V mencapai tingkat penemuan bug hanya 12,5%, sedangkan Claude 3 dan Gemini menemukan 9,8% dan 7,4% bug. Angka-angka ini jauh lebih rendah daripada kinerja manusia, yang mencapai 85,3% pada tolok ukur yang sama. Model-model tersebut terutama kesulitan dengan cacat halus yang memerlukan interaksi multi-langkah atau pemahaman perubahan keadaan yang kompleks. Penulis juga menganalisis jenis bug yang ditemukan dan menemukan bahwa model lebih baik dalam mengidentifikasi ketidakkonsistenan visual daripada kesalahan fungsional. Kinerja rendah ini menyoroti kesenjangan jelas antara kemampuan VLM saat ini dan tuntutan pengujian dunia nyata dalam pengembangan web AI. Tabel di bawah ini merangkum tingkat penemuan bug:
| Model | Bug Discovery Rate |
|-------|-------------------|
| GPT-4V | 12.5% |
| Claude 3 | 9.8% |
| Gemini | 7.4% |
| Human | 85.3% |
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten memberโฆ