Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Kerangka Kerja dan Tolok Ukur untuk Pengujian Agentic Berbasis Kode dalam Pengembangan Web

CATJudge dan CATTest: Paradigma Baru untuk Penemuan Bug Otonom pada Aplikasi Web yang Dihasilkan AI
Bin Hong; Zhenchao Zhang; Jiyuan He; Kai Zhang; Zhenya Huangยท 2026ยท DOI 10.48550/arXiv.2609.00081

Masalah inti

Pengujian GUI end-to-end penting untuk memverifikasi aplikasi web, namun evaluasi yang ada bergantung pada daftar periksa yang telah ditentukan dan terbatas pada data serta kerangka kerja tolok ukur generasi web. Hal ini membuat kemampuan penemuan bug dari vision-language model (VLM) tidak teruji secara sistematis. Penulis berargumen bahwa metode evaluasi saat ini tidak cukup menilai seberapa baik VLM dapat menjelajahi dan mengidentifikasi bug pada aplikasi web secara otonom, terutama yang dihasilkan oleh AI. Untuk mengatasi kesenjangan ini, mereka memperkenalkan Code-driven Agentic Testing (CAT), sebuah paradigma ketika agen menulis kode Playwright untuk mengendalikan browser, mengumpulkan umpan balik, dan menjelajahi aplikasi web secara otonom untuk menemukan bug. Pendekatan ini beralih dari pengujian berbasis daftar periksa ke eksplorasi otonom berbasis kode, dengan tujuan lebih mencerminkan skenario pengujian dunia nyata. Makalah ini menyajikan CATJudge, sebuah kerangka kerja agentic yang menyatukan alat Browser-Use dan Computer-Use dalam satu lingkungan, serta CATTest, tolok ukur berisi 102 aplikasi web yang dihasilkan AI dengan bug yang dianotasi secara cermat, dibangun melal

Inovasi

Penulis mengevaluasi beberapa VLM arus utama pada tolok ukur CATTest menggunakan kerangka kerja CATJudge. Hasilnya menunjukkan bahwa semua model yang dievaluasi berkinerja buruk, dengan tingkat penemuan bug yang rendah. Misalnya, GPT-4V mencapai tingkat penemuan bug hanya 12,5%, sedangkan Claude 3 dan Gemini menemukan 9,8% dan 7,4% bug. Angka-angka ini jauh lebih rendah daripada kinerja manusia, yang mencapai 85,3% pada tolok ukur yang sama. Model-model tersebut terutama kesulitan dengan cacat halus yang memerlukan interaksi multi-langkah atau pemahaman perubahan keadaan yang kompleks. Penulis juga menganalisis jenis bug yang ditemukan dan menemukan bahwa model lebih baik dalam mengidentifikasi ketidakkonsistenan visual daripada kesalahan fungsional. Kinerja rendah ini menyoroti kesenjangan jelas antara kemampuan VLM saat ini dan tuntutan pengujian dunia nyata dalam pengembangan web AI. Tabel di bawah ini merangkum tingkat penemuan bug:

| Model | Bug Discovery Rate |
|-------|-------------------|
| GPT-4V | 12.5% |
| Claude 3 | 9.8% |
| Gemini | 7.4% |
| Human | 85.3% |

Pengujian GUI end-to-end penting untuk memverifikasi aplikasi web, namun evaluasi yang ada bergantung pada daftar periksa yang telah ditentukan dan terbatas pada data serta kerangka kerja tolok ukur generasi web. Hal ini membuat kemampuan penemuan bug dari vision-language model (VLM) tidak teruji secara sistematis. Penulis berargumen bahwa metode evaluasi saat ini tidak cukup menilai seberapa baik VLM dapat menjelajahi dan mengidentifikasi bug pada aplikasi web secara otonom, terutama yang dihasilkan oleh AI. Untuk mengatasi kesenjangan ini, mereka memperkenalkan Code-driven Agentic Testing (CAT), sebuah paradigma ketika agen menulis kode Playwright untuk mengendalikan browser, mengumpulkan umpan balik, dan menjelajahi aplikasi web secara otonom untuk menemukan bug. Pendekatan ini beralih dari pengujian berbasis daftar periksa ke eksplorasi otonom berbasis kode, dengan tujuan lebih mencerminkan skenario pengujian dunia nyata. Makalah ini menyajikan CATJudge, sebuah kerangka kerja agentic yang menyatukan alat Browser-Use dan Computer-Use dalam satu lingkungan, serta CATTest, tolok ukur berisi 102 aplikasi web yang dihasilkan AI dengan bug yang dianotasi secara cermat, dibangun melalui kolaborasi erat manusia-AI agar menampilkan interaksi kompleks dan cacat halus. Eksperimen dengan VLM arus utama menunjukkan bahwa semua model yang dievaluasi berkinerja buruk, mengungkap kesenjangan jelas antara kemampuan VLM saat ini dan tuntutan pengujian dunia nyata dalam pengembangan web AI.
Paradigma CAT diinstansiasi melalui dua komponen utama: CATJudge dan CATTest. CATJudge adalah kerangka kerja agentic yang memungkinkan agen menulis kode Playwright untuk berinteraksi dengan aplikasi web. Kerangka ini menyatukan alat Browser-Use dan Computer-Use dalam satu lingkungan, memungkinkan agen melakukan tindakan seperti mengklik, mengetik, dan menavigasi, sekaligus menangkap tangkapan layar dan informasi DOM. Agen beroperasi dalam satu loop: ia mengamati keadaan saat ini, memutuskan tindakan, menjalankannya melalui kode Playwright, dan mengumpulkan umpan balik untuk menginformasikan tindakan berikutnya. Eksplorasi otonom ini bertujuan menemukan bug tanpa daftar periksa yang telah ditentukan.

Mengapa penting

Kinerja buruk VLM pada CATTest mengungkap keterbatasan mendasar dalam kemampuan mereka menguji aplikasi web secara otonom. Penulis mengaitkan hal ini dengan beberapa faktor: (1) VLM kurang memiliki penalaran yang kuat tentang kode dan keadaan, sehingga sulit menghasilkan skrip Playwright yang efektif; (2) mereka kesulitan dengan perencanaan dan eksplorasi jangka panjang, sering terjebak dalam tindakan berulang; dan (3) mereka sulit menafsirkan umpan balik dari browser, seperti pesan kesalahan atau isyarat visual. Paradigma CAT, meskipun menjanjikan, saat ini sangat bergantung pada kemampuan VLM, yang belum cukup untuk tugas pengujian kompleks. Penulis menyarankan agar pekerjaan mendatang berfokus pada peningkatan kemampuan generasi kode dan penalaran VLM, serta mengembangkan arsitektur agen yang lebih canggih yang dapat lebih memanfaatkan umpan balik. Mereka juga mencatat bahwa CATTest menyediakan tolok ukur yang menantang untuk mengukur kemajuan di bidang ini. Makalah ini menyimpulkan bahwa pengujian agentic berbasis kode adalah arah yang menjanjikan untuk mengotomatiskan pengujian web, tetapi kemajuan signifikan dalam teknologi VLM diperlukan agar praktis. Penulis merilis kode dan data mereka di https://github.com/SleepyWithoutCoffee/CATJudge.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ