Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

LiveEvalBench: Menuju Evaluasi Open-World untuk Generasi Web

Kerangka agentic, adaptif, dan extensible yang merumuskan ulang evaluasi generasi web sebagai alur kerja tinjauan kolaboratif.
Yiyao Wang; Zhen Wen; Yinghao Tang; Yixiao Fu; Lin Yuan; Xiaolau Zhang; Jun Zhou; Wei Chenยท 2026ยท DOI 10.48550/arXiv.2608.03689

Masalah inti

Large language models (LLMs) semakin mampu menyintesis proyek frontend yang dapat dieksekusi, namun benchmark yang ada masih memperlakukan generasi web sebagai masalah evaluasi statis. Penulis berargumen bahwa artefak frontend menuntut paradigma yang berbeda karena tiga alasan: artefak tersebut interaktif dan bukan statis, menerima implementasi yang beragam namun sama-sama valid, serta berkembang lebih cepat daripada yang dapat diakomodasi oleh pipeline yang kaku.

Kesenjangan ini memotivasi **LiveEvalBench**, sebuah framework otomatis yang merumuskan ulang evaluasi generasi web sebagai proses yang *agentic, adaptif, dan extensible*. Alih-alih menilai artefak yang dibekukan terhadap rubrik tetap, LiveEvalBench mewujudkan evaluasi sebagai alur kerja tinjauan kolaboratif di mana peran-peran evaluator khusus mengumpulkan bukti di sepanjang siklus hidup penuh sebuah proyek frontend.

Makalah ini memosisikan hal tersebut sebagai pergeseran menuju evaluasi *open-world*: benchmark harus tetap valid ketika framework, library, dan konvensi desain berubah, dan harus menerima berbagai solusi yang benar untuk spesifikasi yang sama.

Inovasi

Penulis melaporkan eksperimen pada beragam skenario generasi web dunia nyata. Dua temuan utama dinyatakan:

1. **Keselarasan dengan penilaian pakar manusia** โ€” LiveEvalBench selaras erat dengan penilaian pakar manusia, yang mengindikasikan bahwa alur kerja tinjauan agentic menangkap sinyal kualitas yang juga dikenali oleh peninjau manusia.
2. **Wawasan terperinci** โ€” framework ini memberikan wawasan terperinci tentang kemampuan generasi web model-model frontier, alih-alih memadatkan kinerja menjadi satu skor yang tidak transparan.

Makalah ini tidak melaporkan skor numerik spesifik, nama model, atau ukuran dataset dalam abstrak; bukti yang dilaporkan bersifat kualitatif dan komparatif. Kode tersedia di repositori proyek yang tercantum pada sumber.

Large language models (LLMs) semakin mampu menyintesis proyek frontend yang dapat dieksekusi, namun benchmark yang ada masih memperlakukan generasi web sebagai masalah evaluasi statis. Penulis berargumen bahwa artefak frontend menuntut paradigma yang berbeda karena tiga alasan: artefak tersebut interaktif dan bukan statis, menerima implementasi yang beragam namun sama-sama valid, serta berkembang lebih cepat daripada yang dapat diakomodasi oleh pipeline yang kaku.
Kesenjangan ini memotivasi **LiveEvalBench**, sebuah framework otomatis yang merumuskan ulang evaluasi generasi web sebagai proses yang *agentic, adaptif, dan extensible*. Alih-alih menilai artefak yang dibekukan terhadap rubrik tetap, LiveEvalBench mewujudkan evaluasi sebagai alur kerja tinjauan kolaboratif di mana peran-peran evaluator khusus mengumpulkan bukti di sepanjang siklus hidup penuh sebuah proyek frontend.

Mengapa penting

Klaim utama makalah ini adalah bahwa evaluasi statis secara struktural tidak cocok dengan artefak frontend. Karena frontend bersifat interaktif, benchmark harus mengamati perilaku runtime, bukan hanya teks sumber. Karena banyak implementasi dapat sama-sama valid, benchmark harus menghindari penalti terhadap perbedaan desain yang sah. Karena ekosistem web berkembang cepat, benchmark harus extensible tanpa perancangan ulang.

LiveEvalBench menjawab setiap ketidakcocokan dengan pilihan desain yang bersesuaian: pengumpulan bukti siklus hidup untuk interaktivitas, protokol adaptif untuk keragaman implementasi, serta integrasi peran/dimensi secara inkremental untuk evolvabilitas. Trade-off-nya adalah kompleksitas: alur kerja agentic multi-peran lebih mahal dan lebih sulit direproduksi daripada skrip penilaian statis. Mitigasi yang diajukan makalah ini adalah lapisan rubrik bersama, yang menjadi jangkar komparabilitas antar-model sekaligus memungkinkan kriteria khusus artefak bervariasi.

Implikasi sekunder menyangkut evaluasi *open-world* secara lebih luas. Jika kriteria evaluasi dapat ditambahkan secara inkremental, benchmark menjadi artefak yang hidup alih-alih papan peringkat yang dibekukan โ€” properti yang mungkin dapat digeneralisasi di luar generasi web ke keluaran model lain yang dapat dieksekusi, interaktif, atau berkembang cepat. Penulis membingkai ini sebagai langkah menuju evaluasi yang mengikuti laju sistem yang diukurnya.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ