Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Pola di Atas Piksel: Mengukur Bias Penyelesaian Pola dalam Generasi Kode Multimodal

Sebuah benchmark yang mengungkap bagaimana pola UI yang berulang secara sistematis mengalahkan bukti visual dalam tugas screenshot-to-code MLLM
Khai-Nguyen Nguyen; Oscar Chaparro; Antonio Mastropaoloยท 2026ยท DOI 10.48550/arXiv.2608.03691

Masalah inti

Model bahasa besar multimodal (MLLM) semakin banyak digunakan untuk menerjemahkan tangkapan layar halaman web menjadi kode front-end, namun keandalannya pada antarmuka yang berulang secara visual masih kurang dipahami. Para penulis mengidentifikasi mode kegagalan yang konkret: ketika elemen terlokalisasi dalam pola UI yang berulang diperturbasi, model cenderung memulihkan nilai baseline yang konsisten dengan pola daripada nilai yang benar secara visual. Karya ini memperkenalkan benchmark pertama untuk bias penyelesaian pola visual, memformalkan tugas sebagai masalah fill-in-the-blank screenshot-to-code yang objektif. Dimulai dari 30 halaman web yang dikurasi dari dataset Design2Code, para penulis membangun 1.440 tangkapan layar yang dievaluasi yang mencakup pola kartu struktural dan pola gaya teks dalam kondisi standar dan dilapisi noise. Hipotesis utamanya adalah bahwa pola visual yang berulang bertindak sebagai prior yang kuat yang dapat mengalahkan bukti tingkat piksel, menghasilkan generasi kode yang salah secara visual namun konsisten dengan pola. Bias ini diukur pada lima MLLM terdepan, dan hasilnya mengungkap degradasi akurasi yang sistematis dan parah yang berkorelasi denga

Inovasi

Pada lima MLLM terdepan, hasilnya menunjukkan bias yang kuat terhadap baseline berulang. Rata-rata tingkat bias mencapai 69,78% pada perturbasi lebar kartu dan 80,22% pada perturbasi ukuran font teks. Akurasi rata-rata yang sesuai hanya 21,17% untuk kartu dan 7,89% untuk teks. Codex-5.3 berkinerja terbaik secara keseluruhan tetapi masih turun dari akurasi 68,61% pada kartu menjadi 13,89% pada teks. Flash-3.0 mencapai bias 96,11% pada teks, menunjukkan ketergantungan hampir total pada pola berulang. Kondisi yang dilapisi noise, perturbasi yang lebih halus, dan posisi batas semakin meningkatkan tingkat bias. Temuan ini menunjukkan bahwa bias bukan artefak dari satu model atau kondisi tunggal melainkan fenomena sistematis di seluruh arsitektur. Kesenjangan antara tugas kartu dan teks menunjukkan bahwa saliency visual dan kekuatan pola memodulasi tingkat keparahan bias. Tabel di bawah ini merangkum metrik utama.

| Pattern Type | Mean Bias Rate | Mean Accuracy | Best Model Accuracy | Worst Bias |
|--------------|----------------|---------------|---------------------|------------|
| Card width | 69.78% | 21.17% | 68.61% (Codex-5.3) | โ€” |
| Text font-size | 80.

Model bahasa besar multimodal (MLLM) semakin banyak digunakan untuk menerjemahkan tangkapan layar halaman web menjadi kode front-end, namun keandalannya pada antarmuka yang berulang secara visual masih kurang dipahami. Para penulis mengidentifikasi mode kegagalan yang konkret: ketika elemen terlokalisasi dalam pola UI yang berulang diperturbasi, model cenderung memulihkan nilai baseline yang konsisten dengan pola daripada nilai yang benar secara visual. Karya ini memperkenalkan benchmark pertama untuk bias penyelesaian pola visual, memformalkan tugas sebagai masalah fill-in-the-blank screenshot-to-code yang objektif. Dimulai dari 30 halaman web yang dikurasi dari dataset Design2Code, para penulis membangun 1.440 tangkapan layar yang dievaluasi yang mencakup pola kartu struktural dan pola gaya teks dalam kondisi standar dan dilapisi noise. Hipotesis utamanya adalah bahwa pola visual yang berulang bertindak sebagai prior yang kuat yang dapat mengalahkan bukti tingkat piksel, menghasilkan generasi kode yang salah secara visual namun konsisten dengan pola. Bias ini diukur pada lima MLLM terdepan, dan hasilnya mengungkap degradasi akurasi yang sistematis dan parah yang berkorelasi dengan saliency visual.

Benchmark dibangun dari 30 halaman web yang dipilih dari Design2Code, dari mana para penulis menghasilkan 1.440 tangkapan layar yang dievaluasi. Dua keluarga pola dipertimbangkan: pola kartu struktural (komponen kartu berulang dengan lebar yang diperturbasi) dan pola gaya teks (blok teks berulang dengan ukuran font yang diperturbasi). Untuk setiap instance, satu elemen terlokalisasi dalam pola berulang diperturbasi, dan model harus memulihkan nilai lebar atau ukuran font yang dimask dari tangkapan layar dan konteks HTML. Tugas dibingkai sebagai objektif fill-in-the-blank, memungkinkan pengukuran bias dan akurasi yang tepat. Kondisi mencakup rendering standar dan tangkapan layar yang dilapisi noise untuk menguji ketahanan. Lima MLLM terdepan dievaluasi, termasuk Codex-5.3 dan Flash-3.0. Tingkat bias didefinisikan sebagai proporsi respons yang cocok dengan nilai baseline berulang alih-alih ground truth yang diperturbasi. Akurasi adalah proporsi pemulihan yang benar. Desain eksperimen juga memvariasikan kehalusan perturbasi dan posisi batas untuk menyelidiki efek saliency visual. Secara formal, untuk instance tertentu dengan nilai baseline dan nilai yang diperturbasi , output model

diklasifikasikan sebagai bias jika
dan benar jika
. Tingkat bias dan akurasi pada instance adalah:

Mengapa penting

Analisis penalaran mengungkap bahwa upaya penalaran yang lebih besar berkorelasi dengan bias yang lebih rendah, menunjukkan bahwa inferensi yang deliberatif dapat sebagian memitigasi efek tersebut. Namun, bukti kualitatif menunjukkan bahwa model dapat mengidentifikasi elemen anomali dan tetap mengalahkannya dengan jawaban yang konsisten dengan pola. Disosiasi antara pengenalan dan respons ini menunjukkan bahwa bias beroperasi pada tahap akhir generasi, di mana pola berulang bertindak sebagai prior yang kuat yang menekan bukti visual. Tingkat keparahan bias sangat terkait dengan saliency visual: perturbasi yang lebih menonjol dan posisi batas meningkatkan tingkat bias. Hasil ini mengidentifikasi mode kegagalan yang konkret dalam generasi kode multimodal dan menyoroti kebutuhan akan protokol evaluasi yang secara eksplisit menguji bias penyelesaian pola. Benchmark ini memberikan fondasi untuk mengembangkan strategi mitigasi, seperti contrastive decoding atau pattern-aware prompting, untuk memastikan bahwa MLLM memprioritaskan bukti tingkat piksel di atas prior pengulangan yang dipelajari. Pekerjaan selanjutnya harus memperluas benchmark ke pola UI dan modalitas lain, serta menyelidiki intervensi arsitektural yang memisahkan persepsi visual dari penyelesaian pola.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ