Editorial Ilmu Komputer & AI
Pola di Atas Piksel: Mengukur Bias Penyelesaian Pola dalam Generasi Kode Multimodal
Masalah inti
Inovasi
Pada lima MLLM terdepan, hasilnya menunjukkan bias yang kuat terhadap baseline berulang. Rata-rata tingkat bias mencapai 69,78% pada perturbasi lebar kartu dan 80,22% pada perturbasi ukuran font teks. Akurasi rata-rata yang sesuai hanya 21,17% untuk kartu dan 7,89% untuk teks. Codex-5.3 berkinerja terbaik secara keseluruhan tetapi masih turun dari akurasi 68,61% pada kartu menjadi 13,89% pada teks. Flash-3.0 mencapai bias 96,11% pada teks, menunjukkan ketergantungan hampir total pada pola berulang. Kondisi yang dilapisi noise, perturbasi yang lebih halus, dan posisi batas semakin meningkatkan tingkat bias. Temuan ini menunjukkan bahwa bias bukan artefak dari satu model atau kondisi tunggal melainkan fenomena sistematis di seluruh arsitektur. Kesenjangan antara tugas kartu dan teks menunjukkan bahwa saliency visual dan kekuatan pola memodulasi tingkat keparahan bias. Tabel di bawah ini merangkum metrik utama.
| Pattern Type | Mean Bias Rate | Mean Accuracy | Best Model Accuracy | Worst Bias |
|--------------|----------------|---------------|---------------------|------------|
| Card width | 69.78% | 21.17% | 68.61% (Codex-5.3) | โ |
| Text font-size | 80.
Benchmark dibangun dari 30 halaman web yang dipilih dari Design2Code, dari mana para penulis menghasilkan 1.440 tangkapan layar yang dievaluasi. Dua keluarga pola dipertimbangkan: pola kartu struktural (komponen kartu berulang dengan lebar yang diperturbasi) dan pola gaya teks (blok teks berulang dengan ukuran font yang diperturbasi). Untuk setiap instance, satu elemen terlokalisasi dalam pola berulang diperturbasi, dan model harus memulihkan nilai lebar atau ukuran font yang dimask dari tangkapan layar dan konteks HTML. Tugas dibingkai sebagai objektif fill-in-the-blank, memungkinkan pengukuran bias dan akurasi yang tepat. Kondisi mencakup rendering standar dan tangkapan layar yang dilapisi noise untuk menguji ketahanan. Lima MLLM terdepan dievaluasi, termasuk Codex-5.3 dan Flash-3.0. Tingkat bias didefinisikan sebagai proporsi respons yang cocok dengan nilai baseline berulang alih-alih ground truth yang diperturbasi. Akurasi adalah proporsi pemulihan yang benar. Desain eksperimen juga memvariasikan kehalusan perturbasi dan posisi batas untuk menyelidiki efek saliency visual. Secara formal, untuk instance tertentu dengan nilai baseline dan nilai yang diperturbasi , output model
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten memberโฆ