Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Di Balik Diff: Mendiagnosis dan Memitigasi Keruntuhan Mode Algoritmik pada Loop Penelitian Otonom Tingkat Kode

Diagnosis sistematis keruntuhan keragaman semantik pada loop penyuntingan kode yang digerakkan LLM dan mitigasi DAPS
Bowei He; Weixu Zhang; Yili Jin; Xue Liuยท 2026ยท DOI 10.48550/arXiv.2609.00077

Masalah inti

Loop penelitian otonom (ARL) tingkat kode telah muncul sebagai objek kajian yang konkret dalam penelitian automated machine learning. Dalam loop semacam itu, agen LLM mengusulkan modifikasi pada pipeline pelatihan eksperimental, menjalankan pipeline yang dimodifikasi, dan mempertahankan suntingan yang meningkatkan metrik di dalam loop yang dapat diverifikasi. Meskipun metrik yang dapat dieksekusi tampak menyediakan sinyal kemajuan yang andal, masih belum jelas apakah penyuntingan kode yang berulang kali digerakkan metrik menghasilkan perbaikan yang benar-benar menggeneralisasi di luar loop. Makalah ini menyediakan diagnosis sistematis atas pertanyaan tersebut. Pada berbagai pengaturan eksperimen, penulis mengidentifikasi mode kegagalan yang kokoh yang disebut **keruntuhan mode algoritmik**. Dalam rezim ini, keragaman suntingan pada tingkat permukaan tetap stabil, tetapi keragaman semantik dan tingkat mekanisme runtuh: agen terus menyunting baris kode yang berbeda sambil berulang kali mengusulkan jenis perubahan algoritmik yang sama. Keruntuhan ini disertai dengan melebarnya jarak antara perolehan metrik di dalam loop dan perolehan yang diukur pada evaluasi held-out yang independen.

Inovasi

Penulis melaporkan bahwa pada berbagai pengaturan eksperimen, keruntuhan mode algoritmik merupakan mode kegagalan yang kokoh. Keragaman suntingan pada tingkat permukaan tetap stabil, tetapi keragaman semantik dan tingkat mekanisme runtuh: agen terus menyunting baris kode yang berbeda sambil berulang kali mengusulkan jenis perubahan algoritmik yang sama. Keruntuhan ini disertai dengan melebarnya jarak antara perolehan metrik di dalam loop dan perolehan yang diukur pada evaluasi held-out yang independen.

Di bawah protokol tiga tingkat, DAPS menurunkan peluruhan klaster semantik suntingan sebesar **69,1%** dan meningkatkan kefaalan relatif sebesar **83,7%** secara blind dan **81,6%** secara audited, sambil mempertahankan kecepatan optimisasi di dalam loop. Kefaalan relatif didefinisikan sebagai rasio perolehan metrik blind terhadap perolehan metrik di dalam loop:

DAPS mencapai kefaalan relatif 0,837 (blind) dan 0,816 (audited), dibandingkan dengan nilai yang lebih rendah tanpa DAPS. Peluruhan klaster semantik diukur sebagai penurunan jumlah klaster semantik yang berbeda sepanjang iterasi:

Loop penelitian otonom (ARL) tingkat kode telah muncul sebagai objek kajian yang konkret dalam penelitian automated machine learning. Dalam loop semacam itu, agen LLM mengusulkan modifikasi pada pipeline pelatihan eksperimental, menjalankan pipeline yang dimodifikasi, dan mempertahankan suntingan yang meningkatkan metrik di dalam loop yang dapat diverifikasi. Meskipun metrik yang dapat dieksekusi tampak menyediakan sinyal kemajuan yang andal, masih belum jelas apakah penyuntingan kode yang berulang kali digerakkan metrik menghasilkan perbaikan yang benar-benar menggeneralisasi di luar loop. Makalah ini menyediakan diagnosis sistematis atas pertanyaan tersebut. Pada berbagai pengaturan eksperimen, penulis mengidentifikasi mode kegagalan yang kokoh yang disebut **keruntuhan mode algoritmik**. Dalam rezim ini, keragaman suntingan pada tingkat permukaan tetap stabil, tetapi keragaman semantik dan tingkat mekanisme runtuh: agen terus menyunting baris kode yang berbeda sambil berulang kali mengusulkan jenis perubahan algoritmik yang sama. Keruntuhan ini disertai dengan melebarnya jarak antara perolehan metrik di dalam loop dan perolehan yang diukur pada evaluasi held-out yang independen. Penulis kemudian mengusulkan Diversity-Aware Proposal Sampling (DAPS), mitigasi ringan yang menggabungkan pembobotan ulang cakupan kategori, memori suntingan persisten, dan gerbang validasi. Di bawah protokol tiga tingkat yang memisahkan metrik di dalam loop, metrik audit yang dibaca oleh gerbang, dan metrik blind yang tidak pernah diakses oleh komponen loop mana pun, DAPS menurunkan peluruhan klaster semantik suntingan sebesar 69,1% dan meningkatkan kefaalan relatif sebesar 83,7% secara blind dan 81,6% secara audited, sambil mempertahankan kecepatan optimisasi di dalam loop.
Penulis melakukan diagnosis sistematis atas keruntuhan mode algoritmik pada ARL tingkat kode. Mereka merancang eksperimen pada berbagai pengaturan ketika agen LLM secara iteratif mengusulkan suntingan kode pada pipeline pelatihan, menjalankan pipeline yang dimodifikasi, dan mempertahankan suntingan yang meningkatkan metrik di dalam loop yang dapat diverifikasi. Untuk mengukur keragaman, mereka membedakan antara keragaman suntingan pada tingkat permukaan (misalnya, baris kode yang diubah) dan keragaman semantik/tingkat mekanisme (misalnya, jenis perubahan algoritmik yang diusulkan). Mereka melacak evolusi ukuran keragaman tersebut sepanjang iterasi loop dan membandingkan perolehan metrik di dalam loop dengan perolehan pada evaluasi held-out yang independen.

Mengapa penting

Temuan ini mengungkapkan bahwa keruntuhan mode algoritmik merupakan isu kritis pada ARL tingkat kode: meskipun metrik di dalam loop dapat meningkat, perbaikan tersebut sering kali tidak menggeneralisasi. Keruntuhan ini bersifat semantik, bukan sintaktis, yang berarti agen menjelajahi lokasi kode yang berbeda tetapi konvergen pada ide algoritmik yang sama. Hal ini berimplikasi pada perancangan loop penelitian otonom: mengandalkan metrik di dalam loop semata dapat menyesatkan.

DAPS mengatasi hal ini dengan mendorong keragaman dalam distribusi proposal, memelihara memori untuk menghindari pengulangan, dan menggunakan gerbang validasi untuk menyaring suntingan. Protokol tiga tingkat menyediakan cara yang ketat untuk mengevaluasi generalisasi. Penulis menunjukkan bahwa DAPS mempertahankan kecepatan optimisasi di dalam loop, yang mengindikasikan bahwa mitigasi tersebut tidak mengorbankan efisiensi.

Hasil ini menunjukkan bahwa pengambilan sampel yang sadar keragaman dan validasi merupakan strategi yang efektif untuk memitigasi keruntuhan mode. Kode tersedia di repositori GitHub, memfasilitasi reproduksibilitas dan penelitian lebih lanjut. Pekerjaan selanjutnya dapat mengeksplorasi metrik keragaman lain dan skema pembobotan adaptif.

Kandidat taksonomi (Architecture, Cybersecurity, Network, Cryptography) tidak dibahas secara langsung dalam makalah ini, tetapi metodologinya dapat diterapkan pada domain lain tempat loop otonom digunakan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ