Editorial ilmu komputer
Probe Eksploratif Tumpang-Tindih Replika pada Transisi Grokking
Masalah inti
Grokking โ munculnya generalisasi secara tertunda jauh setelah loss pelatihan mendatar โ mengundang pembacaan fisika-statistik di mana solusi yang dipelajari adalah fase replica-symmetry-broken (RSB). Jika analogi itu berlaku, distribusi tumpang-tindih berpasangan antara solusi dengan seed independen semestinya tertata ulang pada transisi tersebut, sebagaimana parameter orde Parisi tertata ulang melintasi transisi RSB pada spin glass medan rata-rata.
Karya ini meregistrasikan probe eksploratif atas hipotesis itu. Para penulis melatih 64 jaringan dengan seed independen pada empat konfigurasi, melanjutkan setiap run hingga konvergensi berkelanjutan atau batas 40.000 epoch, dan menanyakan apakah distribusi tumpang-tindih bobot berpasangan yang terinspirasi RSB berubah melintasi transisi grokking. Pembingkaiannya sengaja terpraregistrasi: aturan konfirmatori ditetapkan di muka, dan hasil utama makalah ini adalah bahwa aturan tersebut tidak mengembalikan putusan sama sekali.
Klaim metodologis utamanya sempit dan penting. Langkah penyelarasan, bukan statistik tumpang-tindih, yang menentukan apa yang dapat dilaporkan oleh probe terdaftar ini. Dua kuantitas tumpang-tindih dibedaka
Inovasi
Hasil terdaftar adalah UNDETERMINED (kode alasan C0_INSTRUMENT_INVALID). Tidak ada putusan konfirmatori yang tersedia, dan makalah ini menyatakan secara gamblang bahwa data tidak memberikan null konfirmatori maupun pembacaan parameter orde Parisi yang tervalidasi.
Secara post-hoc, perhatian menyempit ke frac40, satu-satunya konfigurasi yang melampaui persyaratan kelengkapan checkpoint 12/16. Dua statistik dilaporkan pada data yang sama. Pertama, interval Hartigan-dip yang memuat nol, dengan interval kepercayaan 95% untuk statistik dip sebesar
Kedua hasil ini tidak membawa bobot evidensial yang setara, dan makalah ini cermat menjelaskan alasannya. Kalibrasi post-hoc memberikan daya nol pada uji dip pada pemisahan yang disimulasikan, sehingga interval itu tidak informatif alih-alih menjadi bukti tidak ada perubahan. Rasio simpangan baku, sebaliknya, adalah satu-satunya statistik di sini yang berdaya pada efek yang teramati.
Hasil deskriptif lebih lanjut menyangkut loss ansambel, yang nyaris datar hanya di bawah ambang 1% yang telah ditetapkan sebelumnya. Akhirnya,
Mengapa penting
Kontribusi makalah ini sama besarnya tentang validitas instrumen dengan tentang grokking. Probe terdaftar dirancang untuk menguji apakah distribusi tumpang-tindih yang terinspirasi RSB tertata ulang pada transisi. Probe itu tidak dapat melakukannya, karena langkah penyelarasan yang memetakan solusi dengan seed independen ke dalam korespondensi tidak mempertahankan fungsi. Perbedaan antara dan adalah poin teknis paling tajam dalam makalah ini: dihitung dari prediksi model yang tidak dipermutasi dan karena itu lolos dari cacat tersebut, sementara setiap nilai mewarisinya.
Penyelamatan post-hoc sengaja dibuat sederhana. Interval Hartigan-dip yang memuat nol bukanlah hasil null, karena uji tersebut berdaya nol pada pemisahan yang disimulasikan. Rasio simpangan baku sekitar 5,6 adalah satu-satunya statistik yang berdaya pada efek yang teramati, dan disajikan sebagai demikian โ satu sinyal berdaya pada satu konfigurasi, bukan pembacaan parameter orde Parisi yang tervalidasi.
Konfound antara fraksi pelatihan dan identitas split membatasi makna laju grokking 0/16, 11/16 dan 16/16. Loss ansambel yang nyaris datar hanya berlaku di bawah ambang 1% yang telah ditetapkan sebelumnya, sehingga juga bergantung pada ambang.
Pelajaran yang lebih luas bersifat prosedural. Praregistrasi hanya sekuat pemeriksaan validitas yang melekat padanya, dan langkah penyelarasan yang diam-diam merusak simetri dapat membatalkan seluruh lengan konfirmatori. Kode alasan C0_INSTRUMENT_INVALID dalam makalah ini adalah model tentang cara melaporkan kegagalan tersebut tanpa mengubahnya menjadi klaim positif.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ