Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Teori Spektral Grokking: Weight Decay Memicu Feature Learning

Derivasi mekanistik yang menghubungkan feature learning pasca-fit dengan generalisasi tertunda dan struktur fase pada bidang learning rate–weight decay
Lenz Pracher; Pascal de Jong; Oskar Lieshaus; Alan Jeffares; Steffen Rulands· 2026· DOI 10.48550/arXiv.2609.26679

Masalah inti

Grokking merujuk pada fenomena dalam pelatihan jaringan saraf ketika kecocokan awal terhadap data pelatihan diikuti oleh peningkatan generalisasi yang jauh lebih lambat. Selama jeda ini, jaringan bertransisi dari rezim lazy learning, yang dicirikan oleh neural tangent kernel (NTK) tetap, ke rezim rich learning tempat arah eigen kernel yang relevan dengan tugas terus berkembang. Makalah ini bertujuan menyediakan teori kuantitatif tentang bagaimana transisi dari lazy ke rich learning dapat menghasilkan generalisasi tertunda. Penulis berfokus pada jaringan homogen yang dilatih dengan squared loss dan weight decay, dan menurunkan sistem dinamika tereduksi yang menangkap interaksi antara pertumbuhan kernel yang digerakkan residual dan weight decay. Teori ini memprediksi hukum skala dan batas fase spesifik yang kemudian diuji pada tugas penjumlahan modular menggunakan MLP dan Transformer.

Inovasi

Analisis teoretis menghasilkan beberapa prediksi. Pertama, skala waktu grokking dikendalikan oleh hasil kali learning rate () dan weight decay (). Secara spesifik, waktu generalisasi berskala terbalik dengan :

. Kedua, feature learning melambat secara logaritmik di dekat decay kritis , di atasnya struktur NTK yang selaras tugas tidak lagi dapat mendukung generalisasi. Ketiga, decay yang lebih kuat dapat mencegah fitting sama sekali. Prediksi ini diuji pada penjumlahan modular. Pada MLP homogen, struktur Fourier yang selaras tugas terus muncul pada NTK setelah akurasi pelatihan jenuh. Grid jaringan terlatih memulihkan geometri fase yang diprediksi dan penskalaan hasil kali terbalik dari waktu generalisasi dengan learning rate dan weight decay. Transformer satu blok menunjukkan struktur fase makroskopis serupa pada grid , serta penskalaan waktu transisi yang sama, meskipun melanggar homogenitas eksak. Hasil ini mengonfirmasi prediksi kunci teori tersebut.

Grokking merujuk pada fenomena dalam pelatihan jaringan saraf ketika kecocokan awal terhadap data pelatihan diikuti oleh peningkatan generalisasi yang jauh lebih lambat. Selama jeda ini, jaringan bertransisi dari rezim lazy learning, yang dicirikan oleh neural tangent kernel (NTK) tetap, ke rezim rich learning tempat arah eigen kernel yang relevan dengan tugas terus berkembang. Makalah ini bertujuan menyediakan teori kuantitatif tentang bagaimana transisi dari lazy ke rich learning dapat menghasilkan generalisasi tertunda. Penulis berfokus pada jaringan homogen yang dilatih dengan squared loss dan weight decay, dan menurunkan sistem dinamika tereduksi yang menangkap interaksi antara pertumbuhan kernel yang digerakkan residual dan weight decay. Teori ini memprediksi hukum skala dan batas fase spesifik yang kemudian diuji pada tugas penjumlahan modular menggunakan MLP dan Transformer.
Penulis mempertimbangkan jaringan homogen yang dilatih dengan squared loss dan weight decay. Mereka menunjukkan bahwa setelah memorisasi, residual terbatas tetap ada, dengan fraksi residual yang lebih besar pada komponen target yang terkait dengan nilai eigen NTK yang lebih kecil. Residual ini umpan balik ke dalam dinamika NTK itu sendiri. Dengan memproyeksikan dinamika yang dihasilkan ke arah spektral yang relevan dengan tugas, mereka memperoleh sistem tereduksi di mana pertumbuhan kernel yang digerakkan residual bersaing dengan weight decay. Sistem tereduksi dianalisis untuk menurunkan prediksi tentang skala waktu grokking dan struktur fase. Prediksi teoretis kemudian diuji pada tugas penjumlahan modular. Mereka melatih MLP homogen dan Transformer satu blok pada grid learning rate dan nilai weight decay. Untuk MLP, digunakan grid , dan untuk Transformer, grid . Mereka memantau kemunculan struktur Fourier yang selaras tugas pada NTK dan mengukur waktu generalisasi. Pengaturan eksperimen memungkinkan mereka memverifikasi geometri fase dan hukum skala yang diprediksi.

Mengapa penting

Hasil ini memberikan derivasi mekanistik yang menghubungkan feature learning pasca-fit dengan onset generalisasi dan struktur fasenya pada bidang learning rate dan weight decay. Teori ini menjelaskan mengapa grokking terjadi: setelah memorisasi, residual pada arah dengan nilai eigen NTK kecil mendorong evolusi kernel lebih lanjut, yang bersaing dengan weight decay. Hasil kali menetapkan skala waktu untuk kompetisi ini, yang mengarah pada penskalaan terbalik waktu generalisasi. Perlambatan logaritmik di dekat decay kritis menunjukkan transisi fase di mana struktur yang selaras tugas tidak dapat dipertahankan. Fakta bahwa Transformer, yang tidak sepenuhnya homogen, menunjukkan perilaku serupa menunjukkan teori ini mungkin memiliki penerapan yang lebih luas. Penulis menyarankan bahwa kerangka ini dapat diperluas ke arsitektur dan tugas lain. Temuan ini juga memiliki implikasi praktis untuk penyetelan hyperparameter: untuk menghindari grokking, seseorang dapat meningkatkan weight decay atau learning rate, tetapi decay yang terlalu besar dapat mencegah fitting. Makalah ini membuka jalan untuk memahami generalisasi tertunda dalam pengaturan yang lebih kompleks.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…