Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Ketika Model Rekursif Selesai Menghitung

Stabilitas anisotropik terkondisi lintasan sebagai tanda dinamik penyelesaian pada Tiny Recursive Models
Hare Krishna; Shubham Singh; Stephen Ebert; Hao-Yu Sunยท 2026ยท DOI 10.48550/arXiv.2609.26487

Masalah inti

Model rekursif dapat terus memperbarui keadaan latennya melampaui anggaran inferensi nominal, sehingga keluaran yang salah pada anggaran tersebut tidak menunjukkan apakah komputasi belum selesai atau telah memasuki rezim yang gagal secara menetap. Ambiguitas ini memotivasi studi dinamik tentang penyelesaian pada Tiny Recursive Models (TRM) berbasis attention dan MLP pada 1.000 teka-teki Sudoku sulit. Pertanyaan utamanya adalah apakah kegagalan pada anggaran nominal dapat dibedakan dari komputasi yang telah selesai dengan menganalisis evolusi keadaan laten di bawah rekurensi yang diperluas.

Inovasi

Memperluas rekurensi dari 16 langkah nominal menjadi 512 langkah meningkatkan akurasi penyelesaian eksak kumulatif dari 59,2% menjadi 87,5% untuk model attention dan dari 74,4% menjadi 91,9% untuk model MLP, sehingga menyelesaikan lebih dari dua pertiga teka-teki yang tidak terselesaikan pada anggaran nominal. Pada kedua arsitektur, gerak keadaan laten turun tajam setelah solusi eksak pertama. Keadaan yang telah selesai umumnya bersifat kontraktif secara lokal sepanjang arah lintasan, meskipun Jacobian lokal yang sama mempertahankan arah yang mengembang kuat. Kami mencirikan fenomena ini sebagai stabilitas anisotropik terkondisi lintasan. Eksperimen perturbasi mengonfirmasi stabilitas berarah ini pada kedua model. Nasib multi-langkah dari arah yang paling mengembang berbeda: arah tersebut diserap dalam 16 langkah pada model attention tetapi bertahan lebih lama pada model MLP. Pola stabilitas anisotropik juga berlaku untuk checkpoint attention kedua.
Model rekursif dapat terus memperbarui keadaan latennya melampaui anggaran inferensi nominal, sehingga keluaran yang salah pada anggaran tersebut tidak menunjukkan apakah komputasi belum selesai atau telah memasuki rezim yang gagal secara menetap. Ambiguitas ini memotivasi studi dinamik tentang penyelesaian pada Tiny Recursive Models (TRM) berbasis attention dan MLP pada 1.000 teka-teki Sudoku sulit. Pertanyaan utamanya adalah apakah kegagalan pada anggaran nominal dapat dibedakan dari komputasi yang telah selesai dengan menganalisis evolusi keadaan laten di bawah rekurensi yang diperluas.
Kami mempelajari dua arsitektur TRM: model berbasis attention dan model berbasis MLP. Keduanya dievaluasi pada 1.000 teka-teki Sudoku sulit. Anggaran inferensi nominal adalah 16 langkah rekuren. Kami memperluas rekurensi hingga 512 langkah dan mengukur akurasi penyelesaian eksak kumulatif. Untuk mencirikan dinamikanya, kami menganalisis gerak keadaan laten, Jacobian lokal, dan respons perturbasi. Jacobian lokal \( J = \frac{\partial f}{\partial h} \) pada keadaan laten \( h \) mendeskripsikan dinamika terlinearisasi. Kami menghitung arah lintasan \( v_t = h_{t+1} - h_t \) dan memeriksa turunan berarah \( J v_t \). Eksperimen perturbasi menguji stabilitas arah lintasan pada kedua model. Checkpoint attention kedua digunakan untuk memverifikasi keumuman pola stabilitas anisotropik.

Mengapa penting

Penurunan tajam gerak keadaan laten setelah solusi eksak pertama menunjukkan bahwa model telah mencapai keadaan selesai. Kontraktivitas lokal sepanjang arah lintasan, meskipun terdapat arah yang mengembang pada Jacobian penuh, menunjukkan bahwa penyelesaian dicirikan oleh subruang terkondisi lintasan yang stabil. Stabilitas anisotropik ini memberikan tanda dinamik yang membedakan kegagalan pada anggaran nominal dari komputasi yang telah selesai. Perbedaan nasib arah yang paling mengembang antara model attention dan MLP menyoroti pengaruh arsitektur terhadap dinamika penyelesaian. Temuan ini berimplikasi pada pemahaman komputasi rekuren dan perancangan anggaran inferensi yang beradaptasi dengan keadaan internal model. Penelitian selanjutnya dapat mengeksplorasi apakah tanda serupa muncul pada arsitektur rekuren dan tugas lain.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ