Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Tangga Pemikiran: Kurikulum yang Berkembang Sendiri dari Jejak Penalaran yang Disederhanakan Secara Progresif

Kerangka kerja yang meningkatkan penalaran model bahasa kecil melalui penulisan ulang pertanyaan secara progresif dan penjadwalan bandit adaptif
Minghui Liu; Thomas Magelinski; Dehao Yuan; Qi Yu; Furong Huang· 2026· DOI 10.48550/arXiv.2609.25643

Masalah inti

Large language models (LLM) mencapai penalaran yang kuat ketika diskalakan hingga ratusan miliar parameter, tetapi model berskala kecil dan menengah tetap menjadi penalar yang rapuh bahkan dengan distilasi pengetahuan (KD). Karya ini memperkenalkan Ladders-of-Thought (LoT), sebuah kerangka kerja yang meningkatkan penalaran dengan menggabungkan penulisan ulang pertanyaan secara progresif dengan kurikulum yang berkembang sendiri. LoT secara otomatis menghasilkan varian masalah penalaran yang setia secara semantik namun lebih mudah, mengorganisasikannya ke dalam keranjang kesulitan menggunakan ukuran berbasis langkah, dan menggunakan penjadwal bandit yang berkembang sendiri untuk mengalokasikan pelatihan secara adaptif. Para penulis mengevaluasi LoT pada dua domain penalaran—matematika dan penalaran multi-hop—pada model 1–8B dari berbagai keluarga. Hipotesis utamanya adalah bahwa penulisan ulang progresif yang digabungkan dengan kurikulum adaptif menyediakan resep yang sederhana namun efektif untuk memperkuat penalaran pada LLM yang lebih kecil.

Inovasi

LoT secara konsisten meningkatkan KD pada model 1–8B dari berbagai keluarga. Pada tugas aritmetika, metode ini memberikan keuntungan besar: **+32 poin persentase pada AddSub** dan **+25pp pada SVAMP**. Pada pemisahan uji dalam domain, peningkatan berkisar dari **+2 hingga +8pp**. Untuk penalaran multi-hop, manfaatnya kuat tetapi bergantung pada dataset: **+16pp pada QASC** dan **+25pp pada StrategyQA**. Kerangka kerja ini juga konvergen lebih cepat daripada kurikulum bertahap, menyoroti nilai progresi adaptif. Hasil ini menunjukkan bahwa penulisan ulang progresif yang digabungkan dengan kurikulum adaptif menyediakan resep yang sederhana namun efektif untuk memperkuat penalaran pada LLM yang lebih kecil.
Large language models (LLM) mencapai penalaran yang kuat ketika diskalakan hingga ratusan miliar parameter, tetapi model berskala kecil dan menengah tetap menjadi penalar yang rapuh bahkan dengan distilasi pengetahuan (KD). Karya ini memperkenalkan Ladders-of-Thought (LoT), sebuah kerangka kerja yang meningkatkan penalaran dengan menggabungkan penulisan ulang pertanyaan secara progresif dengan kurikulum yang berkembang sendiri. LoT secara otomatis menghasilkan varian masalah penalaran yang setia secara semantik namun lebih mudah, mengorganisasikannya ke dalam keranjang kesulitan menggunakan ukuran berbasis langkah, dan menggunakan penjadwal bandit yang berkembang sendiri untuk mengalokasikan pelatihan secara adaptif. Para penulis mengevaluasi LoT pada dua domain penalaran—matematika dan penalaran multi-hop—pada model 1–8B dari berbagai keluarga. Hipotesis utamanya adalah bahwa penulisan ulang progresif yang digabungkan dengan kurikulum adaptif menyediakan resep yang sederhana namun efektif untuk memperkuat penalaran pada LLM yang lebih kecil.
LoT beroperasi dalam tiga tahap: (1) **Penulisan ulang pertanyaan secara progresif**: Untuk setiap masalah penalaran asli, kerangka kerja ini menghasilkan urutan varian yang setara secara semantik namun secara progresif lebih sederhana. Kesederhanaan diukur dengan jumlah langkah penalaran yang diperlukan, misalnya, masalah yang memerlukan langkah ditulis ulang menjadi varian yang memerlukan langkah. (2) **Pengelompokan kesulitan**: Masalah yang ditulis ulang dikelompokkan ke dalam keranjang berdasarkan metrik kesulitan berbasis langkah, membentuk tangga kompleksitas yang meningkat. (3) **Penjadwal bandit yang berkembang sendiri**: Algoritma multi-armed bandit secara dinamis mengalokasikan komputasi pelatihan di seluruh keranjang. Penjadwal memperlakukan setiap keranjang sebagai lengan dan memperbarui kebijakannya berdasarkan kinerja model, memungkinkan kurikulum berkembang seiring model membaik. Secara formal, penjadwal mempertahankan distribusi probabilitas atas keranjang pada langkah pelatihan , yang diperbarui melalui sinyal imbalan (misalnya, akurasi validasi pada keranjang ). Tujuan pelatihan menggabungkan loss KD dengan strategi pengambilan sampel berbobot kurikulum:

Mengapa penting

Efektivitas LoT berasal dari dua mekanisme utama: penyederhanaan progresif dan penjadwalan adaptif. Penulisan ulang progresif menciptakan tangga contoh yang menjembatani kesenjangan antara kemampuan siswa saat ini dan tugas target, mengurangi kerapuhan yang diamati pada model kecil. Penjadwal bandit yang berkembang sendiri memastikan bahwa pelatihan berfokus pada tingkat kesulitan yang paling informatif pada setiap tahap, menghindari inefisiensi kurikulum statis. Konvergensi yang lebih cepat dibandingkan kurikulum bertahap menunjukkan bahwa alokasi dinamis sangat penting. Namun, manfaat yang bergantung pada dataset pada penalaran multi-hop menunjukkan bahwa kualitas penulisan ulang dan sifat tugas memengaruhi hasil. Pekerjaan selanjutnya dapat mengeksplorasi strategi penulisan ulang yang lebih canggih dan memperluas LoT ke domain lain seperti pembuatan kode dan deduksi logis. Secara keseluruhan, LoT menawarkan jalur praktis untuk meningkatkan penalaran dalam pengaturan dengan sumber daya terbatas.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…