Editorial ilmu komputer
Open AccessOA2026
Apa yang Harus Dilihat oleh Pengajar Mandiri? Desain Konteks Istimewa untuk On-Policy Self-Distillation
Tingkat abstraksi, bukan volume informasi, menentukan efektivitas konteks istimewa dalam on-policy self-distillation
Kanghui Tian; Siyuan Liu; Tianxiang Jiang; Shuai Dong; Yizhuo Li; Tian Ding; Yuan Guo; Songze Li; Haowen Hou; Congcong Wang; Yi Wang· 2026· DOI 10.48550/arXiv.2609.25623
Masalah inti
On-policy self-distillation (OPSD) memanfaatkan salinan beku dari model dasar sebagai pengajar yang menilai rollout siswa sendiri di bawah konteks istimewa. Secara konvensional, konteks istimewa ini adalah solusi referensi lengkap yang menggabungkan jawaban akhir dengan satu jalur penalaran tertentu. Ketegangan utama yang dieksplorasi dalam karya ini adalah bahwa informasi istimewa yang lebih banyak tidak selalu menghasilkan pengajar yang lebih baik. Penulis berhipotesis bahwa tingkat abstraksi optimal dalam konteks istimewa bergantung pada apa yang masih dapat ditindaklanjuti oleh siswa. Mereka secara sistematis membandingkan konteks solusi lengkap bawaan dengan tiga abstraksi yang dikompilasi secara offline—strategi bernama, kerangka yang tidak bergantung metode, dan kategori masalah—serta kontrol hanya jawaban yang mempertahankan tujuan tetapi menghilangkan jalur penalaran. Penelitian ini bertujuan mengidentifikasi bagaimana desain konteks berinteraksi dengan skala siswa dan jenis tugas, serta apakah divergensi KL awal antara pengajar dan siswa dapat memprediksi performa hilir.
Inovasi
Pada uji utama pada matematika kompetisi, konteks tingkat menengah terbaik meningkatkan rata-rata puncak dalam domain dibandingkan solusi lengkap sebesar 1,4 poin pada 4B dan 1,6 poin pada 8B. Keuntungan ini dicapai sambil menyimpan token petunjuk satu orde lebih sedikit. Pada tiga seed, konteks kerangka dan kategori menunjukkan keuntungan rata-rata positif pada kedua skala. Pengondisian hanya jawaban tetap kompetitif, berada dalam 0,2 poin dari solusi lengkap pada skala ini. Konteks yang disukai bervariasi menurut skala siswa dan tugas: misalnya, pada 4B konteks strategi bernama berkinerja terbaik, sedangkan pada 8B kerangka yang tidak bergantung metode menghasilkan rata-rata puncak tertinggi. Divergensi KL awal antara pengajar dan siswa tidak mengurutkan performa hilir, yang menunjukkan bahwa ini bukan prediktor yang andal untuk efektivitas konteks. Hasil ini menunjukkan bahwa tingkat abstraksi optimal bergantung pada siswa dan bahwa memberikan terlalu banyak detail dapat merugikan.
On-policy self-distillation (OPSD) memanfaatkan salinan beku dari model dasar sebagai pengajar yang menilai rollout siswa sendiri di bawah konteks istimewa. Secara konvensional, konteks istimewa ini adalah solusi referensi lengkap yang menggabungkan jawaban akhir dengan satu jalur penalaran tertentu. Ketegangan utama yang dieksplorasi dalam karya ini adalah bahwa informasi istimewa yang lebih banyak tidak selalu menghasilkan pengajar yang lebih baik. Penulis berhipotesis bahwa tingkat abstraksi optimal dalam konteks istimewa bergantung pada apa yang masih dapat ditindaklanjuti oleh siswa. Mereka secara sistematis membandingkan konteks solusi lengkap bawaan dengan tiga abstraksi yang dikompilasi secara offline—strategi bernama, kerangka yang tidak bergantung metode, dan kategori masalah—serta kontrol hanya jawaban yang mempertahankan tujuan tetapi menghilangkan jalur penalaran. Penelitian ini bertujuan mengidentifikasi bagaimana desain konteks berinteraksi dengan skala siswa dan jenis tugas, serta apakah divergensi KL awal antara pengajar dan siswa dapat memprediksi performa hilir.
Pengaturan eksperimen mempertahankan tampilan siswa dan prosedur pelatihan tetap sama dalam setiap skala model (4B dan 8B parameter). Untuk setiap skala, penulis mengevaluasi lima kondisi konteks istimewa: (1) solusi referensi lengkap (bawaan), (2) strategi bernama, (3) kerangka yang tidak bergantung metode, (4) kategori masalah, dan (5) hanya jawaban. Konteks tingkat menengah dikompilasi secara offline, artinya konteks tersebut dihasilkan tanpa akses ke rollout siswa. Model pengajar adalah salinan beku dari model dasar yang menilai rollout on-policy siswa di bawah konteks yang diberikan. Pelatihan menggunakan objektif OPSD standar. Evaluasi utama dilakukan pada tugas matematika kompetisi, dengan akurasi rata-rata puncak dalam domain sebagai metrik kunci. Perbandingan dilakukan pada tiga seed acak untuk menilai ketahanan. Penulis juga mengukur jumlah token petunjuk yang disimpan untuk setiap jenis konteks dan menghitung divergensi KL awal antara pengajar dan siswa untuk menguji korelasinya dengan performa hilir. Desain eksperimen mengisolasi efek abstraksi konteks sambil mengendalikan skala model dan dinamika pelatihan.
Mengapa penting
Temuan ini menantang asumsi bahwa informasi istimewa yang lebih kaya selalu menguntungkan self-distillation. Sebaliknya, tingkat abstraksi harus selaras dengan kapasitas siswa untuk menindaklanjutinya. Konteks tingkat menengah seperti strategi bernama dan kerangka yang tidak bergantung metode memberikan panduan yang cukup tanpa membebani siswa dengan satu jalur penalaran yang mungkin tidak cocok dengan distribusi rollout-nya sendiri. Daya saing kontrol hanya jawaban menunjukkan bahwa untuk beberapa skala dan tugas, tujuan saja sudah cukup, dan jalur dapat menimbulkan noise. Variasi konteks yang disukai antar skala menyiratkan bahwa seiring siswa menjadi lebih mampu, mereka mendapat manfaat dari petunjuk yang lebih abstrak dan tidak bergantung metode. Tidak adanya korelasi antara divergensi KL awal dan performa hilir menunjukkan bahwa ukuran statis divergensi pengajar-siswa tidak cukup untuk memprediksi keberhasilan OPSD. Wawasan ini memiliki implikasi praktis untuk merancang pipeline self-distillation yang efisien dan efektif, terutama dalam mengurangi biaya penyimpanan token sambil meningkatkan performa. Pekerjaan selanjutnya harus mengeksplorasi pemilihan konteks adaptif berdasarkan skala siswa dan karakteristik tugas.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…