Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

iSDFT: Self-Distillation Proksimal-Informasi untuk Pembelajaran Berkelanjutan pada LLM

Kendala informasi guru yang dianggarkan menghasilkan target eksponensial bentuk tertutup dan meningkatkan pertukaran spesialisasi-retensi pada empat tulang punggung LLM.
Ahmed Khaled Khamis; Xiaotong Ji; Hassan Jaber; Rasul Tutunov; Matthieu Zimmer; Jun Wang; Haitham Bou-Ammarยท 2026ยท DOI 10.48550/arXiv.2609.24646

Masalah inti

Pembelajaran berkelanjutan pada large language model (LLM) menghadapi ketegangan yang menetap: memperoleh keterampilan baru dari demonstrasi sekaligus menghindari catastrophic forgetting terhadap kemampuan pra-latih yang luas. On-policy self-distillation fine-tuning (SDFT) mengatasi hal ini dengan belajar dari demonstrasi sekaligus mengurangi forgetting, tetapi metode ini selalu melakukan distilasi menuju guru penuh yang dikondisikan demonstrasi. Hal ini menetapkan pengaruh guru pada titik akhir guru penuh, sehingga tidak memberikan kendali atas seberapa banyak informasi demonstrasi yang harus ditransfer pada setiap keadaan prediksi. Penulis memperkenalkan Information-Proximal SDFT (iSDFT), yang memperlakukan guru sebagai sumber informasi yang dianggarkan, bukan target tanpa syarat. Pertanyaan penelitian utamanya adalah apakah pengendalian jumlah dan waktu informasi guru dapat meningkatkan pertukaran spesialisasi-retensi. Karya ini diposisikan terhadap rangkaian tolok ukur SDFT asli dan sepuluh tolok ukur tambahan matematika, pengkodean, dan matematika kompetisi, dievaluasi pada empat tulang punggung LLM yang heterogen dan dua tugas spesialisasi.

Inovasi

Penulis mengevaluasi iSDFT pada empat tulang punggung LLM yang heterogen dan dua tugas spesialisasi. iSDFT meningkatkan SDFT vanilla pada 7 dari 8 pengaturan model-tugas dan menyamainya pada satu pengaturan sisanya. Pada rangkaian tolok ukur SDFT asli, iSDFT memberikan retensi yang lebih ketat: 73% evaluasi tetap berada dalam 0,5 poin dari model dasar, dibandingkan dengan 52% untuk baseline terkuat. Pada sepuluh tolok ukur tambahan matematika, pengkodean, dan matematika kompetisi, iSDFT mencapai peningkatan rata-rata terbesar di antara metode yang dibandingkan. Hasil ini menunjukkan bahwa pengendalian seberapa banyak dan kapan informasi guru diperkenalkan meningkatkan spesialisasi sekaligus mempertahankan kemampuan yang lebih luas. Keuntungan yang konsisten pada berbagai tulang punggung dan tugas menunjukkan bahwa formulasi proksimal-informasi tidak terikat pada arsitektur atau domain tertentu.
Pembelajaran berkelanjutan pada large language model (LLM) menghadapi ketegangan yang menetap: memperoleh keterampilan baru dari demonstrasi sekaligus menghindari catastrophic forgetting terhadap kemampuan pra-latih yang luas. On-policy self-distillation fine-tuning (SDFT) mengatasi hal ini dengan belajar dari demonstrasi sekaligus mengurangi forgetting, tetapi metode ini selalu melakukan distilasi menuju guru penuh yang dikondisikan demonstrasi. Hal ini menetapkan pengaruh guru pada titik akhir guru penuh, sehingga tidak memberikan kendali atas seberapa banyak informasi demonstrasi yang harus ditransfer pada setiap keadaan prediksi. Penulis memperkenalkan Information-Proximal SDFT (iSDFT), yang memperlakukan guru sebagai sumber informasi yang dianggarkan, bukan target tanpa syarat. Pertanyaan penelitian utamanya adalah apakah pengendalian jumlah dan waktu informasi guru dapat meningkatkan pertukaran spesialisasi-retensi. Karya ini diposisikan terhadap rangkaian tolok ukur SDFT asli dan sepuluh tolok ukur tambahan matematika, pengkodean, dan matematika kompetisi, dievaluasi pada empat tulang punggung LLM yang heterogen dan dua tugas spesialisasi.
iSDFT beroperasi pada tingkat token. Pada setiap token, metode ini memilih distribusi yang paling dekat dengan siswa saat ini yang memenuhi kendala informasi guru yang ditetapkan. Secara formal, misalkan menyatakan distribusi siswa dan distribusi guru pada keadaan prediksi tertentu. Kendala dinyatakan sebagai batas pada divergensi Kullback-Leibler dari siswa ke guru:

Mengapa penting

Wawasan kunci iSDFT adalah bahwa pengaruh guru harus diperlakukan sebagai sumber daya yang dapat dikendalikan, bukan titik akhir yang tetap. Dengan memilih distribusi yang paling dekat dengan siswa yang memenuhi kendala informasi guru, metode ini menghindari komitmen berlebihan terhadap guru penuh pada setiap token, yang dapat mengikis kemampuan pra-latih. Target eksponensial bentuk tertutup dengan tilt yang ditentukan secara lokal menyediakan mekanisme yang berprinsip dan dapat dihitung secara komputasional untuk kendali ini. Penjangkaran pada kebijakan dasar yang dibekukan lebih lanjut menstabilkan pelatihan dengan membatasi drift kumulatif. Hasil empiris mendukung hipotesis bahwa kendali yang lebih halus atas transfer informasi menghasilkan pertukaran spesialisasi-retensi yang lebih baik. Batasan meliputi kebutuhan untuk menyetel anggaran informasi dan kekuatan penjangkaran, serta evaluasi yang terbatas pada dua tugas spesialisasi dan empat tulang punggung. Pekerjaan selanjutnya dapat mengeksplorasi anggaran adaptif, ukuran divergensi alternatif, dan rangkaian tugas yang lebih luas. Secara keseluruhan, iSDFT menawarkan modifikasi yang sederhana namun efektif pada SDFT yang meningkatkan spesialisasi dan retensi pada berbagai tolok ukur.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ