Editorial ilmu komputer
Open AccessOA2026
Dari Pakar ke Sub-pakar: Fine-tuning Parameter-Efisien Berbutir Halus untuk LLM MoE
NSFT menyempurnakan adaptasi MoE dengan memilih sub-pakar yang relevan dengan tugas melalui kepentingan routing dan saliency aktivasi intra-pakar, mencapai kinerja unggul dengan parameter yang dapat dilatih lebih sedikit.
Zhentao Tan; Chang Liu; Yao Liu; Yue Wu; Jieping Ye· 2026· DOI 10.48550/arXiv.2609.25655
Masalah inti
Large language models (LLMs) terus berkembang, membuat adaptasi penuh parameter secara dense semakin mahal. Arsitektur sparse dan modular seperti model Mixture-of-Experts (MoE) muncul sebagai arah yang menjanjikan untuk mengelola biaya komputasi sambil mempertahankan kapasitas tinggi. Namun, pergeseran ini memunculkan pertanyaan kritis bagi parameter-efficient fine-tuning (PEFT): pada granularitas apa parameter harus dipilih dan diperbarui? Metode PEFT yang ada seperti LoRA beroperasi pada matriks bobot yang telah ditentukan, sedangkan metode penyetelan sparse tingkat pakar memperbarui seluruh pakar terpilih. Penulis mengamati bahwa pakar yang diaktifkan bersifat sparse secara internal—hanya sebagian kecil kanal perantara yang merespons kuat terhadap tugas hilir. Ini menunjukkan bahwa adaptasi tingkat pakar masih terlalu kasar. Untuk mengatasi hal ini, mereka mengusulkan NSFT (Neural Sub-expert Fine-Tuning), kerangka PEFT berbutir halus yang menyempurnakan adaptasi MoE dari pakar ke sub-pakar. NSFT menguraikan setiap pakar sepanjang dimensi perantara menjadi kelompok kanal terstruktur dan memilih sub-pakar yang relevan dengan tugas dengan menggabungkan kepentingan routing dengan sa
Inovasi
Penulis mengevaluasi NSFT pada dua LLM MoE: OLMoE dan Ling-mini-2.0. Eksperimen mencakup tugas spesifik domain yang menantang dan tolok ukur umum. Baseline mencakup metode PEFT representatif (misalnya, LoRA) dan metode penyetelan sparse tingkat pakar. Di seluruh tugas, NSFT secara konsisten mengungguli baseline tersebut. Secara notable, NSFT mencapai keuntungan ini sambil menggunakan parameter yang dapat dilatih jauh lebih sedikit. Misalnya, pada tugas spesifik domain, NSFT meningkatkan akurasi dengan margin signifikan dibandingkan LoRA dan penyetelan tingkat pakar, menunjukkan efektivitas adaptasi tingkat sub-pakar. Pada tolok ukur umum, NSFT mempertahankan kemampuan umum yang kompetitif, menunjukkan bahwa pembaruan berbutir halus tidak merusak pengetahuan luas model. Hasilnya konsisten di kedua arsitektur model, menunjukkan generalitas pendekatan ini. Penulis melaporkan bahwa efisiensi parameter NSFT adalah keunggulan utama, karena hanya memperbarui sebagian kecil sub-pakar per pakar, yang mengarah pada kebutuhan memori dan komputasi yang lebih rendah selama fine-tuning. Secara keseluruhan, eksperimen memvalidasi bahwa adaptasi tingkat sub-pakar adalah paradigma PEFT yang lebih p
Large language models (LLMs) terus berkembang, membuat adaptasi penuh parameter secara dense semakin mahal. Arsitektur sparse dan modular seperti model Mixture-of-Experts (MoE) muncul sebagai arah yang menjanjikan untuk mengelola biaya komputasi sambil mempertahankan kapasitas tinggi. Namun, pergeseran ini memunculkan pertanyaan kritis bagi parameter-efficient fine-tuning (PEFT): pada granularitas apa parameter harus dipilih dan diperbarui? Metode PEFT yang ada seperti LoRA beroperasi pada matriks bobot yang telah ditentukan, sedangkan metode penyetelan sparse tingkat pakar memperbarui seluruh pakar terpilih. Penulis mengamati bahwa pakar yang diaktifkan bersifat sparse secara internal—hanya sebagian kecil kanal perantara yang merespons kuat terhadap tugas hilir. Ini menunjukkan bahwa adaptasi tingkat pakar masih terlalu kasar. Untuk mengatasi hal ini, mereka mengusulkan NSFT (Neural Sub-expert Fine-Tuning), kerangka PEFT berbutir halus yang menyempurnakan adaptasi MoE dari pakar ke sub-pakar. NSFT menguraikan setiap pakar sepanjang dimensi perantara menjadi kelompok kanal terstruktur dan memilih sub-pakar yang relevan dengan tugas dengan menggabungkan kepentingan routing dengan saliency aktivasi intra-pakar. Untuk mengoptimalkan pembaruan parsial sparse, NSFT memperkenalkan penskalaan learning-rate dan penskalaan gradien dinamis untuk mengompensasi berkurangnya magnitudo pembaruan efektif. Eksperimen pada OLMoE dan Ling-mini-2.0 di seluruh tugas spesifik domain yang menantang dan tolok ukur umum menunjukkan bahwa NSFT secara konsisten mengungguli baseline PEFT representatif dan penyetelan sparse tingkat pakar, sambil menggunakan parameter yang dapat dilatih jauh lebih sedikit dan mempertahankan kemampuan umum yang kompetitif. Hasil ini menunjukkan bahwa adaptasi tingkat sub-pakar adalah paradigma PEFT yang lebih presisi dan efisien untuk LLM MoE.
NSFT beroperasi dengan menguraikan setiap pakar dalam lapisan MoE sepanjang dimensi perantara menjadi kelompok kanal terstruktur, yang disebut sub-pakar. Untuk input tertentu, router memilih sekumpulan pakar, dan di dalam setiap pakar terpilih, NSFT mengidentifikasi sub-pakar yang relevan dengan tugas dengan menggabungkan dua sinyal: kepentingan routing dan saliency aktivasi intra-pakar. Kepentingan routing mencerminkan seberapa kuat router mengaktifkan pakar untuk input saat ini, sedangkan saliency aktivasi mengukur besaran respons kanal perantara di dalam pakar tersebut. Kombinasi ini menghasilkan skor saliency untuk setiap sub-pakar, dan hanya yang di atas ambang batas yang diperbarui selama fine-tuning.
Mengapa penting
Wawasan kunci yang mendorong NSFT adalah pengamatan bahwa pakar yang diaktifkan bersifat sparse secara internal: hanya sebagian kecil kanal perantara yang merespons kuat terhadap tugas hilir. Ini menantang kebijaksanaan konvensional bahwa adaptasi tingkat pakar sudah cukup. Dengan menguraikan pakar menjadi sub-pakar dan memilih berdasarkan gabungan routing dan saliency aktivasi, NSFT mencapai granularitas yang lebih halus tanpa mengorbankan efisiensi. Mekanisme penskalaan learning-rate dan gradien dinamis sangat penting untuk menstabilkan pembaruan sparse, karena mengompensasi berkurangnya magnitudo pembaruan efektif. Penulis mencatat bahwa keuntungan kinerja NSFT sangat menonjol pada tugas spesifik domain, di mana sub-pakar yang relevan dengan tugas lebih berbeda. Pada tolok ukur umum, metode ini mempertahankan kinerja kompetitif, menunjukkan bahwa metode ini tidak overfit pada domain tertentu. Batasan potensial adalah kebutuhan untuk menghitung skor saliency, yang menambah beberapa overhead, tetapi ini diimbangi oleh pengurangan parameter yang dapat dilatih. Pekerjaan masa depan dapat mengeksplorasi thresholding adaptif dan memperluas dekomposisi sub-pakar ke arsitektur modular lainnya. Secara keseluruhan, NSFT mewakili langkah signifikan menuju fine-tuning yang lebih presisi dan efisien untuk LLM MoE, membuka jalan bagi adopsi yang lebih luas dari teknik adaptasi sparse.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…