Editorial Ilmu Komputer & AI
Anda Hanya Perlu 2/3 dari Pakar Terpilih: Studi Empiris Pemangkasan Pakar Dinamis pada LLM MoE Berbutir Halus
Masalah inti
Arsitektur mixture-of-experts (MoE) berbutir halus telah menjadi desain arus utama untuk model bahasa besar berbobot terbuka. Checkpoint modern kini memuat ratusan pakar dan memilih semakin banyak pakar per token. Pergeseran ini menjadikan pemangkasan pakar dinamis sebagai jalur menarik menuju inferensi yang lebih murah, karena komputasi saat penyajian berskala dengan jumlah pakar yang benar-benar dieksekusi untuk setiap token.
Namun, bukti yang ada tentang redundansi pakar sebagian besar berasal dari arsitektur MoE yang lebih kasar dan dari benchmark pilihan ganda berbasis skor likelihood. Karena itu, masih belum jelas apakah temuan tersebut berlaku pada rezim berbutir halus. Penulis mengidentifikasi tiga pertanyaan terbuka utama:
1. Seberapa redundan pemilihan pakar per token pada MoE berbutir halus?
2. Seberapa efektif metode pemangkasan dinamis yang ada memanfaatkan redundansi itu?
3. Apa yang menentukan sensitivitas model terhadap pemangkasan agresif?
Untuk menjawab pertanyaan-pertanyaan ini, makalah ini melakukan studi empiris sistematis terhadap **dua belas checkpoint MoE berbutir halus** yang mencakup **sembilan keluarga arsitektur**, dievaluasi pada rangkaian inti **seb
Inovasi
Hasil empiris disusun sekitar tiga pertanyaan penelitian.
**Redundansi pemilihan pakar.** Pemilihan pakar jauh lebih redundan daripada yang diasumsikan oleh titik operasi bidang ini. Mempertahankan sekitar **dua pertiga** pakar terpilih secara seragam mempertahankan **98,8% kinerja tanpa pemangkasan secara rata-rata**. Ini hanya memerlukan perubahan satu bilangan bulat pada konfigurasi penyajian dan menghasilkan **percepatan terukur 1,2-1,7x pada dua backend penyajian**.
**Efektivitas pemangkasan dinamis pada anggaran konservatif.** Baseline seragam yang sederhana menyisakan sedikit ruang untuk alokasi dinamis. Pada anggaran konservatif, bahkan aturan terbaik yang telah dipublikasikan berbeda dari pemotongan seragam **di bawah 1%** pada anggaran pakar yang setara.
**Efektivitas di bawah pemangkasan agresif.** Nilai aturan dinamis muncul di bawah pemangkasan agresif. Di sana, aturan terbaik memulihkan **hingga 3,0%** dibanding pemotongan seragam. Keuntungan ini terkonsentrasi pada tugas generatif yang mengalami degradasi paling tajam ketika pakar dihapus.
**Sensitivitas tingkat model.** Sensitivitas terhadap pemangkasan agresif bergantung pada model. Model yang lebih besar dan m
Mengapa penting
Studi ini membingkai ulang pertanyaan praktis untuk penyajian MoE berbutir halus. Alih-alih bertanya aturan alokasi dinamis mana yang terbaik, pertanyaan yang lebih konsekuensial adalah seberapa banyak komputasi pakar yang dapat ditiadakan oleh suatu model. Jawabannya, berdasarkan bukti ini, adalah sekitar sepertiga dari pakar terpilih per token, dengan biaya hanya 1,2% kehilangan kinerja rata-rata.
Ini memiliki dua implikasi. Pertama, untuk penerapan, titik operasi dua pertiga seragam adalah default yang kuat: mudah diimplementasikan, hanya memerlukan perubahan satu bilangan bulat, dan menangkap sebagian besar penghematan yang tersedia. Kedua, untuk penelitian, alokasi dinamis layak secara kompleksitas hanya pada anggaran pemangkasan agresif, di mana tugas generatif terdegradasi paling tajam dan di mana aturan terbaik memulihkan hingga 3,0% dibanding pemotongan seragam.
Hasil sensitivitas menambahkan dimensi yang bergantung pada model. Model yang lebih besar dan model thinking lebih toleran terhadap pemangkasan agresif, sedangkan model multimodal lebih rentan. Ini menunjukkan bahwa kebijakan pemangkasan sebaiknya dikondisikan pada keluarga model alih-alih diperlakukan sebagai pengaturan universal.
Secara bersama, temuan ini mengungkap seberapa banyak komputasi pakar yang dapat ditiadakan oleh MoE berbutir halus, dan menetapkan kapan alokasi dinamis layak secara kompleksitas, sehingga menginformasikan baik penerapan praktis maupun metode pemangkasan di masa depan.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ