Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

DeepSeek-V4-Flash pada AMD gfx90a: Pemulihan Kebenaran Numerik dan Rekayasa Kinerja Inferensi

Mengaktifkan inferensi MoE FP4 pada CDNA2 dengan perbaikan kebenaran numerik dan penyetelan kinerja
Siming Huang· 2026· DOI 10.48550/arXiv.2609.15627

Masalah inti

Penerapan model large mixture-of-experts (MoE) seperti DeepSeek-V4-Flash pada akselerator non-NVIDIA menghadirkan tantangan tersendiri. Karya ini berfokus pada pengaktifan inferensi efisien pada GPU AMD Instinct MI250 yang berbasis arsitektur gfx90a/CDNA2. Sistem ini mengintegrasikan pemuatan safetensors native, paralelisme tensor dan expert, komputasi MoE routed FP4, proyeksi dense FP8, sparse attention, eksekusi HIP graph, dan penyajian yang kompatibel dengan OpenAI di dalam SGLang. Sebuah masalah kritis muncul: jalur eksekusi yang awalnya cepat menghasilkan hasil yang salah secara numerik akibat ketidaksesuaian tata letak W2 routed-expert. Makalah ini merinci identifikasi permutasi keluaran, perbaikan tata letak bobot pada waktu pemuatan, dan penetapan pemeriksaan kebenaran sebelum optimasi kinerja. Jalur yang telah diperbaiki kemudian menjalani rekayasa kinerja ekstensif untuk fase decode dan prefill, yang menunjukkan bahwa inferensi efisien pada CDNA2 dibatasi oleh faktor di luar bandwidth memori, termasuk ketidaksesuaian format eksekusi FP4, pemanfaatan M yang rendah, dan biaya sinkronisasi per lapisan.

Inovasi

Pada empat GCD MI250 dengan TP4/EP1, sistem yang telah diperbaiki dan dioptimalkan mencapai sekitar 74,5 token per detik untuk decode autoregresif native. Untuk prompt 4.604 token, time-to-first-token (TTFT) adalah 2,061–2,062 detik, setara dengan throughput masukan sekitar 2.234 token per detik. Hasil ini diperoleh setelah menerapkan seluruh rangkaian optimasi. Pemeriksaan kebenaran mengonfirmasi bahwa tata letak bobot yang diperbaiki menghilangkan kesalahan numerik yang ada pada jalur cepat awal. Peningkatan kinerja diatribusikan pada kombinasi bobot FP4 packed, kuantisasi aktivasi INT8, instruksi khusus CDNA2, dan geometri kernel yang sadar topologi untuk decode, serta kernel MFMA, pemanfaatan ulang bobot yang lebih baik, dan pengurangan overhead sparse attention untuk prefill. Hasil ini menyoroti bahwa bandwidth memori saja tidak menentukan kinerja; ketidaksesuaian format eksekusi FP4, pemanfaatan M yang rendah, dan biaya sinkronisasi per lapisan merupakan faktor pembatas yang signifikan pada CDNA2.
Penerapan model large mixture-of-experts (MoE) seperti DeepSeek-V4-Flash pada akselerator non-NVIDIA menghadirkan tantangan tersendiri. Karya ini berfokus pada pengaktifan inferensi efisien pada GPU AMD Instinct MI250 yang berbasis arsitektur gfx90a/CDNA2. Sistem ini mengintegrasikan pemuatan safetensors native, paralelisme tensor dan expert, komputasi MoE routed FP4, proyeksi dense FP8, sparse attention, eksekusi HIP graph, dan penyajian yang kompatibel dengan OpenAI di dalam SGLang. Sebuah masalah kritis muncul: jalur eksekusi yang awalnya cepat menghasilkan hasil yang salah secara numerik akibat ketidaksesuaian tata letak W2 routed-expert. Makalah ini merinci identifikasi permutasi keluaran, perbaikan tata letak bobot pada waktu pemuatan, dan penetapan pemeriksaan kebenaran sebelum optimasi kinerja. Jalur yang telah diperbaiki kemudian menjalani rekayasa kinerja ekstensif untuk fase decode dan prefill, yang menunjukkan bahwa inferensi efisien pada CDNA2 dibatasi oleh faktor di luar bandwidth memori, termasuk ketidaksesuaian format eksekusi FP4, pemanfaatan M yang rendah, dan biaya sinkronisasi per lapisan.
Metodologi mencakup pemulihan kebenaran dan optimasi kinerja. Pertama, ketidaksesuaian tata letak W2 routed-expert diatasi dengan mengidentifikasi permutasi keluaran dan memperbaiki tata letak bobot pada waktu pemuatan. Pemeriksaan kebenaran berbasis token tetap dan hash ditetapkan untuk memvalidasi akurasi numerik. Untuk kinerja decode, beberapa optimasi diterapkan: bobot FP4 packed, kuantisasi aktivasi INT8, instruksi dot-product CDNA2, peer-read all-reduce, dan geometri kernel yang sadar topologi. Percepatan prefill menggunakan kernel MFMA CDNA2, pemanfaatan ulang bobot packed yang lebih baik, pengurangan overhead sparse attention, chunk yang lebih besar, dan penyetelan ulang pengurutan expert. Sistem dievaluasi pada empat GCD MI250 dengan paralelisme tensor (TP4) dan paralelisme expert (EP1). Metrik kinerja utama adalah throughput decode (token per detik) dan time-to-first-token (TTFT) untuk panjang prompt tertentu. Arsitektur ini mengintegrasikan beberapa komponen seperti ditunjukkan pada diagram Mermaid di bawah ini.

Mengapa penting

Temuan ini mengungkapkan bahwa inferensi DeepSeek-V4-Flash yang efisien pada CDNA2 memerlukan perhatian cermat terhadap kebenaran numerik dan optimasi khusus perangkat keras. Ketidaksesuaian tata letak W2 routed-expert menegaskan pentingnya memvalidasi jalur eksekusi sebelum penyetelan kinerja. Rekayasa kinerja menunjukkan bahwa pemanfaatan fitur CDNA2 seperti instruksi dot-product dan kernel MFMA dapat menghasilkan keuntungan substansial. Namun, hambatan yang tersisa—ketidaksesuaian format eksekusi FP4, pemanfaatan M yang rendah, dan sinkronisasi per lapisan—menunjukkan bahwa perbaikan lebih lanjut mungkin memerlukan perubahan arsitektur atau penjadwalan yang lebih canggih. Throughput decode yang dicapai sebesar 74,5 tok/s dan TTFT ~2,06 s untuk prompt 4,6k token merupakan langkah signifikan menuju praktisnya model MoE besar pada GPU AMD. Pekerjaan selanjutnya dapat mengeksplorasi skema kuantisasi alternatif, tumpang tindih komputasi dan komunikasi yang lebih baik, serta optimasi untuk arsitektur CDNA lainnya.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…