Editorial Ilmu Komputer & AI
Akselerator Perangkat Keras AI untuk Model Bahasa Besar: Arsitektur dan Dinding Memori
Masalah inti
Model bahasa besar (LLM) menempatkan tuntutan yang belum pernah terjadi sebelumnya dan masih terus tumbuh pada perangkat keras yang melatih dan melayaninya. Seiring skala model, panjang konteks, dan luas penerapan berkembang, lanskap akselerator telah terdiversifikasi jauh melampaui GPU serbaguna. Tinjauan ini menyurvei seluruh lanskap akselerator perangkat keras AI untuk LLM, termasuk GPU serbaguna, ASIC khusus seperti TPU, Trainium, Groq, dan Cerebras, FPGA yang dapat dikonfigurasi ulang, arsitektur processing-in-memory dan near-memory, serta pendekatan neuromorfik dan fotonik yang muncul di seluruh penerapan cloud dan edge.
Tesis utamanya adalah bahwa kendala yang menentukan pada akselerasi LLM bukanlah aritmetika melainkan memori. Dengan menggunakan struktur komputasi transformer dan analisis roofline sebagai kerangka kerja bersama, penulis menunjukkan bahwa fase decode autoregresif terikat bandwidth, cache key-value dapat menyaingi ukuran bobot model, dan perpindahan data mendominasi energi. Hal ini membingkai ulang desain akselerator di sekitar hierarki memori, bandwidth, dan lokalitas data, bukan sekadar FLOP puncak.
Inovasi
Analisis komparatif menghasilkan pola yang jelas: tidak ada satu arsitektur pun yang optimal di semua beban kerja. GPU tetap menjadi default yang fleksibel dan kuda pekerja pelatihan, berkat ekosistem perangkat lunak yang matang, komputasi puncak yang tinggi, dan kemampuan pemrograman umum. ASIC khusus domain menang pada skala untuk beban kerja yang stabil dan bervolume tinggi, di mana dataflow tetap dan hierarki memori khusus dapat disetel untuk keluarga model dan pola pelayanan tertentu.
Processing-in-memory (PIM) muncul sebagai respons jangka pendek paling menjanjikan terhadap dinding memori, masuk ke sistem sebagai pelengkap heterogen alih-alih pengganti menyeluruh. Dengan menempatkan komputasi di dekat atau di dalam larik memori, PIM mengurangi perpindahan data, yang diidentifikasi tinjauan ini sebagai biaya energi dominan. FPGA yang dapat dikonfigurasi ulang menawarkan kemampuan beradaptasi untuk operator yang berkembang dan kendala edge, meskipun dengan throughput puncak lebih rendah daripada GPU dan ASIC terdepan.
Komputasi neuromorfik dan fotonik, meskipun menjanjikan, belum siap produksi pada skala terdepan. Pendekatan neuromorfik menawarkan komputasi sparse yang digera
Mengapa penting
Klaim analitis utama tinjauan ini adalah bahwa untuk model bahasa besar, sistem memori telah menjadi komputer itu sendiri. Analisis roofline menjelaskan mengapa: fase decode terikat bandwidth, cache key-value dapat menyaingi ukuran bobot model, dan perpindahan data mendominasi energi. Akibatnya, keuntungan arsitektural semakin banyak berasal dari desain yang berpusat pada memori—bandwidth lebih tinggi, cache yang lebih besar dan lebih cerdas, komputasi near-memory dan in-memory, serta perpindahan data yang berkurang—bukan dari throughput aritmetika semata.
Pembingkaian ulang ini memiliki implikasi langsung bagi desain sistem. Sistem heterogen yang berpusat pada memori yang menggabungkan GPU, ASIC, dan akselerator PIM dapat mencocokkan fase dan beban kerja yang berbeda dengan substrat yang tepat. Ko-desain perangkat keras-algoritma menjadi esensial: kuantisasi, sparsitas, varian attention, dan manajemen KV-cache dapat menggeser intensitas operasional dan mengubah rezim roofline mana yang mendominasi.
Perbandingan di seluruh komputasi, memori, energi, kemampuan pemrograman, dan skalabilitas menunjukkan strategi portofolio alih-alih satu pemenang tunggal. GPU menyediakan fleksibilitas dan kekuatan pelatihan; ASIC menyediakan efisiensi skala untuk beban kerja yang stabil; PIM menyediakan respons jangka pendek terhadap dinding memori sebagai pelengkap; FPGA menyediakan kemampuan konfigurasi ulang; dan pendekatan neuromorfik serta fotonik tetap menjadi opsi berhorizon lebih panjang. Kemajuan di masa depan bergantung pada ko-desain perangkat keras-algoritma dan sistem heterogen yang berpusat pada memori, dengan hierarki memori—bukan unit aritmetika—sebagai target desain utama.
Siapa yang sebaiknya membaca
Membuka konten member…