Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2025

PIM Is All You Need: Sistem Tanpa GPU Berbasis CXL untuk Inferensi Large Language Model

CENT: Ekspansi memori berbasis CXL ditambah pemrosesan near-bank untuk melayani dekode LLM yang terikat memori tanpa GPU
Yu-Feng Gu; Alireza Khadem; S. Umesh; Ning Liang; Xavier Servot; O. Mutlu; Ravi Iyer; Reetuparna Dasยท International Conference on Architectural Support for Programming Languages and Operating Systemsยท 2025ยท DOI 10.1145/3676641.3716267

Masalah inti

Inferensi Large Language Model (LLM) secara mendasar berbeda dari beban kerja yang membentuk desain akselerator modern. Dihasilkan secara autoregresif, satu token pada satu waktu, dekode LLM menunjukkan **intensitas operasional** yang jauh lebih rendah daripada model Machine Learning (ML) sebelumnya seperti transformer encoder-only dan Convolutional Neural Network. Selama dekode, setiap parameter model biasanya harus dibaca dari memori untuk menghasilkan satu token berikutnya, sehingga rasio kerja aritmetika terhadap byte yang dipindahkan merosot menuju satu operasi per byte, bukan rezim kaya komputasi yang dahulu ditempati CNN dan encoder.

Secara formal, untuk model decoder padat dengan parameter yang disimpan pada byte per bobot, intensitas aritmetika suatu langkah dekode pada ukuran batch dapat didekati sebagai

dengan adalah jejak cache key-value. Karena dibatasi dalam praktik, intensitas yang dapat dicapai tetap jauh di bawah titik keseimbangan komputas

Inovasi

Evaluasi membandingkan CENT dengan baseline GPU yang dikonfigurasi pada ukuran batch maksimum yang didukung dan pada daya rata-rata serupa. Dalam kondisi tersebut CENT mencapai **throughput 2,3x lebih tinggi** dan mengonsumsi **energi 2,3x lebih rendah**. Kedua angka bergerak ke arah berlawanan โ€” faktor yang sama muncul dalam throughput dan energi โ€” yang menyiratkan bahwa pengurangan energi yang dilaporkan adalah perolehan efisiensi yang sebenarnya, bukan artefak dari menurunkan titik pembanding ke rezim daya rendah.

Hasil yang paling penting adalah ekonomi. CENT **menurunkan Total Cost of Ownership (TCO)**, menghasilkan **5,2x lebih banyak token per dolar** daripada GPU. Ini adalah metrik yang paling penting bagi operator, karena menggabungkan biaya akuisisi perangkat keras, penalti pemanfaatan yang dibayarkan ketika komputasi mahal menganggur dalam beban kerja yang terikat memori, dan tagihan energi. Kerangka abstraknya adalah bahwa sistem kontemporer membuat pengguna membayar sumber daya komputasi mahal yang kurang termanfaatkan untuk tugas inferensi LLM yang terikat memori; angka 5,2x token per dolar mengkuantifikasi besarnya salah alokasi tersebut.

Baseline pembanding dinyat

Inferensi Large Language Model (LLM) secara mendasar berbeda dari beban kerja yang membentuk desain akselerator modern. Dihasilkan secara autoregresif, satu token pada satu waktu, dekode LLM menunjukkan **intensitas operasional** yang jauh lebih rendah daripada model Machine Learning (ML) sebelumnya seperti transformer encoder-only dan Convolutional Neural Network. Selama dekode, setiap parameter model biasanya harus dibaca dari memori untuk menghasilkan satu token berikutnya, sehingga rasio kerja aritmetika terhadap byte yang dipindahkan merosot menuju satu operasi per byte, bukan rezim kaya komputasi yang dahulu ditempati CNN dan encoder.
Secara formal, untuk model decoder padat dengan parameter yang disimpan pada byte per bobot, intensitas aritmetika suatu langkah dekode pada ukuran batch dapat didekati sebagai

Mengapa penting

Signifikansi CENT melampaui hasil satu sistem; ini adalah klaim tentang ke mana dolar marginal dalam penyajian LLM seharusnya diarahkan. Selama sebagian besar era akselerator, kendala pengikatnya adalah throughput komputasi, dan respons desainnya adalah memperlebar unit vektor, menambahkan mesin matriks, dan mengarahkan bandwidth yang sangat besar untuk memberi mereka makan. CENT membalik urutan itu. Ia berangkat dari pengamatan bahwa inferensi LLM terikat memori, bahwa cache key-value untuk konteks hingga 1 juta token mengonsumsi kapasitas yang unik untuk setiap prompt, dan bahwa kedua fakta ini bersama-sama membatasi ukuran batch yang dapat diamortisasi oleh desain apa pun yang berpusat pada komputasi. Dengan titik awal itu, membelanjakan area silikon untuk komputasi di sisi memori dan untuk fabric CXL yang menskalakan kapasitas dan bandwidth adalah alokasi yang lebih baik daripada membelanjakan untuk lebih banyak FLOPS.

Konsekuensi arsitekturalnya konkret. Pertama, pemrosesan near-bank mengubah granularitas di mana paralelisme diekspos: alih-alih mempartisi pekerjaan ke sejumlah kecil akselerator yang sangat lebar, CENT mempartisi ke banyak unit near-bank yang moderat, dan jaringan CXL yang skalabel โ€” dengan primitif peer-to-peer dan kolektifnya โ€” menyediakan substrat sinkronisasi yang dibutuhkan pemartisian tersebut. Kedua, menghilangkan GPU dari jalur inferensi mengubah kisah kapasitas, karena ekspansi memori CXL tersedia dalam kenaikan yang terpisah dari akuisisi akselerator. Ketiga, peningkatan 5,2x token per dolar yang dilaporkan menunjukkan bahwa TCO, bukan throughput puncak, seharusnya menjadi ukuran utama jasa bagi infrastruktur penyajian LLM.

Desain ini juga memunculkan pertanyaan yang tidak dapat diselesaikan digest hanya dari abstrak. Interaksi antara PIM near-bank dan protokol koherensi CXL, bandwidth yang dapat dicapai dari fabric CXL di bawah komunikasi kolektif, dan sensitivitas hasil throughput 2,3x terhadap ukuran model, lebar kuantisasi , serta panjang konteks semuanya perlu ditelaah. Dalam taksonomi yang digunakan untuk koleksi ini, CENT berada di persimpangan **Architecture** (PIM near-bank, hierarki memori, fabric heterogen) dan **Network** (interkoneksi CXL skalabel dengan komunikasi peer-to-peer dan kolektif). Dimensi keamanan bersifat implisit alih-alih dieksplorasi: fabric tempat perangkat memori bertukar data secara langsung melalui primitif peer-to-peer memperluas permukaan serangan dibandingkan jalur yang dimediasi host, dan penyajian LLM multi-tenant melalui memori CXL bersama memunculkan pertanyaan isolasi yang tidak ditangani karya ini. Meskipun demikian, kesimpulan utamanya langsung โ€” untuk inferensi LLM yang terikat memori, memorilah sistemnya.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ