Karakterisasi Biaya Energi Permintaan dan Token untuk Beban Inferensi LLM pada Platform GPU
Prabhu Vellaisamy; Vanessa Lam; Shawn Blanton; John Paul Shen
- Ringkasan
- Inferensi LLM dihargai berdasarkan token, tetapi energi GPU dikonsumsi sepanjang jendela inferensi, sehingga menimbulkan ketidaksesuaian akuntansi. Karya ini menguraikan energi inferensi menjadi biaya prefill/setup tetap dan energi langkah…
- Metode
- Penulis mengusulkan model energi terurai untuk beban inferensi LLM. Model ini memisahkan energi menjadi tiga komponen: (1) biaya prefill tetap satu kali, (2) biaya setup generasi …
- Hasil
- Hasil menunjukkan bahwa energi token dan energi permintaan dapat bergerak ke arah yang berlawanan. Untuk Llama-3.2-1B pada H200 dengan batch-16 dan konteks-4K, menaikkan panjang keluaran dari 10 menj…