Characterization of Request and Token Energy Costs for LLM Inference Workloads on GPU Platforms
Prabhu Vellaisamy; Vanessa Lam; Shawn Blanton; John Paul Shen
- Summary
- LLM inference is priced by tokens but GPU energy is consumed over inference windows, creating an accounting mismatch. This work decomposes inference energy into fixed prefill/setup costs and marginal per-token step energy, showing that ave…
- Method
- Penulis mengusulkan model energi terurai untuk beban inferensi LLM. Model ini memisahkan energi menjadi tiga komponen: (1) biaya prefill tetap satu kali, (2) biaya setup generasi …
- Results
- Hasil menunjukkan bahwa energi token dan energi permintaan dapat bergerak ke arah yang berlawanan. Untuk Llama-3.2-1B pada H200 dengan batch-16 dan konteks-4K, menaikkan panjang keluaran dari 10 menj…