Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Karakterisasi Biaya Energi Permintaan dan Token untuk Beban Inferensi LLM pada Platform GPU

Model energi terurai mengungkap mengapa metrik ternormalisasi token menyesatkan penyajian LLM yang sadar energi pada GPU NVIDIA H100 dan H200
Prabhu Vellaisamy; Vanessa Lam; Shawn Blanton; John Paul Shen· 2026· DOI 10.48550/arXiv.2608.28044

Masalah inti

Penyajian inferensi large language model (LLM) dihargai secara komersial berdasarkan token, namun energi GPU yang mendasarinya dikonsumsi sepanjang jendela inferensi. Ketidaksesuaian akuntansi ini membuat metrik ternormalisasi token tidak lengkap: energi rata-rata token keluaran dapat menurun bahkan ketika energi total permintaan meningkat. Penulis berargumen bahwa penyajian yang sadar energi karena itu harus mengoptimalkan energi permintaan dan energi token secara bersamaan, bukan hanya menurunkan biaya energi per token.

Studi ini dimotivasi oleh pengamatan bahwa satu permintaan menanggung biaya prefill satu kali ditambah biaya setup generasi yang tetap, sementara setiap langkah generasi token keluaran berikutnya hanya menambah energi langkah marginal. Secara formal, energi total permintaan dapat dinyatakan sebagai:

dengan adalah panjang keluaran. Energi ternormalisasi token kemudian adalah

, yang sangat sensitif terhadap serta terhadap batching dan panjang konteks. Makalah ini mengarakterisasi perilaku tersebut di seluruh tipe mod

Inovasi

Hasil menunjukkan bahwa energi token dan energi permintaan dapat bergerak ke arah yang berlawanan. Untuk Llama-3.2-1B pada H200 dengan batch-16 dan konteks-4K, menaikkan panjang keluaran dari 10 menjadi 512 token menurunkan energi token dari 7,46 menjadi 0,72 J/token, sementara energi total jendela inferensi ter-batch meningkat dari 1,19 menjadi 5,93 kJ. Ini adalah ilustrasi langsung dari ketidaksesuaian akuntansi: energi per token membaik sekitar satu orde besaran, namun energi absolut yang dikonsumsi per permintaan tumbuh sekitar 5x.

Batching juga menurunkan energi token, tetapi keuntungannya terbatas oleh konteks. Pada 10 token keluaran, keuntungan batch-16 terhadap batch-1 turun dari 6,31x pada konteks-512 menjadi 1,17x pada konteks-4K. Dengan kata lain, manfaat batching berkurang seiring bertambahnya panjang konteks, karena biaya prefill dan setup yang tetap menjadi fraksi yang lebih besar dari total energi jendela.

Model MoE memperkuat efek ini. Routing sparse dan eksekusi expert yang terfragmentasi meningkatkan energi tetap pada konkurensi rendah. Namun, batching menyebarkan energi tetap tersebut ke lebih banyak token yang dihasilkan dan secara substansial mempersempit cel

Penyajian inferensi large language model (LLM) dihargai secara komersial berdasarkan token, namun energi GPU yang mendasarinya dikonsumsi sepanjang jendela inferensi. Ketidaksesuaian akuntansi ini membuat metrik ternormalisasi token tidak lengkap: energi rata-rata token keluaran dapat menurun bahkan ketika energi total permintaan meningkat. Penulis berargumen bahwa penyajian yang sadar energi karena itu harus mengoptimalkan energi permintaan dan energi token secara bersamaan, bukan hanya menurunkan biaya energi per token.
Studi ini dimotivasi oleh pengamatan bahwa satu permintaan menanggung biaya prefill satu kali ditambah biaya setup generasi yang tetap, sementara setiap langkah generasi token keluaran berikutnya hanya menambah energi langkah marginal. Secara formal, energi total permintaan dapat dinyatakan sebagai:

Mengapa penting

Implikasi utamanya adalah penyajian yang sadar energi harus mengoptimalkan energi permintaan dan energi token secara bersamaan. Mengoptimalkan hanya energi per token dapat menyembunyikan kenaikan energi total permintaan, terutama ketika panjang keluaran meningkat atau ketika panjang konteks besar. Model terurai ini menyediakan cara yang berprinsip untuk menalar trade-off: biaya prefill dan setup yang tetap diamortisasi ke lebih banyak token seiring bertambahnya , tetapi energi langkah marginal tetap terakumulasi secara linear.

Bagi operator, panduan praktisnya adalah memperlakukan batching dan panjang konteks sebagai knob yang saling terkait. Batching menurunkan energi token, tetapi keuntungannya terbatas oleh konteks; pada konteks panjang, biaya prefill tetap mendominasi dan batching hanya menghasilkan perbaikan energi token yang moderat. Untuk model MoE, penerapan pada konkurensi rendah sangat tidak efisien karena routing sparse memfragmentasi eksekusi expert dan menaikkan energi tetap, sedangkan batching memulihkan sebagian besar celah antara dense dan MoE.

Penulis menyimpulkan bahwa metrik ternormalisasi token tidak lengkap untuk penyajian yang sadar energi. Pandangan dua tujuan—energi permintaan dan energi token—diperlukan untuk menghindari kesimpulan yang menyesatkan. Kandidat taksonomi untuk karya ini mencakup Architecture, Cybersecurity, Network, dan Cryptography, meskipun kontribusi utamanya adalah dalam karakterisasi energi untuk inferensi LLM pada platform GPU.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…