Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

ETCInfer: Penjadwal Pendinginan Bersama yang Sadar Termal dan Hemat Energi untuk Inferensi LLM di Pusat Data AI

Pengendali berbasis pembelajaran dan fisika yang secara bersama mengoptimalkan setpoint CRAC, frekuensi GPU, dan ukuran micro-batch untuk menekan energi dan throttling termal sambil mempertahankan SLO latensi
Rui Lu; Rui Ge; Huanghuang Liang; Xiaobo Zhou; Dan Wang· 2026· DOI 10.48550/arXiv.2609.15230

Masalah inti

Inferensi large language model (LLM) di pusat data AI menggabungkan dua loop kendali yang biasanya terpisah: penyajian GPU dan pendinginan fasilitas. Menaikkan setpoint suhu lingkungan mengurangi energi pendinginan dan jejak karbon, tetapi juga menyusutkan ruang termal, memicu throttling GPU, dan dapat menyebabkan pelanggaran Service-Level-Objective (SLO). Makalah ini mempelajari kendali pendinginan–komputasi bersama untuk inferensi LLM, dengan tujuan meminimalkan energi GPU-plus-pendinginan per pekerjaan sambil memenuhi batasan keamanan termal dan SLO latensi.

Penulis mengidentifikasi trade-off mendasar: pendinginan agresif membuang energi, sedangkan pendinginan yang tidak memadai menurunkan kinerja dan melanggar target latensi. Penjadwal yang ada umumnya memperlakukan pendinginan dan komputasi sebagai sistem independen, sehingga melewatkan peluang optimasi lintas lapisan. ETCInfer mengatasi celah ini dengan merancang bersama pemilihan setpoint Computer Room Air Conditioner (CRAC) pra-pekerjaan dengan adaptasi frekuensi per-GPU dan ukuran micro-batch selama eksekusi.

Inovasi

Evaluasi pada simulasi jejak nyata dan eksperimen validasi menunjukkan bahwa ETCInfer menurunkan total energi pekerjaan hingga 33,1%, paparan throttling termal hingga 92,9%, dan menjaga tingkat pelanggaran SLO di bawah 0,7% bahkan pada suhu lingkungan hingga . Hasil ini menunjukkan bahwa kendali pendinginan–komputasi bersama dapat mencapai penghematan energi yang substansial tanpa mengorbankan jaminan latensi.

Eksperimen membandingkan ETCInfer dengan penjadwal baseline yang entah menetapkan setpoint CRAC tetap atau hanya mengadaptasi parameter GPU. Pengurangan energi berasal dari daya pendinginan yang lebih rendah (karena setpoint lebih tinggi) dan throttling GPU yang berkurang (karena penyesuaian frekuensi dan micro-batch yang proaktif). Metrik paparan throttling termal, yang mengukur fraksi waktu GPU beroperasi di atas suhu aman, turun drastis, menandakan keamanan termal yang lebih baik.

Inferensi large language model (LLM) di pusat data AI menggabungkan dua loop kendali yang biasanya terpisah: penyajian GPU dan pendinginan fasilitas. Menaikkan setpoint suhu lingkungan mengurangi energi pendinginan dan jejak karbon, tetapi juga menyusutkan ruang termal, memicu throttling GPU, dan dapat menyebabkan pelanggaran Service-Level-Objective (SLO). Makalah ini mempelajari kendali pendinginan–komputasi bersama untuk inferensi LLM, dengan tujuan meminimalkan energi GPU-plus-pendinginan per pekerjaan sambil memenuhi batasan keamanan termal dan SLO latensi.
Penulis mengidentifikasi trade-off mendasar: pendinginan agresif membuang energi, sedangkan pendinginan yang tidak memadai menurunkan kinerja dan melanggar target latensi. Penjadwal yang ada umumnya memperlakukan pendinginan dan komputasi sebagai sistem independen, sehingga melewatkan peluang optimasi lintas lapisan. ETCInfer mengatasi celah ini dengan merancang bersama pemilihan setpoint Computer Room Air Conditioner (CRAC) pra-pekerjaan dengan adaptasi frekuensi per-GPU dan ukuran micro-batch selama eksekusi.

Mengapa penting

Wawasan kunci ETCInfer adalah bahwa pendinginan dan komputasi harus dikendalikan bersama, bukan secara independen. Dengan menggunakan model berbasis fisika untuk memperkirakan keadaan termal tersembunyi dan waktu-menuju-throttle, penjadwal dapat membuat keputusan proaktif yang menyeimbangkan energi, suhu, dan latensi. Formulasi POMDP menangkap keteramatan parsial dinamika termal, dan ETCAdapter berbasis pembelajaran menyediakan solusi praktis.

Hasilnya menunjukkan bahwa pusat data AI dapat dengan aman menaikkan suhu lingkungan jauh di atas batas konvensional (hingga 48°C) jika penjadwal inferensinya sadar termal. Ini berimplikasi signifikan untuk mengurangi jejak karbon dan biaya operasional. Namun, pendekatan ini bergantung pada telemetri dan kalibrasi yang akurat; pekerjaan selanjutnya dapat mengeksplorasi ketahanan terhadap derau sensor dan pergeseran model. Selain itu, implementasi saat ini berfokus pada satu jenis pekerjaan; memperluas ke beban kerja heterogen dan pengaturan multi-tenant masih menjadi tantangan terbuka.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…