Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

SMetric: Memikirkan Ulang Penjadwalan LLM untuk Melayani Agen dengan Penjadwalan Berbasis Sesi yang Seimbang

Penjadwal berbasis sesi yang menyeimbangkan beban dan penggunaan ulang KV cache untuk penyajian LLM agentic
Jiahao Wang; Kaizhan Lin; Kaixi Zhang; Jinbo Han; Xingda Wei; Sijie Shen; Chenguang Fang; Wenyuan Yu; Rong Chen; Haibo Chenยท 2026ยท DOI 10.48550/arXiv.2607.08565

Masalah inti

Penjadwalan Large Language Model (LLM) sangat penting untuk penyajian, namun desain yang ada terutama dioptimalkan untuk permintaan obrolan yang dihasilkan manusia. Munculnya penyajian agentic, di mana agen otonom mengirimkan permintaan, secara fundamental mengubah karakteristik beban kerja. Agen mengonsumsi token jauh lebih banyak daripada manusia, menuntut throughput tinggi (TPS) pada latensi rendah, dan permintaan mereka menunjukkan penggunaan ulang KV cache yang jauh lebih besar dibandingkan obrolan. Penjadwal yang ada menghadapi trade-off antara keseimbangan beban dan penggunaan ulang KV cache: penjadwal yang sadar cache dapat memusatkan permintaan pada instance yang menyimpan KV, membiarkan instance lain menganggur, sementara penjadwal yang seimbang dapat mengorbankan peluang penggunaan ulang, yang mahal mengingat rasio penggunaan ulang yang tinggi. Makalah ini menyajikan SMetric, pendekatan penjadwalan berbasis sesi yang mengatasi trade-off ini dengan memanfaatkan penyimpanan KV tingkat global dan lokalitas sesi. Tantangan utamanya adalah mengidentifikasi sesi suatu permintaan secara stateless, yang dipecahkan SMetric melalui penjadwalan diferensial berdasarkan dua indikator

Inovasi

SMetric dievaluasi pada jejak dunia nyata. Dalam kolokasi prefill-decode dengan tingkat global yang disediakan, SMetric meningkatkan TPS puncak sebesar 9-15% dibandingkan penjadwal state-of-the-art. Dalam disagregasi, ia meningkatkan TPS prefill puncak sebesar 9%. Dalam kedua skenario, SMetric juga mencapai latensi yang lebih rendah. Hasil ini menunjukkan bahwa SMetric secara efektif menyeimbangkan beban dan memaksimalkan penggunaan ulang KV cache, yang mengarah pada keuntungan throughput yang signifikan dalam beban kerja penyajian agentic.
Penjadwalan Large Language Model (LLM) sangat penting untuk penyajian, namun desain yang ada terutama dioptimalkan untuk permintaan obrolan yang dihasilkan manusia. Munculnya penyajian agentic, di mana agen otonom mengirimkan permintaan, secara fundamental mengubah karakteristik beban kerja. Agen mengonsumsi token jauh lebih banyak daripada manusia, menuntut throughput tinggi (TPS) pada latensi rendah, dan permintaan mereka menunjukkan penggunaan ulang KV cache yang jauh lebih besar dibandingkan obrolan. Penjadwal yang ada menghadapi trade-off antara keseimbangan beban dan penggunaan ulang KV cache: penjadwal yang sadar cache dapat memusatkan permintaan pada instance yang menyimpan KV, membiarkan instance lain menganggur, sementara penjadwal yang seimbang dapat mengorbankan peluang penggunaan ulang, yang mahal mengingat rasio penggunaan ulang yang tinggi. Makalah ini menyajikan SMetric, pendekatan penjadwalan berbasis sesi yang mengatasi trade-off ini dengan memanfaatkan penyimpanan KV tingkat global dan lokalitas sesi. Tantangan utamanya adalah mengidentifikasi sesi suatu permintaan secara stateless, yang dipecahkan SMetric melalui penjadwalan diferensial berdasarkan dua indikator: giliran sesi dan hit KV lokal.
SMetric dibangun di atas dua wawasan kunci: (1) dengan penyimpanan KV tingkat global, mengejar keseimbangan beban tidak perlu mengorbankan penggunaan ulang KV, meskipun tingkat global yang lebih lambat harus digunakan dengan hati-hati; dan (2) mengingat lokalitas intra-sesi agen, merutekan permintaan berdasarkan sesinya dapat menyeimbangkan beban dengan penggunaan ulang KV yang tinggi. Untuk mewujudkan penjadwalan berbasis sesi secara stateless, SMetric menggunakan penjadwalan diferensial berdasarkan dua indikator yang berasal dari permintaan itu sendiri: giliran sesi dan hit KV lokal. Kebijakan penjadwalannya adalah sebagai berikut: permintaan giliran pertama dijadwalkan untuk keseimbangan beban, sedangkan permintaan lanjutan ditempelkan ke instance dengan hit lokal tertinggi untuk penggunaan ulang KV yang tinggi. Namun, karena sesi berbeda jauh dalam ukuran, SMetric hanya menempelkan permintaan lanjutan jika instance dapat melayaninya dalam Service Level Objective (SLO)-nya; jika tidak, ia memigrasikan sesi ke instance dengan beban paling ringan untuk mencegah banyak sesi panjang akhirnya membuat beban tidak seimbang. Pendekatan ini memastikan penggunaan ulang KV yang tinggi dan beban yang seimbang di seluruh instance. Logika penjadwalan dapat direpresentasikan sebagai:

Mengapa penting

Hasil ini menyoroti pentingnya penjadwalan berbasis sesi dalam penyajian LLM agentic. Dengan memanfaatkan lokalitas sesi dan penyimpanan KV tingkat global, SMetric mengatasi trade-off tradisional antara keseimbangan beban dan penggunaan ulang KV. Penjadwalan diferensial berdasarkan giliran sesi dan hit KV lokal memungkinkan identifikasi sesi secara stateless, yang krusial bagi penyedia model yang melayani agen arbitrer. Migrasi yang sadar SLO mencegah sesi panjang menyebabkan ketidakseimbangan beban, memastikan kinerja yang berkelanjutan. Peningkatan TPS dan latensi SMetric menegaskan potensinya untuk penerapan produksi. Pekerjaan selanjutnya dapat mengeksplorasi ambang SLO adaptif dan integrasi dengan strategi caching lainnya. Secara keseluruhan, SMetric merupakan langkah signifikan menuju penyajian LLM agentic yang efisien dan skalabel.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ