Editorial ilmu komputer
LLMVisor: Model Atribusi Latensi Waktu Nyata untuk Penyajian LLM Multi-Tenant
Masalah inti
Ketika inferensi large language model (LLM) bergeser dari penyebaran single-tenant ke kluster GPU multi-tenant, co-batching menjadi mekanisme default untuk meningkatkan throughput. Dengan menggabungkan permintaan dari banyak tenant ke dalam satu forward pass, operator mengamortisasi overhead peluncuran kernel dan menaikkan utilisasi perangkat keras. Namun, efisiensi inilah yang mengaburkan penggunaan sumber daya per-tenant: begitu permintaan difusikan ke dalam satu batch, penjadwal kehilangan visibilitas atas seberapa besar latensi, bandwidth memori, dan komputasi yang sebenarnya dikonsumsi setiap permintaan.
Opasitas ini membatasi kendali. Tanpa primitif atribusi per-permintaan yang akurat, penyedia tidak dapat menegakkan kebijakan fair-share, tidak dapat menagih tenant berdasarkan konsumsi sebenarnya, dan tidak dapat membuat keputusan penjadwalan berbutir halus seperti preemption atau admission control. Kebutuhan intinya karena itu adalah **primitif atribusi per-permintaan waktu nyata** yang akurat sekaligus cukup ringan untuk dieksekusi di dalam loop penjadwalan itu sendiri.
Para penulis menyajikan **LLMVisor**, model atribusi latensi berbasis roofline. LLMVisor menangkap dua
Inovasi
LLMVisor dievaluasi terhadap baseline penghitungan token pada dua keluarga model dan dua generasi GPU. Hasil utamanya kuat: LLMVisor mencapai **R-squared nyaris sempurna** untuk atribusi latensi, yang menunjukkan bahwa bentuk piecewise-linear roofline menjelaskan hampir seluruh varians dalam latensi batch yang teramati.
Penurunan galat relatif dibandingkan baseline penghitungan token cukup besar dan konsisten di seluruh persentil:
- **Prefill:** hingga **2,5x** penurunan pada p90 dan **3,3x** pada p99.
- **Decode:** hingga **3,5x** penurunan pada p90 dan **4,4x** pada p99.
Keuntungan ini bertahan *meskipun* ada variabilitas batching dan divergensi sekuens โ dua kondisi yang paling menekan model atribusi, karena batch heterogen mencampur permintaan dengan profil komputasi dan memori yang sangat berbeda. Fakta bahwa peningkatan lebih besar pada p99 daripada p90 menunjukkan bahwa LLMVisor sangat efektif meredam galat atribusi latensi ekor, yang justru merupakan galat yang paling penting untuk penegakan SLA dan penjadwalan fair-share.
Peningkatan pada decode yang melebihi peningkatan pada prefill konsisten dengan intuisi roofline: decode bersifat memory-bound dan lebih sensitif ter
Mengapa penting
Signifikansi LLMVisor tidak terletak pada satu angka akurasi tertentu, melainkan pada **primitif** yang disediakannya. Penyajian LLM multi-tenant telah terjebak dalam rezim di mana co-batching meningkatkan throughput tetapi menghancurkan observabilitas. LLMVisor memulihkan observabilitas pada granularitas yang penting โ permintaan individual โ dan melakukannya cukup murah untuk berada di dalam penjadwal.
Beberapa pilihan desain patut diperhatikan. Pertama, bentuk **piecewise-linear** adalah kompromi yang disengaja: cukup ekspresif untuk menangkap transisi compute-bound/memory-bound, namun cukup sederhana untuk di-fit dan dievaluasi dalam mikrodetik. Model yang sepenuhnya nonlinear mungkin sedikit lebih baik dalam fitting, tetapi akan terlalu lambat untuk loop penjadwalan. Kedua, **dekomposisi aditif** inilah yang memungkinkan berbagi fraksional; tanpanya, atribusi hanya akan menghasilkan angka tingkat batch yang tidak dapat dibebankan ke tenant. Ketiga, penggunaan **FLOPs dan I/O memori** sebagai fitur, bukan jumlah token, adalah wawasan pemodelan kuncinya โ jumlah token adalah proksi yang justru runtuh ketika batch bersifat heterogen.
Keluasan evaluasi โ Llama 3.1-8B dan Qwen 2.5-14B/32B, A100 dan H100, dengan variasi tensor parallelism dan campuran beban kerja โ mendukung klaim bahwa pendekatan ini tidak overfit pada satu konfigurasi. Keuntungan yang lebih besar pada p99 daripada p90 menunjukkan LLMVisor tangguh terhadap kasus ekor yang mendominasi pelanggaran SLA di dunia nyata.
Batasan tersirat dalam cakupannya: model divalidasi pada inferensi transformer padat pada skala yang dievaluasi, dan koefisiennya harus di-fit per rezim dan per konfigurasi perangkat keras. Apakah bentuk piecewise-linear ini dapat digeneralisasi ke routing mixture-of-experts, speculative decoding, atau arsitektur prefill/decode yang terdisagregasi masih terbuka. Meski demikian, sebagai primitif atribusi waktu nyata untuk berbagi fraksional, LLMVisor menetapkan baseline praktis yang tidak dapat disamai heuristik penghitungan token.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ