Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Caching KV Bersama untuk Inferensi 27B yang Direplikasi: Kegagalan Kebenaran dan Batas Kinerja

Studi kasus rekayasa terkendali atas transfer cache KV antar-replika: jalur cadangan pointer mentah yang secara diam-diam menghilangkan dependensi CUDA stream, dan kondisi lokalitas yang membuat caching bersama benar-benar menguntungkan.
Frank Liยท 2026ยท DOI 10.48550/arXiv.2609.15021

Masalah inti

Layanan inferensi model besar yang direplikasi biasanya merutekan setiap permintaan ke salah satu dari beberapa replika identik. Ketika permintaan tiba di replika yang belum pernah melihat prefiksnya, replika tersebut harus menjalankan ulang prefill atas seluruh prompt sebelum dapat mengeluarkan token konten pertama. Untuk beban kerja konteks panjang, prefill ini mendominasi latensi: pada panjang input 128k dan 256k, biayanya diukur dalam puluhan detik. Caching memori host bersama adalah solusi alaminya. Jika state key/value (KV) yang dihasilkan satu replika dapat disimpan dalam pool yang dapat dibaca replika lain, permintaan yang berpindah antar-replika dapat melewati prefill sepenuhnya.

Premis studi ini adalah bahwa caching bersama hanya berguna jika dua kondisi independen terpenuhi secara bersamaan. Pertama, transfer state harus *benar*: halaman KV yang ditulis satu replika harus dapat dibaca replika lain tanpa melanggar jaminan pengurutan runtime akselerator yang mendasarinya. Kedua, transfer harus *layak*: permintaan harus benar-benar berpindah antar-replika cukup sering sehingga hilangnya lokalitas prefiks tidak menghapus manfaatnya. Makalah ini meneliti kedua kondisi pada p

Inovasi

Hasil kebenarannya tidak ambigu. Uji byte terkendali gagal ketika penundaan diterapkan pada jalur cadangan pointer mentah, dan lulus setelah dependensi pada CUDA stream saat ini dipulihkan. Alokator campuran yang ada menyediakan jalur penerapan yang berfungsi, dan pemeriksaan alokasi pool penuh plus regresi layanan melengkapi validasi. Dengan kata lain, kegagalannya bukan masalah kapasitas atau akuntansi di pool; ini masalah pengurutan di jalur transfer.

Hasil kinerjanya sama jelasnya pada tingkat permintaan tunggal. Dalam perbandingan empat blok OFF-ON-ON-OFF, median waktu ke token konten pertama antar-replika turun dari **31,715 s menjadi 0,605 s pada input 128k**, dan dari **92,047 s menjadi 0,790 s pada input 256k**. Ini adalah pengurangan sekitar 98% dan 99%. Penghematan absolutnya tumbuh seiring panjang konteks karena biaya prefill tumbuh seiring panjang konteks, sementara jalur cache menggantikan prefill dengan transfer halaman yang biayanya relatif kecil.

Hasil tingkat sesi lebih bernuansa. Sesi sintetis enam giliran yang bergantian antar-replika meningkat sekitar **35%** dan **45%** pada konteks awal **32k** dan **128k**. Peningkatannya lebih kecil daripada pengurangan p

Layanan inferensi model besar yang direplikasi biasanya merutekan setiap permintaan ke salah satu dari beberapa replika identik. Ketika permintaan tiba di replika yang belum pernah melihat prefiksnya, replika tersebut harus menjalankan ulang prefill atas seluruh prompt sebelum dapat mengeluarkan token konten pertama. Untuk beban kerja konteks panjang, prefill ini mendominasi latensi: pada panjang input 128k dan 256k, biayanya diukur dalam puluhan detik. Caching memori host bersama adalah solusi alaminya. Jika state key/value (KV) yang dihasilkan satu replika dapat disimpan dalam pool yang dapat dibaca replika lain, permintaan yang berpindah antar-replika dapat melewati prefill sepenuhnya.
Premis studi ini adalah bahwa caching bersama hanya berguna jika dua kondisi independen terpenuhi secara bersamaan. Pertama, transfer state harus *benar*: halaman KV yang ditulis satu replika harus dapat dibaca replika lain tanpa melanggar jaminan pengurutan runtime akselerator yang mendasarinya. Kedua, transfer harus *layak*: permintaan harus benar-benar berpindah antar-replika cukup sering sehingga hilangnya lokalitas prefiks tidak menghapus manfaatnya. Makalah ini meneliti kedua kondisi pada penerapan konkret: dua replika vLLM 27B satu-GPU yang berbagi pool LMCache 256 GiB.

Mengapa penting

Klaim utama studi ini adalah bahwa caching KV bersama diatur oleh dua gerbang independen: kebenaran transfer state dan pemeliharaan lokalitas prefiks. Gerbang kebenaran bersifat biner dan tidak kenal kompromi. Jalur cadangan pointer mentah yang menghilangkan dependensi CUDA stream dapat lulus pengujian kasual dan gagal di bawah penundaan yang diterapkan, yang persis merupakan jenis bug pengurutan laten yang menghasilkan korupsi intermiten dan sulit direproduksi di produksi. Obatnya bukan alokator baru melainkan sisi pengurutan eksplisit; alokator campuran yang ada sudah menyediakan jalur penerapan yang berfungsi.

Gerbang kinerja bersifat kondisional. Angka utamanya โ€” 31,715 s menjadi 0,605 s pada 128k dan 92,047 s menjadi 0,790 s pada 256k โ€” menggambarkan kasus terbaik: permintaan konteks panjang tunggal yang berpindah ke replika yang memiliki prefiksnya di cache. Hasil sesi, 35% dan 45% pada 32k dan 128k, menggambarkan kasus yang lebih realistis di mana hanya sebagian giliran melintasi replika. Kontrol penempatan tetap yang menunjukkan manfaat kecil menegaskan bahwa mekanismelah, bukan peningkatan pelayanan generik, yang mendorong keuntungan tersebut.

Implikasi praktisnya adalah pertanyaan kebijakan perutean. Caching bersama menguntungkan ketika router mengirim permintaan ke replika yang memegang prefiksnya, atau ketika sesi bergantian antar-replika cukup sering sehingga prefill tidak akan diulang. Jika router mematok sesi ke satu replika, pool menganggur dan manfaatnya hilang. Rekomendasi rekayasanya karena itu ada dua: validasi jalur transfer dengan uji penundaan terkendali yang memaksa bug pengurutan stream muncul, dan instrumentasi tingkat perutean antar-replika sebelum mengharapkan keuntungan tingkat sesi.

Model mental yang berguna tentang penerapannya ditunjukkan di bawah. Router memutuskan apakah prefiks suatu permintaan ada di pool bersama; jika ada, replika memuat halaman KV alih-alih menjalankan ulang prefill.

Pertanyaan terbuka yang tersisa adalah seberapa jauh batasnya meluas. Studi ini mencakup dua replika, satu ukuran pool, dan dua rezim konteks. Apakah kondisi lokalitas yang sama berlaku pada jumlah replika yang lebih tinggi, dengan distribusi prefiks yang heterogen, atau di bawah kontrol penerimaan yang mengeluarkan halaman dari pool, diserahkan ke pekerjaan mendatang. Yang ditetapkan studi kasus ini adalah bahwa gerbang kebenaran harus ditutup terlebih dahulu, dan bahwa gerbang kinerja adalah properti perutean, bukan semata-mata cache.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ