Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Memvalidasi Pemulihan Cache Hybrid-State untuk GLM-5.3-Flash dengan vLLM dan LMCache

Perbaikan integrasi yang divalidasi secara eksperimental untuk pemulihan cache hybrid-state pada paralelisme tensor empat arah
Frank Liยท 2026ยท DOI 10.48550/arXiv.2609.15030

Masalah inti

Transfer cache eksternal dapat berhasil sementara model bahasa hibrida melanjutkan dari keadaan yang tidak konsisten. Digest ini meneliti model penuh GLM-5.3-Flash 45 lapis, menggunakan checkpoint terkuantisasi RedHatAI/GLM-5.3-Flash-NVFP4 dengan vLLM dan LMCache pada paralelisme tensor empat arah. Masalah utamanya adalah ketidakcocokan pemulihan: pemulihan complete-hit memulihkan keadaan untuk prompt penuh sementara penjadwal mengkredit satu token lebih sedikit. Ketidakcocokan semacam itu berarti keadaan internal model dan penghitungan penjadwal menyimpang, berpotensi merusak generasi berikutnya. Kontribusinya adalah perbaikan integrasi yang divalidasi secara eksperimental dengan menerapkan prinsip penyelarasan checkpoint yang sudah ada. Bukti terbatas pada satu revisi model dan konfigurasi terkendali; hal ini tidak menetapkan determinisme umum, kesetaraan kualitas tugas, keuntungan penyajian bersamaan, atau kapasitas di luar memori GPU.

Inovasi

Dalam beban kerja serial sembilan panjang, kesesuaian dengan kontrol komputasi ulang yang dimodifikasi meningkat dari 34/36 menjadi 36/36 generasi, masing-masing berisi 64 token ID. Proses instrumentasi terpisah lulus pemeriksaan transfer-page, effective-tail, dan delayed-save yang tercatat. Tiga templat sintetis tambahan lulus 72 kelanjutan 256 token berpasangan di dua proses container baru. Studi kinerja serial berikutnya mempertahankan kesetaraan output pada 120 permintaan; di antara uji yang diukur, pemuatan ulang CPU mengurangi waktu ke token pertama sebesar 46-64% dan total waktu permintaan sebesar 1,9-7,0% relatif terhadap komputasi ulang dingin yang dimodifikasi. Hasil ini menunjukkan bahwa pencarian strict-prefix dan perbaikan penyelarasan checkpoint menghilangkan ketidakcocokan pemulihan yang diamati sambil mempertahankan kesetaraan output dalam konfigurasi yang diuji.
Transfer cache eksternal dapat berhasil sementara model bahasa hibrida melanjutkan dari keadaan yang tidak konsisten. Digest ini meneliti model penuh GLM-5.3-Flash 45 lapis, menggunakan checkpoint terkuantisasi RedHatAI/GLM-5.3-Flash-NVFP4 dengan vLLM dan LMCache pada paralelisme tensor empat arah. Masalah utamanya adalah ketidakcocokan pemulihan: pemulihan complete-hit memulihkan keadaan untuk prompt penuh sementara penjadwal mengkredit satu token lebih sedikit. Ketidakcocokan semacam itu berarti keadaan internal model dan penghitungan penjadwal menyimpang, berpotensi merusak generasi berikutnya. Kontribusinya adalah perbaikan integrasi yang divalidasi secara eksperimental dengan menerapkan prinsip penyelarasan checkpoint yang sudah ada. Bukti terbatas pada satu revisi model dan konfigurasi terkendali; hal ini tidak menetapkan determinisme umum, kesetaraan kualitas tugas, keuntungan penyajian bersamaan, atau kapasitas di luar memori GPU.
Penulis menyelaraskan pemulihan melalui pencarian strict-prefix dan menetapkan perbandingan numerik menggunakan koreksi komputasi bersama, penjadwalan checkpoint yang dipasangkan, dan konfigurasi kernel per-rank yang tetap. Pengaturan eksperimen menggunakan model penuh GLM-5.3-Flash 45 lapis dengan checkpoint terkuantisasi RedHatAI/GLM-5.3-Flash-NVFP4, vLLM, dan LMCache pada paralelisme tensor empat arah. Perbaikan ini menerapkan prinsip penyelarasan checkpoint yang sudah ada pada jalur pemulihan cache hybrid-state. Evaluasi dilakukan secara bertahap: pertama, beban kerja serial sembilan panjang yang membandingkan kesesuaian dengan kontrol komputasi ulang yang dimodifikasi; kedua, proses instrumentasi yang memeriksa kondisi transfer-page, effective-tail, dan delayed-save yang tercatat; ketiga, tiga templat sintetis tambahan dengan 72 kelanjutan 256 token berpasangan di dua proses container baru; dan keempat, studi kinerja serial pada 120 permintaan yang mengukur kesetaraan output, waktu ke token pertama, dan total waktu permintaan. Kondisi kontrol adalah komputasi ulang dingin yang dimodifikasi, dan perlakuan adalah pemuatan ulang CPU dari cache eksternal.

Mengapa penting

Kontribusinya adalah perbaikan integrasi yang divalidasi secara eksperimental dengan menerapkan prinsip penyelarasan checkpoint yang sudah ada. Bukti terbatas pada satu revisi model dan konfigurasi terkendali; hal ini tidak menetapkan determinisme umum, kesetaraan kualitas tugas, keuntungan penyajian bersamaan, atau kapasitas di luar memori GPU. Peningkatan dari 34/36 menjadi 36/36 generasi menunjukkan bahwa pencarian strict-prefix menyelesaikan ketidakcocokan penghitungan token penjadwal. Keuntungan kinerja, meskipun hanya diukur dalam uji serial, menunjukkan bahwa pemuatan ulang CPU dapat mengurangi latensi tanpa mengubah output. Namun, cakupan validasi tetap sempit: satu revisi model, checkpoint terkuantisasi tertentu, dan paralelisme tensor empat arah. Penelitian selanjutnya harus menguji konfigurasi yang lebih luas, penyajian bersamaan, dan kesetaraan kualitas tugas. Perbaikan itu sendiri adalah perbaikan integrasi yang tertarget, bukan solusi umum untuk konsistensi cache hybrid-state.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ