Editorial Ilmu Komputer & AI
Unified AI Gateway: Kerangka Kerja untuk Perutean Model dan Pengelolaan KV Cache secara Bersama
Masalah inti
Inferensi large language model (LLM) semakin mencakup model-model yang berbeda dalam ukuran, kemampuan, harga, dan penyedia. Pergeseran ini menciptakan dua biaya bagi pengembang. Pertama adalah biaya integrasi untuk memilih di antara dan beralih di antara banyak model. Kedua adalah biaya inferensi untuk membangun ulang KV cache ketika tidak tersedia atau tidak kompatibel dengan model yang dipilih.
Makalah ini mendefinisikan dan menganalisis **Unified AI Gateway** sebagai pengaturan sistem untuk pusat lalu lintas AI yang diterapkan di edge. Sistem ini mengoordinasikan perutean model, pengelolaan KV cache, dan penempatan komputasi di seluruh perangkat akhir, sumber daya edge, dan layanan model cloud. Pada saat permintaan, gateway secara bersama memilih model target, lokasi eksekusi, dan aksi KV cache di bawah batasan kualitas tugas, latensi, biaya, dan sumber daya. Secara paralel, aksi pengelolaan cache di latar belakang mengoptimalkan keputusan penempatan, replikasi, pengambilan, dan siklus hidup KV cache untuk permintaan berikutnya.
Karya ini menyintesis bukti yang ada tentang penggunaan ulang KV cache, kompresi, pemetaan lintas model, penyimpanan terdistribusi, dan transfer, ser
Inovasi
Pada delapan profil beban kerja tipikal, simulasi analitis tingkat beban kerja melaporkan percepatan TTFT sebesar – dan manfaat biaya input sebesar –. Rentang ini menunjukkan bahwa optimasi bersama atas perutean model, penempatan eksekusi, dan aksi KV cache dapat menghasilkan peningkatan latensi dan biaya yang substansial dibandingkan strategi dasar yang memperlakukan keputusan-keputusan ini secara terpisah.
Hasil ini berasal dari simulasi analitis, bukan dari sistem yang telah diterapkan, sehingga mewakili proyeksi tingkat beban kerja di bawah batasan yang dimodelkan. Makalah ini tidak melaporkan rincian per profil dalam abstrak; rentang tersebut merangkum manfaat yang diamati pada delapan profil.
Mengapa penting
Unified AI Gateway menangani dua biaya yang berbeda: biaya integrasi untuk memilih di antara dan beralih di antara banyak model, serta biaya inferensi untuk membangun ulang KV cache ketika tidak tersedia atau tidak kompatibel dengan model yang dipilih. Dengan secara bersama memilih model target, lokasi eksekusi, dan aksi KV cache pada saat permintaan, gateway dapat menghindari pembangunan ulang cache yang tidak perlu dan menyelaraskan pilihan model dengan batasan latensi, biaya, kualitas, dan sumber daya.
Komponen pengelolaan cache di latar belakang melengkapi keputusan pada saat permintaan dengan mengoptimalkan keputusan penempatan, replikasi, pengambilan, dan siklus hidup KV cache untuk permintaan berikutnya. Pemisahan perhatian ini memungkinkan sistem meningkatkan tingkat cache hit dan mengurangi overhead transfer seiring waktu.
Makalah ini menyintesis bukti yang ada tentang penggunaan ulang KV cache, kompresi, pemetaan lintas model, penyimpanan terdistribusi, dan transfer, serta membahas tantangan yang tersisa dalam mengintegrasikan kemampuan-kemampuan ini ke dalam satu sistem. Tantangan terbuka utama meliputi kompatibilitas cache lintas model, konsistensi cache terdistribusi, dan overhead transfer cache di seluruh tingkat perangkat, edge, dan cloud.
Percepatan TTFT yang dilaporkan sebesar – dan manfaat biaya input sebesar – menunjukkan bahwa pendekatan gateway terpadu ini menjanjikan, tetapi sifat evaluasi berupa simulasi analitis berarti studi penerapan di dunia nyata diperlukan untuk memvalidasi temuan ini.
Siapa yang sebaiknya membaca
Membuka konten member…