Editorial ilmu komputer
Open AccessOA2026
OpRAG: Runtime Deterministik-Sumber Daya untuk Alur Kerja RAG Multi-Tahap Berbasis GPU
Lapisan orkestrasi terdistribusi yang memperlakukan tahap RAG sebagai operator sadar sumber daya, memangkas overhead non-model hingga 20,7% tanpa menyentuh kernel decoding LLM.
Arup Kumar Sarker; Mills Staylor; Aymen Alsaadi; Gregor von Laszewski; Shantenu Jha; Geoffrey Fox· 2026· DOI 10.48550/arXiv.2608.08340
Masalah inti
Sistem agentic retrieval-augmented generation (RAG) merangkai preprocessing, embedding, retrieval, akses memori, konstruksi konteks, generation, dan pembaruan indeks vektor. Meskipun decoding LLM terikat GPU, lapisan orkestrasi di sekitarnya sering menjadi bottleneck melalui overhead serialisasi, penjadwalan yang terfragmentasi, batching yang tidak efisien, dan stall pipeline CPU–GPU. Kerangka kerja yang ada seperti LangChain, LangGraph, CrewAI, dan AutoGen menawarkan alur kontrol yang fleksibel, dan runtime terdistribusi seperti Ray menyediakan paralelisme tugas yang skalabel, tetapi keduanya tidak mengekspos tahap RAG sebagai operator sadar sumber daya dengan semantik eksekusi yang deterministik. Kesenjangan inilah yang memotivasi OpRAG, runtime terdistribusi deterministik-sumber daya untuk alur kerja RAG multi-tahap berbasis GPU. Hipotesis utamanya adalah bahwa mengoptimalkan lapisan orkestrasi terdistribusi dapat meningkatkan kinerja end-to-end secara substansial tanpa memodifikasi kernel decoding LLM. OpRAG dievaluasi dengan Llama3-8B dan Mistral-7B di bawah FlashAttention 2, eksekusi BF16, dan 32K chunk RAG, menyasar throughput pipeline GPU end-to-end dan latensi penyajian ku
Inovasi
Dalam eksperimen pipeline GPU end-to-end, OpRAG meningkatkan kinerja dibandingkan pesaing terdekat sebesar 16,16% untuk Llama3-8B dan 15,66% untuk Mistral-7B. Terhadap RayScalableRAG, keuntungannya adalah 20,57% dan 20,71%. Dibandingkan baseline kerangka kerja terbaik di antara LangChain, LangGraph, CrewAI, dan AutoGen, OpRAG 17,77% lebih cepat untuk Llama3-8B dan 17,48% lebih cepat untuk Mistral-7B. Dalam penyajian kueri bergaya Higress, OpRAG menurunkan latensi hybrid retrieval sebesar 59,20–59,62% dan latensi skenario generation sebesar 52,48–53,55%, sambil mempertahankan 100% Recall@5. Hasil ini menunjukkan bahwa peningkatan kinerja yang substansial dapat dicapai murni melalui optimasi lapisan orkestrasi, tanpa mengubah kernel decoding LLM. Konsistensi keuntungan di dua keluarga model dan dua skenario penyajian menunjukkan bahwa bottleneck yang ditangani—serialisasi, fragmentasi penjadwalan, ketidakefisienan batching, dan stall CPU–GPU—bersifat umum, bukan spesifik model.
Sistem agentic retrieval-augmented generation (RAG) merangkai preprocessing, embedding, retrieval, akses memori, konstruksi konteks, generation, dan pembaruan indeks vektor. Meskipun decoding LLM terikat GPU, lapisan orkestrasi di sekitarnya sering menjadi bottleneck melalui overhead serialisasi, penjadwalan yang terfragmentasi, batching yang tidak efisien, dan stall pipeline CPU–GPU. Kerangka kerja yang ada seperti LangChain, LangGraph, CrewAI, dan AutoGen menawarkan alur kontrol yang fleksibel, dan runtime terdistribusi seperti Ray menyediakan paralelisme tugas yang skalabel, tetapi keduanya tidak mengekspos tahap RAG sebagai operator sadar sumber daya dengan semantik eksekusi yang deterministik. Kesenjangan inilah yang memotivasi OpRAG, runtime terdistribusi deterministik-sumber daya untuk alur kerja RAG multi-tahap berbasis GPU. Hipotesis utamanya adalah bahwa mengoptimalkan lapisan orkestrasi terdistribusi dapat meningkatkan kinerja end-to-end secara substansial tanpa memodifikasi kernel decoding LLM. OpRAG dievaluasi dengan Llama3-8B dan Mistral-7B di bawah FlashAttention 2, eksekusi BF16, dan 32K chunk RAG, menyasar throughput pipeline GPU end-to-end dan latensi penyajian kueri bergaya Higress.
OpRAG memodelkan embedding, retrieval, reasoning, memory, dan upsert sebagai operator kelas satu dan menurunkannya ke dalam graf eksekusi sadar komunikasi. Runtime ini menggabungkan beberapa teknik sistem: bidang data Arrow zero-copy untuk menghilangkan salinan serialisasi, worker persisten untuk mengamortisasi startup proses, antrean terbatas untuk backpressure dan keamanan memori, prefetching tokenizer CPU untuk menumpang-tindihkan tokenisasi dengan pekerjaan GPU, embedding GPU ter-batch untuk memaksimalkan utilisasi perangkat, dan eksekusi retrieval/generation yang tumpang-tindih untuk menyembunyikan latensi retrieval di balik decoding. Mekanisme ini diorkestrasi untuk mengurangi overhead non-model di sekitar inferensi LLM sambil mempertahankan semantik eksekusi yang deterministik. Desain ini dievaluasi terhadap dua kelas baseline: runtime RAG terdistribusi (RayScalableRAG) dan kerangka kerja agentic (LangChain, LangGraph, CrewAI, AutoGen). Eksperimen menggunakan Llama3-8B dan Mistral-7B dengan FlashAttention 2, presisi BF16, dan 32K chunk RAG. Evaluasi mencakup throughput pipeline GPU end-to-end dan penyajian kueri bergaya Higress, mengukur latensi hybrid retrieval, latensi skenario generation, dan Recall@5. Graf operator dapat direpresentasikan sebagai graf asiklik berarah di mana node adalah operator beranotasi sumber daya dan edge membawa tensor berbasis Arrow:
Mengapa penting
Hasil ini memvalidasi tesis inti bahwa lapisan orkestrasi merupakan persoalan kinerja tingkat pertama dalam RAG multi-tahap berbasis GPU. Dengan mengekspos tahap RAG sebagai operator sadar sumber daya dengan semantik eksekusi yang deterministik, OpRAG memungkinkan optimasi sistematis komunikasi dan penjadwalan yang ortogonal terhadap peningkatan tingkat model. Bidang data Arrow zero-copy dan worker persisten secara langsung menyerang overhead serialisasi dan startup, sementara antrean terbatas dan prefetching tokenizer CPU meredam stall pipeline. Embedding GPU ter-batch dan eksekusi retrieval/generation yang tumpang-tindih meningkatkan utilisasi perangkat dan menyembunyikan latensi. Terpeliharanya 100% Recall@5 menegaskan bahwa optimasi ini tidak menukar kualitas retrieval dengan kecepatan. Implikasi utamanya adalah praktisi dapat mengadopsi OpRAG sebagai runtime drop-in di sekitar stack penyajian LLM yang ada, memperoleh peningkatan throughput dua digit tanpa pelatihan ulang atau modifikasi kernel. Batasan mencakup evaluasi pada dua keluarga model dan satu ukuran chunk (32K); pekerjaan selanjutnya harus mengeksplorasi cakupan model yang lebih luas, alokasi sumber daya dinamis, dan penjadwalan multi-tenant. Kandidat taksonomi—Architecture, Cybersecurity, Network, Cryptography—menyarankan potensi perluasan ke RAG multi-pihak yang aman dan penerapan sadar jaringan, meskipun pekerjaan ini berfokus pada kinerja dan determinisme.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…