Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

SPA: Kerangka Reinforcement Learning Sadar Rencana SQL untuk Penulisan Ulang Query dengan LLM

RL sadar rencana dengan pembentukan reward adaptif dan perbaikan mandiri untuk optimasi query basis data
Xinyi Huang; Zhengjie Miaoยท 2026ยท DOI 10.48550/arXiv.2606.08620

Masalah inti

Penulisan ulang query SQL meningkatkan kinerja basis data tanpa perubahan skema atau indeks, tetapi menemukan penulisan ulang yang efektif untuk beban kerja analitis modern tetap sulit. Metode berbasis aturan terbatas pada transformasi yang telah ditentukan, sedangkan pendekatan berbasis LLM sering menghasilkan penulisan ulang yang valid secara semantik tetapi dikompilasi menjadi rencana fisik yang setara atau menurunkan kinerja runtime. Makalah ini memperkenalkan SPA, kerangka reinforcement learning sadar rencana SQL yang melatih LLM untuk menulis ulang query menggunakan umpan balik eksekusi fisik. SPA merumuskan penulisan ulang sebagai masalah optimasi kebijakan dan memperluas GRPO dengan reward yang mencakup kesetaraan semantik, jarak penulisan ulang tekstual, divergensi rencana fisik, dan percepatan runtime. Untuk menangani kelangkaan reward di berbagai tingkat kesulitan query, SPA memperkenalkan Probability-Gated Adaptive Reward Shaping, kurikulum tingkat query yang hanya membuka reward tingkat lebih tinggi setelah kelompok rollout mencapai penguasaan yang memadai atas tujuan tingkat lebih rendah. SPA juga meningkatkan efisiensi sampel melalui perbaikan mandiri on-policy denga

Inovasi

SPA dievaluasi pada beban kerja in-distribution (IID) dan out-of-distribution (OOD). SPA mengungguli baseline berbasis aturan dan LLM yang kuat dalam runtime end-to-end. Kerangka ini secara substansial mengurangi penulisan ulang yang memperlambat dan menghasilkan keuntungan tail-latency yang kuat. Hasil kuantitatif spesifik tidak disediakan dalam abstrak, tetapi penulis melaporkan peningkatan yang konsisten di seluruh pengaturan IID dan OOD.
Penulisan ulang query SQL meningkatkan kinerja basis data tanpa perubahan skema atau indeks, tetapi menemukan penulisan ulang yang efektif untuk beban kerja analitis modern tetap sulit. Metode berbasis aturan terbatas pada transformasi yang telah ditentukan, sedangkan pendekatan berbasis LLM sering menghasilkan penulisan ulang yang valid secara semantik tetapi dikompilasi menjadi rencana fisik yang setara atau menurunkan kinerja runtime. Makalah ini memperkenalkan SPA, kerangka reinforcement learning sadar rencana SQL yang melatih LLM untuk menulis ulang query menggunakan umpan balik eksekusi fisik. SPA merumuskan penulisan ulang sebagai masalah optimasi kebijakan dan memperluas GRPO dengan reward yang mencakup kesetaraan semantik, jarak penulisan ulang tekstual, divergensi rencana fisik, dan percepatan runtime. Untuk menangani kelangkaan reward di berbagai tingkat kesulitan query, SPA memperkenalkan Probability-Gated Adaptive Reward Shaping, kurikulum tingkat query yang hanya membuka reward tingkat lebih tinggi setelah kelompok rollout mencapai penguasaan yang memadai atas tujuan tingkat lebih rendah. SPA juga meningkatkan efisiensi sampel melalui perbaikan mandiri on-policy dengan mendaur ulang penulisan ulang yang memperlambat dari kebijakan saat ini sebagai sinyal pelatihan yang tertarget.
SPA merumuskan penulisan ulang query sebagai masalah optimasi kebijakan di mana kebijakan LLM menghasilkan query SQL yang ditulis ulang berdasarkan query asli. Kerangka ini memperluas Group Relative Policy Optimization (GRPO) dengan fungsi reward gabungan:

Mengapa penting

Inovasi utama SPA terletak pada desain reward sadar rencana dan kurikulum adaptifnya. Dengan memasukkan divergensi rencana fisik dan percepatan runtime, SPA secara langsung mengoptimalkan efisiensi eksekusi daripada sekadar kemiripan tekstual. Mekanisme Probability-Gated Adaptive Reward Shaping secara efektif mengatasi kelangkaan reward, memungkinkan model belajar secara progresif. Perbaikan mandiri on-policy lebih lanjut meningkatkan efisiensi sampel dengan mengubah kegagalan (penulisan ulang yang memperlambat) menjadi peluang belajar. Hasilnya menunjukkan bahwa SPA dapat menggeneralisasi ke beban kerja OOD, yang menunjukkan ketangguhan. Namun, makalah ini tidak membahas potensi batasan seperti overhead komputasi evaluasi rencana atau skalabilitas ke kumpulan query yang sangat besar. Pekerjaan selanjutnya dapat mengeksplorasi integrasi SPA dengan teknik optimasi basis data lain atau memperluasnya ke beban kerja multi-query.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ