Editorial ilmu komputer
Optimasi Keterampilan Residual untuk Ansambel Text-to-SQL
Masalah inti
Sistem Text-to-SQL semakin banyak mengadopsi strategi ansambel: alih-alih mengandalkan satu kandidat SQL yang dihasilkan, sistem tersebut menarik beberapa kandidat dan memilih satu, biasanya melalui verifier atau mekanisme voting. Batas teoretis ansambel semacam itu dibatasi oleh Pass@K, yaitu probabilitas bahwa setidaknya satu dari K kandidat adalah benar. Metode yang ada memperoleh keragaman secara heuristik melalui stochastic decoding (misalnya temperature sampling) atau varian prompt, yang sering menghasilkan himpunan kandidat yang didominasi oleh kegagalan berkorelasi—jika model dasar memiliki kesalahpahaman sistematis terhadap skema atau dialek, semua K kandidat dapat berbagi kesalahan yang sama.
Makalah ini memperkenalkan **DivSkill-SQL**, kerangka kerja optimasi keterampilan residual yang membangun ansambel Text-to-SQL agentic komplementer tanpa fine-tuning model apa pun. Wawasan utamanya adalah memperlakukan setiap keterampilan baru sebagai residual learner: keterampilan tersebut dioptimalkan secara khusus pada contoh-contoh yang gagal ditangani ansambel keterampilan saat ini, sehingga secara terbukti menyasar kontribusi marginalnya terhadap Pass@K. Kerangka kerja ini die
Inovasi
Pada Spider2-Lite, DivSkill-SQL meningkatkan akurasi terpilih hingga **+11,1 poin pada Snowflake** dan **+8,3 poin pada BigQuery** dibandingkan baseline ansambel terkuat. Peningkatan ini konsisten pada dua model dasar: Opus-4.6 dan GPT-5.4. Kerangka kerja ini juga menunjukkan transfer lintas dialek: keterampilan yang dioptimalkan pada satu dialek (misalnya Snowflake) meningkatkan kinerja pada dialek lain (BigQuery, SQLite) tanpa pelatihan ulang. Selain itu, transfer ke formulasi tugas yang berbeda, BIRD-Critic, menghasilkan peningkatan **+2,6 poin**.
Diagnostik kesalahan mengungkapkan bahwa peningkatan tersebut bukan sekadar dari variasi bentuk permukaan. Jumlah referensi skema dan pemanggilan fungsi yang terhalusinasi berkurang hingga **3x**, menunjukkan bahwa keterampilan komplementer tersebut benar-benar lebih andal. Ini adalah hasil kunci: ansambel tidak hanya lebih beragam, tetapi lebih akurat pada tingkat kandidat individual.
Ringkasan hasil utama ditunjukkan di bawah ini:
| Dataset / Dialect | Baseline (best ensemble) | DivSkill-SQL | Improvement |
|-------------------|--------------------------|--------------|-------------|
| Spider2-Lite (Snowflake) | — | — | +11.1 pts
Mengapa penting
Kontribusi inti DivSkill-SQL adalah pergeseran dari keragaman heuristik ke **optimasi keterampilan residual**. Dengan secara eksplisit menyasar mode kegagalan ansambel saat ini, kerangka kerja ini secara terbukti meningkatkan kontribusi marginal setiap keterampilan baru terhadap Pass@K. Hal ini berbeda dengan stochastic decoding atau varian prompt, yang sering menghasilkan kegagalan berkorelasi karena mengambil sampel dari distribusi model dasar yang sama.
Hasil transfer lintas dialek dan lintas tugas sangat menjanjikan. Hasil tersebut menunjukkan bahwa keterampilan residual mempelajari pola penalaran SQL yang dapat digeneralisasi—seperti menangani join kompleks, subquery, atau schema linking—yang tidak terikat pada dialek atau tugas tertentu. Hal ini memiliki implikasi praktis: satu set keterampilan dapat digunakan di berbagai sistem basis data tanpa pelatihan ulang, sehingga mengurangi beban rekayasa.
Pengurangan referensi skema dan pemanggilan fungsi yang terhalusinasi (hingga 3x lebih sedikit) menunjukkan bahwa ansambel tidak hanya lebih beragam tetapi juga lebih andal. Hal ini penting karena dalam aplikasi Text-to-SQL di dunia nyata, halusinasi dapat menyebabkan kueri yang salah atau bahkan berbahaya.
Salah satu batasannya adalah kerangka kerja ini memerlukan loop optimasi iteratif, yang mungkin mahal secara komputasi. Namun, penulis mencatat bahwa tidak diperlukan fine-tuning model, yang menurunkan hambatan adopsi. Penelitian selanjutnya dapat mengeksplorasi cara yang lebih efisien untuk mengidentifikasi kegagalan residual atau menentukan secara otomatis jumlah keterampilan yang dibutuhkan.
Secara keseluruhan, DivSkill-SQL merupakan langkah maju yang signifikan dalam membangun ansambel Text-to-SQL yang tangguh, dengan hasil empiris yang kuat dan pendekatan yang berprinsip terhadap keragaman.
Siapa yang sebaiknya membaca
Membuka konten member…