Editorial ilmu komputer
Open AccessOA2026
Seleksi kandidat sadar data dalam terjemahan NL2SQL melalui instansi pemisah kecil
Pendekatan berbasis provenans untuk memilih kandidat SQL terbaik ketika hanya tersedia sedikit opsi
Stanislav Kikot; Alexander Shulgin; Yanwei Xuยท 2026ยท DOI 10.48550/arXiv.2605.12319
Masalah inti
Sistem terjemahan bahasa alami ke SQL (NL2SQL) sering menghasilkan beberapa kueri SQL kandidat untuk satu pertanyaan bahasa alami. Memilih kandidat yang benar sangat penting untuk eksekusi kueri yang akurat. Metode seleksi tradisional bergantung pada skor konsistensi atau jumlah kandidat yang besar, tetapi dalam banyak skenario praktis, hanya sedikit kandidat yang tersedia dan tidak ada skor konsistensi yang diberikan. Makalah ini mengatasi kesenjangan tersebut dengan mengusulkan metode seleksi kandidat sadar data berdasarkan instansi pemisah dan provenans. Metode ini bertujuan mengidentifikasi kandidat yang paling sesuai dengan maksud pengguna dengan memanfaatkan instansi basis data untuk menemukan contoh pembeda yang kecil. Penulis mengevaluasi pendekatan mereka pada subset benchmark BIRD-DEV dan membandingkannya dengan tiga baseline alami. Hasilnya menunjukkan bahwa metode mereka secara signifikan mengungguli baseline ketika hanya dua atau tiga kandidat diberikan dan tidak ada skor konsistensi yang tersedia. Kode tersedia di https://github.com/staskikotx/SISelection.
Inovasi
Penulis mengevaluasi metode mereka pada subset benchmark BIRD-DEV, yaitu dataset skala besar untuk tugas NL2SQL. Mereka membandingkan dengan tiga baseline alami: seleksi acak, seleksi berdasarkan panjang kueri, dan seleksi berdasarkan heuristik sederhana. Eksperimen berfokus pada skenario ketika hanya dua atau tiga kandidat tersedia dan tidak ada skor konsistensi yang diberikan. Hasilnya menunjukkan bahwa SISelection secara signifikan mengungguli semua baseline dalam pengaturan tersebut. Misalnya, ketika dua kandidat diberikan, akurasi SISelection jauh lebih tinggi daripada baseline. Peningkatan ini konsisten di berbagai subset BIRD-DEV. Penulis juga menganalisis dampak ukuran instansi pemisah dan informasi provenans. Mereka menemukan bahwa penggunaan instansi yang lebih kecil menghasilkan akurasi seleksi yang lebih baik, karena instansi yang lebih kecil lebih mungkin menangkap perbedaan esensial antar kueri. Informasi provenans lebih lanjut menyempurnakan seleksi dengan menyoroti bagian kueri mana yang bertanggung jawab atas perbedaan tersebut. Kode dan pengaturan eksperimen tersedia di repositori GitHub yang disediakan.
Sistem terjemahan bahasa alami ke SQL (NL2SQL) sering menghasilkan beberapa kueri SQL kandidat untuk satu pertanyaan bahasa alami. Memilih kandidat yang benar sangat penting untuk eksekusi kueri yang akurat. Metode seleksi tradisional bergantung pada skor konsistensi atau jumlah kandidat yang besar, tetapi dalam banyak skenario praktis, hanya sedikit kandidat yang tersedia dan tidak ada skor konsistensi yang diberikan. Makalah ini mengatasi kesenjangan tersebut dengan mengusulkan metode seleksi kandidat sadar data berdasarkan instansi pemisah dan provenans. Metode ini bertujuan mengidentifikasi kandidat yang paling sesuai dengan maksud pengguna dengan memanfaatkan instansi basis data untuk menemukan contoh pembeda yang kecil. Penulis mengevaluasi pendekatan mereka pada subset benchmark BIRD-DEV dan membandingkannya dengan tiga baseline alami. Hasilnya menunjukkan bahwa metode mereka secara signifikan mengungguli baseline ketika hanya dua atau tiga kandidat diberikan dan tidak ada skor konsistensi yang tersedia. Kode tersedia di https://github.com/staskikotx/SISelection.
Metode yang diusulkan, bernama SISelection (Small Separating Instance Selection), beroperasi pada sekumpulan kueri SQL kandidat yang dihasilkan untuk pertanyaan bahasa alami. Untuk setiap pasangan kandidat, metode ini mencari instansi basis data kecil (sekumpulan tuple) yang membedakan keduanya: mengeksekusi kedua kueri pada instansi ini menghasilkan hasil yang berbeda. Instansi semacam itu disebut instansi pemisah. Metode ini kemudian menggunakan informasi provenans untuk menentukan kandidat mana yang lebih mungkin benar berdasarkan pertanyaan pengguna. Secara formal, diberikan basis data dan himpunan kueri kandidat
, untuk setiap pasangan , kami menemukan instansi kecil sehingga . Ukuran diminimalkan untuk memastikan contoh pembeda sederhana dan dapat diinterpretasikan. Provenans kemudian digunakan untuk melacak bagian kueri mana yang berkontribusi terhadap perbedaan. Kandidat yang paling selaras dengan pertanyaan bahasa alami, sebagaimana ditentukan oleh fungsi penilaian yang mempertimbangkan instansi pemisah dan provenans, dipilih. Metode ini sadar data karena secara aktif menanyakan basis data untuk menemukan instansi tersebut, bukan hanya mengandalkan struktur kueri. Arsitektur keseluruhan diilustrasikan dalam diagram Mermaid berikut:
Mengapa penting
Makalah ini menunjukkan bahwa seleksi kandidat sadar data menggunakan instansi pemisah kecil efektif untuk terjemahan NL2SQL, terutama ketika hanya sedikit kandidat yang tersedia. Hal ini penting karena dalam aplikasi dunia nyata, sistem NL2SQL mungkin tidak menghasilkan banyak kandidat, dan skor konsistensi mungkin tidak tersedia. Ketergantungan metode pada instansi basis data membuatnya tangguh terhadap variasi struktur kueri. Namun, pendekatan ini memiliki batasan: menemukan instansi pemisah kecil dapat mahal secara komputasi, terutama untuk basis data besar. Penulis menyarankan bahwa pekerjaan selanjutnya dapat berfokus pada optimalisasi pencarian instansi pemisah dan memperluas metode untuk menangani lebih banyak kandidat. Penilaian berbasis provenans juga dapat ditingkatkan dengan memasukkan informasi semantik dari pertanyaan bahasa alami. Secara keseluruhan, metode ini memberikan arah yang menjanjikan untuk meningkatkan akurasi NL2SQL dalam pengaturan praktis. Kandidat taksonomi untuk pekerjaan ini mencakup Architecture, Cybersecurity, Network, dan Cryptography, meskipun fokus utamanya adalah pada manajemen data dan pemrosesan bahasa alami.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ