Editorial ilmu komputer
Open AccessOA2026
PIPE-Cypher: Pembuatan Benchmark Enterprise Otomatis untuk Sistem Text-to-Cypher
Pipeline lokal untuk mengubah property graph aktif menjadi benchmark NL-to-Cypher yang seimbang dan dapat dieksekusi
Suraj Ranganath; Anish Raghavendraยท 2026ยท DOI 10.48550/arXiv.2606.08481
Masalah inti
Property graph enterprise sangat heterogen: strukturnya berbeda dalam skema, terminologi internal, asumsi domain, batasan tata kelola, dan pola interaksi pengguna. Akibatnya, benchmark Text2Cypher yang relevan untuk deployment harus mencerminkan pertanyaan yang benar-benar diajukan pengguna dan agen terhadap graph spesifik tersebut. Namun, membuat benchmark semacam itu sulit karena skema dan nilai bersifat unik untuk setiap graph, dan struktur graph terus berkembang seiring waktu. Setiap query bahasa alami (NL) yang dipasangkan dengan query Cypher harus dapat dieksekusi, menggunakan entitas graph nyata, mempertahankan keragaman, dan tetap seimbang di seluruh jenis query dan tingkat kesulitan. PIPE-Cypher menjawab kesenjangan ini dengan menyediakan pipeline lokal yang secara otomatis menghasilkan benchmark NL-to-Cypher yang seimbang dari property graph aktif dan seed query opsional yang berasal dari pertanyaan pelanggan, log analis, atau panggilan tool agen.
Inovasi
Dengan generasi dan penjurian Qwen3.5-9B lokal, PIPE-Cypher mengekspor **3.000 contoh FinBench/SNB yang diterima**. Pipeline ini menyelesaikan **tiga suite ablasi yang diaudit** untuk mengisolasi kontribusi setiap komponen. Perilaku judge dikalibrasi dengan label manusia, dan **11 model hilir lokal** dievaluasi pada benchmark yang dihasilkan. Benchmark ini sengaja bersifat diskriminatif: performa transfer zero-shot lemah, yang menunjukkan bahwa model kesulitan tanpa contoh spesifik skema. Namun, kontrol few-shot menunjukkan bahwa bank contoh spesifik skema dapat sangat membantu keluarga model yang kompatibel. Hasil ini menunjukkan bahwa PIPE-Cypher menghasilkan benchmark yang menantang dan realistis yang mencerminkan graph target dan beban kerjanya.
Property graph enterprise sangat heterogen: strukturnya berbeda dalam skema, terminologi internal, asumsi domain, batasan tata kelola, dan pola interaksi pengguna. Akibatnya, benchmark Text2Cypher yang relevan untuk deployment harus mencerminkan pertanyaan yang benar-benar diajukan pengguna dan agen terhadap graph spesifik tersebut. Namun, membuat benchmark semacam itu sulit karena skema dan nilai bersifat unik untuk setiap graph, dan struktur graph terus berkembang seiring waktu. Setiap query bahasa alami (NL) yang dipasangkan dengan query Cypher harus dapat dieksekusi, menggunakan entitas graph nyata, mempertahankan keragaman, dan tetap seimbang di seluruh jenis query dan tingkat kesulitan. PIPE-Cypher menjawab kesenjangan ini dengan menyediakan pipeline lokal yang secara otomatis menghasilkan benchmark NL-to-Cypher yang seimbang dari property graph aktif dan seed query opsional yang berasal dari pertanyaan pelanggan, log analis, atau panggilan tool agen.
PIPE-Cypher mengintegrasikan beberapa komponen ke dalam satu pipeline. Pertama, **schema profiling** mengekstrak ringkasan struktural dan statistik dari property graph. Kedua, **reverse-query grounding** menggunakan seed query untuk menjangkarkan generasi pada pola penggunaan nyata. Ketiga, **constrained generation** memakai LLM lokal (Qwen3.5-9B) untuk menghasilkan kandidat pasangan query NL/query Cypher di bawah batasan skema dan nilai. Keempat, **tata kelola Cypher deterministik** menegakkan aturan sintaksis dan semantik. Kelima, **validasi eksekusi** menjalankan setiap query Cypher terhadap graph aktif untuk memastikan kelayakan eksekusi dan kebenarannya. Keenam, **redaksi** menghapus informasi sensitif. Ketujuh, **kontrol keragaman** menyeimbangkan jenis query dan tingkat kesulitan. Terakhir, **LLM judge lokal yang terkalibrasi** menyaring dan memberi skor contoh. Pipeline ini diilustrasikan di bawah:
Mengapa penting
Transfer zero-shot yang lemah menyoroti sulitnya generalisasi antar property graph enterprise, tempat skema dan terminologi bersifat unik. Peningkatan few-shot menunjukkan bahwa menyediakan contoh in-context dari skema yang sama dapat menjembatani kesenjangan bagi model yang mampu memanfaatkannya. PIPE-Cypher menjadikan benchmarking Text2Cypher sebagai proses yang dapat diulang dan berkembang bersama graph, penggunanya, dan beban kerja targetnya. Dengan mengotomatiskan pembuatan benchmark, proses ini mengurangi upaya manual dan memungkinkan evaluasi berkelanjutan saat graph berubah. Sifat lokal pipeline memastikan privasi data dan kepatuhan tata kelola. Pekerjaan selanjutnya dapat memperluas pendekatan ini ke bahasa query graph lain dan keluarga model yang lebih besar.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ