Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

"Apakah Data Ini Akan Merusak Tugas Saya?" - Sintesis Interaktif Unit Test Data yang Sadar Tugas

PrismaDV: Sistem AI Gabungan untuk Analisis Data-Kode Bersama dan Validasi Data yang Sadar Tugas
Hao Chen; Arnab Phani; Sebastian Schelterยท 2026ยท DOI 10.48550/arXiv.2608.09376

Masalah inti

Data adalah sumber daya utama bagi perusahaan dan institusi modern, dan kesalahan data yang menyebar melalui pipeline data menimbulkan dampak serius di produksi. Karena itu, validasi data sangat penting untuk memastikan keandalan aplikasi hilir. Hal ini mendorong pengembangan unit test data, yaitu program yang dapat dieksekusi untuk menguji data sebelum dipindahkan melalui pipeline data besar. Namun, kerangka kerja yang ada menurunkan unit test data hanya dari data yang diamati, mengabaikan semantik kode yang mengonsumsi data di hilir. Untuk itu, kami memperkenalkan PrismaDV, sistem AI gabungan yang menyintesis unit test data yang sadar tugas untuk data tabular dengan menganalisis data dan kode tugas hilir secara bersama. PrismaDV menguraikan pembuatan test menjadi beberapa langkah berbasis LLM: profiling data, deteksi akses kolom, analisis aliran data dalam kode tugas, dan inferensi asumsi data implisit. Selanjutnya, sistem menyintesis kode untuk unit test data, dan memelihara "graf asumsi data-kode" internal yang menghubungkan batasan data yang dihasilkan kembali ke kode sumber tugas. Kami mendemonstrasikan PrismaDV melalui antarmuka web interaktif tempat peserta menjalankan sist

Inovasi

PrismaDV didemonstrasikan melalui antarmuka web interaktif tempat peserta menjalankan sistem pada lima dataset dunia nyata dengan 60 tugas hilir. Antarmuka ini memungkinkan peserta menyintesis, memeriksa, dan menyempurnakan asumsi bahasa alami tentang data serta batasan data yang dapat dieksekusi. Hasil utama dari demonstrasi ini meliputi:

- **Baseline sadar tugas vs. tidak sadar tugas**: Antarmuka memungkinkan perbandingan unit test data yang sadar tugas dengan baseline yang tidak sadar tugas pada batch data yang salah. Test yang sadar tugas terbukti lebih efektif mendeteksi kesalahan yang akan merusak tugas hilir, karena memasukkan semantik kode tugas.
- **Penyempurnaan interaktif**: Peserta dapat menavigasi graf asumsi data-kode, mengedit asumsi dan batasan data, serta mengamati dampaknya pada pembuatan test. Lingkaran interaktif ini meningkatkan kualitas test yang dihasilkan.
- **Adaptasi pengoptimal prompt**: Peserta dapat mengamati bagaimana pengoptimal prompt khusus menyesuaikan sistem dengan dataset tertentu seiring waktu, yang menghasilkan kinerja lebih baik dan mengurangi upaya manual.

Sistem dievaluasi pada lima dataset dunia nyata dengan 60 tugas hilir, mencakup berba

Data adalah sumber daya utama bagi perusahaan dan institusi modern, dan kesalahan data yang menyebar melalui pipeline data menimbulkan dampak serius di produksi. Karena itu, validasi data sangat penting untuk memastikan keandalan aplikasi hilir. Hal ini mendorong pengembangan unit test data, yaitu program yang dapat dieksekusi untuk menguji data sebelum dipindahkan melalui pipeline data besar. Namun, kerangka kerja yang ada menurunkan unit test data hanya dari data yang diamati, mengabaikan semantik kode yang mengonsumsi data di hilir. Untuk itu, kami memperkenalkan PrismaDV, sistem AI gabungan yang menyintesis unit test data yang sadar tugas untuk data tabular dengan menganalisis data dan kode tugas hilir secara bersama. PrismaDV menguraikan pembuatan test menjadi beberapa langkah berbasis LLM: profiling data, deteksi akses kolom, analisis aliran data dalam kode tugas, dan inferensi asumsi data implisit. Selanjutnya, sistem menyintesis kode untuk unit test data, dan memelihara "graf asumsi data-kode" internal yang menghubungkan batasan data yang dihasilkan kembali ke kode sumber tugas. Kami mendemonstrasikan PrismaDV melalui antarmuka web interaktif tempat peserta menjalankan sistem pada lima dataset dunia nyata dengan 60 tugas hilir, menyintesis, memeriksa, dan menyempurnakan asumsi bahasa alami tentang data serta batasan data yang dapat dieksekusi. Antarmuka ini memungkinkan peserta menavigasi graf asumsi data-kode, membandingkan unit test data yang sadar tugas dengan baseline yang tidak sadar tugas pada batch data yang salah, dan mengedit asumsi serta batasan data secara interaktif. Selain itu, peserta dapat mengamati bagaimana pengoptimal prompt khusus menyesuaikan sistem dengan dataset tertentu seiring waktu.
PrismaDV adalah sistem AI gabungan yang menyintesis unit test data yang sadar tugas untuk data tabular dengan menganalisis data dan kode tugas hilir secara bersama. Sistem ini menguraikan pembuatan test menjadi beberapa langkah berbasis LLM:

Mengapa penting

Wawasan utama PrismaDV adalah bahwa validasi data harus sadar akan semantik tugas hilir. Dengan menganalisis data dan kode secara bersama, sistem dapat menyimpulkan asumsi implisit yang kritis bagi tugas tetapi tidak terlihat hanya dari data. Misalnya, suatu tugas mungkin mengasumsikan bahwa kolom tertentu hanya berisi nilai positif, atau bahwa kolom tanggal berada dalam format tertentu. Unit test data yang tidak sadar tugas akan melewatkan asumsi semacam itu, yang menyebabkan kegagalan di produksi.

Graf asumsi data-kode menyediakan cara yang transparan dan interaktif untuk menghubungkan batasan data ke kode sumber, sehingga pengguna dapat memahami dan menyempurnakan test. Hal ini menjawab tantangan umum dalam validasi data: kesenjangan antara data engineer dan software engineer. Dengan membuat asumsi menjadi eksplisit dan dapat diedit, PrismaDV memfasilitasi kolaborasi dan memastikan unit test data tetap selaras dengan kebutuhan tugas yang terus berkembang.

Pengoptimal prompt khusus adalah kontribusi penting lainnya. Hal ini memungkinkan sistem beradaptasi dengan dataset baru tanpa penyetelan manual yang ekstensif, sehingga skalabel untuk penggunaan perusahaan. Namun, ketergantungan pada LLM menimbulkan potensi tantangan, seperti kebutuhan akan prompt berkualitas tinggi dan risiko asumsi halusinatif. Pekerjaan selanjutnya dapat mengeksplorasi cara memvalidasi asumsi secara otomatis atau memasukkan umpan balik pengguna dengan lebih efisien.

Secara keseluruhan, PrismaDV merupakan langkah signifikan menuju validasi data yang sadar tugas, dengan potensi meningkatkan keandalan pipeline data di produksi. Antarmuka interaktif dan representasi berbasis graf yang mendasarinya membuatnya dapat diakses oleh pengguna teknis maupun non-teknis, sehingga mendorong praktik kualitas data yang lebih baik.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ