Editorial ilmu komputer
Open AccessOA2026
Sintesis Konforman Hasil Deklaratif: Pemenuhan Spesifikasi Eksak Bentuk Tertutup dan Tolok Ukur Konformansi
Penjelasan formal dan tolok ukur untuk sintesis relasional cold-start yang secara eksak memenuhi hasil analitis yang dideklarasikan, ortogonal terhadap fidelitas.
Muhammed Rasin· 2026· DOI 10.48550/arXiv.2606.08736
Masalah inti
Pembangkitan data tabular sintetis telah didominasi oleh metode imitasi—kopula, GAN, dan model difusi—yang mempelajari distribusi nyata dan mengambil sampel darinya, dievaluasi berdasarkan fidelitas terhadap data nyata. Namun, sebagian besar kebutuhan praktis pada dasarnya berbeda: menghasilkan data **tanpa data sumber** ("cold start") yang mereproduksi **hasil analitis yang dideklarasikan** (misalnya, kurva pendapatan, tingkat churn, pangsa kelompok) pada skema relasional. Alat imitasi siap pakai tidak menawarkan antarmuka untuk target semacam itu, dan tidak ada sampler yang dapat mencapai agregat eksak karena pengambilan sampel memiliki varians. Makalah ini menamai tugas ini **sintesis konforman hasil**, berargumen bahwa sumbu evaluasinya adalah **konformansi** bukan fidelitas, dan menunjukkan kedua sumbu tersebut ortogonal. Pada dataset publik nyata, sintesisor terpelajar siap pakai yang dilatih pada data tersebut meleset dari agregat bulanan yang dideklarasikan sebesar 74 hingga 86 persen; steelman per periode memangkas melesetnya menjadi sekitar 19 persen dan tetap tidak dapat mencapai 0; generator bentuk tertutup mencapai tepat 0.
Inovasi
Evaluasi empiris pada dataset publik nyata menunjukkan kontras tajam antara imitasi dan konformansi. Sintesisor terpelajar siap pakai yang dilatih pada data yang seharusnya mereka imitasi meleset dari agregat bulanan yang dideklarasikan sebesar **74 hingga 86 persen**. Pendekatan steelman per periode mengurangi melesetnya menjadi sekitar **19 persen** tetapi tetap tidak dapat mencapai keeksakan. Sebaliknya, generator bentuk tertutup mencapai meleset **tepat 0**. Eksperimen terkontrol lebih lanjut mengukur biaya memberlakukan agregat eksak: paling banyak **0,006 dalam jarak 1-Wasserstein** terhadap marginal eksternal sembarang, dengan selisih sisanya diatribusikan pada ketidakcocokan keluarga bentuk. Ini menunjukkan bahwa agregasi eksak dapat dicapai dengan distorsi minimal terhadap distribusi marginal, dan bahwa tantangan utamanya bukan agregasi melainkan konformansi bersama dengan desiderata lainnya.
Pembangkitan data tabular sintetis telah didominasi oleh metode imitasi—kopula, GAN, dan model difusi—yang mempelajari distribusi nyata dan mengambil sampel darinya, dievaluasi berdasarkan fidelitas terhadap data nyata. Namun, sebagian besar kebutuhan praktis pada dasarnya berbeda: menghasilkan data **tanpa data sumber** ("cold start") yang mereproduksi **hasil analitis yang dideklarasikan** (misalnya, kurva pendapatan, tingkat churn, pangsa kelompok) pada skema relasional. Alat imitasi siap pakai tidak menawarkan antarmuka untuk target semacam itu, dan tidak ada sampler yang dapat mencapai agregat eksak karena pengambilan sampel memiliki varians. Makalah ini menamai tugas ini **sintesis konforman hasil**, berargumen bahwa sumbu evaluasinya adalah **konformansi** bukan fidelitas, dan menunjukkan kedua sumbu tersebut ortogonal. Pada dataset publik nyata, sintesisor terpelajar siap pakai yang dilatih pada data tersebut meleset dari agregat bulanan yang dideklarasikan sebesar 74 hingga 86 persen; steelman per periode memangkas melesetnya menjadi sekitar 19 persen dan tetap tidak dapat mencapai 0; generator bentuk tertutup mencapai tepat 0.
Makalah ini menyediakan penjelasan formal yang menunjukkan bahwa keluarga generator agregat eksak yang banyak digunakan adalah tepat **conditional-sum sampling dari populasi Gamma** (melalui karakterisasi Lukacs), dengan keeksakan bentuk tertutup, koefisien variasi (CV) marginal bentuk tertutup, dan invariansi skala. Eksperimen terkontrol memetakan batasnya: memberlakukan agregat eksak berbiaya paling banyak 0,006 dalam jarak 1-Wasserstein terhadap marginal eksternal sembarang, dengan sisanya adalah ketidakcocokan keluarga bentuk. Penulis menyumbangkan:
Mengapa penting
Makalah ini berargumen bahwa konformansi dan fidelitas adalah **sumbu yang ortogonal**. Fidelitas mengukur seberapa dekat data sintetis menyerupai data nyata, sedangkan konformansi mengukur seberapa eksak data sintetis memenuhi hasil analitis yang dideklarasikan. Metode imitasi unggul dalam fidelitas tetapi gagal dalam konformansi, terutama dalam skenario cold-start ketika tidak ada data nyata. Pendekatan bentuk tertutup yang diusulkan mencapai konformansi eksak, marginal bentuk tertutup, integritas, determinisme, dan nol data sumber—properti yang esensial untuk aplikasi seperti perencanaan skenario, berbagi data yang menjaga privasi, dan pengujian pipeline analitis. Penulis mengakui bahwa ketika data nyata tersedia, fidelitas pada imitasi mungkin lebih disukai. Namun, untuk pengaturan cold-start, sintesis konforman hasil mengisi celah kritis. Pengenalan **SpecBench** menyediakan cara terstandardisasi untuk mengukur konformansi, yang memungkinkan penelitian selanjutnya. Karakterisasi formal melalui teorema Lukacs menawarkan landasan teoretis, dan sifat invariansi skala menjamin ketangguhan pada berbagai skala. Batas jarak 1-Wasserstein sebesar 0,006 menunjukkan bahwa biaya agregasi eksak dapat diabaikan, sehingga pendekatan ini praktis. Secara keseluruhan, karya ini menggeser paradigma dari imitasi ke pemenuhan spesifikasi, dengan implikasi luas bagi pembangkitan data sintetis.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…