Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Croissant Baker: Pembuatan Metadata untuk Dataset ML yang Mudah Ditemukan, Terkelola, dan Dapat Digunakan Kembali

Alat CLI lokal-first dan open-source yang menghasilkan metadata Croissant tervalidasi langsung dari direktori dataset, mencapai kecocokan 97–100% dengan ground truth pada 140+ dataset.
Rafi Al Attrach; Rajna Fani; Sebastian Lobentanzer; Joan Giner-Miguelez; Debanshu Das; Varuni H. K.; Nobin Sarwar; Rajat Ghosh; Anwai Archit; Surbhi Motghare; Christina Conrad Parry; Luis Oala; Lara Grosso; Joaquin Vanschoren; Steffen Vogler; Sujata Goswami; Eric S. Rosenthal; Marzyeh Ghassemi; Matthew McDermott; Tom Pollard· 2026· DOI 10.48550/arXiv.2605.15079

Masalah inti

Dataset machine learning semakin membutuhkan metadata terstandar untuk mendukung penemuan, ingest otomatis, dan analisis yang dapat direproduksi. Croissant telah muncul sebagai standar metadata untuk dataset ML, menyediakan format berbasis JSON-LD yang terstruktur sehingga properti dataset dapat diperiksa mesin di berbagai platform. Adopsinya semakin cepat, dan NeurIPS kini mewajibkan metadata Croissant pada setiap pengajuan ke dataset track-nya. Namun, dalam praktiknya, pembuatan Croissant biasanya dimulai dengan mengunggah data ke platform publik—jalur yang tidak mungkin dilakukan untuk repositori lokal terkelola dan besar yang menyimpan banyak data bernilai tinggi yang semakin diandalkan ML. Makalah ini memperkenalkan Croissant Baker, alat command-line lokal-first dan open-source yang menghasilkan metadata Croissant tervalidasi langsung dari direktori dataset melalui registry handler modular. Penulis mengevaluasi Croissant Baker pada lebih dari 140 dataset, hingga skala MIMIC-IV dengan 886 juta baris dan 374 file Parquet. Pada perbandingan held-out terhadap ground truth yang dibuat produsen atau diturunkan dari standar, Croissant Baker mencapai kecocokan 97–100% di berbagai doma

Inovasi

Croissant Baker dievaluasi pada lebih dari 140 dataset, menunjukkan kemampuannya menangani beragam tipe dan skala data. Dataset terbesar yang diuji adalah MIMIC-IV, basis data perawatan kritis yang berisi 886 juta baris dan 374 file Parquet. Meskipun skalanya besar, Croissant Baker berhasil menghasilkan metadata Croissant tervalidasi.

Pada perbandingan held-out terhadap ground truth yang dibuat produsen atau diturunkan dari standar, Croissant Baker mencapai kecocokan 97–100% di berbagai domain. Tingkat kecocokan yang tinggi ini menunjukkan bahwa metadata yang dihasilkan otomatis hampir tidak dapat dibedakan dari metadata yang dikurasi manual atau sesuai standar. Evaluasi mencakup domain seperti kesehatan, pemrosesan bahasa alami, dan computer vision, menunjukkan fleksibilitas alat ini.

Hasilnya dirangkum dalam tabel berikut:

| Skala Dataset | Jumlah Dataset | Rentang Kecocokan |
|---------------|-------------------|-----------------|
| Kecil hingga Menengah | 140+ | 97–100% |
| Besar (MIMIC-IV) | 1 | 97–100% |

Temuan ini menunjukkan bahwa Croissant Baker dapat secara andal mengotomatiskan pembuatan metadata untuk dataset ML, mengurangi beban produsen dataset dan memungkinkan ke

Dataset machine learning semakin membutuhkan metadata terstandar untuk mendukung penemuan, ingest otomatis, dan analisis yang dapat direproduksi. Croissant telah muncul sebagai standar metadata untuk dataset ML, menyediakan format berbasis JSON-LD yang terstruktur sehingga properti dataset dapat diperiksa mesin di berbagai platform. Adopsinya semakin cepat, dan NeurIPS kini mewajibkan metadata Croissant pada setiap pengajuan ke dataset track-nya. Namun, dalam praktiknya, pembuatan Croissant biasanya dimulai dengan mengunggah data ke platform publik—jalur yang tidak mungkin dilakukan untuk repositori lokal terkelola dan besar yang menyimpan banyak data bernilai tinggi yang semakin diandalkan ML. Makalah ini memperkenalkan Croissant Baker, alat command-line lokal-first dan open-source yang menghasilkan metadata Croissant tervalidasi langsung dari direktori dataset melalui registry handler modular. Penulis mengevaluasi Croissant Baker pada lebih dari 140 dataset, hingga skala MIMIC-IV dengan 886 juta baris dan 374 file Parquet. Pada perbandingan held-out terhadap ground truth yang dibuat produsen atau diturunkan dari standar, Croissant Baker mencapai kecocokan 97–100% di berbagai domain.
Croissant Baker dirancang sebagai alat lokal-first yang beroperasi langsung pada direktori dataset tanpa memerlukan unggahan data ke platform publik. Arsitekturnya modular, berpusat pada registry handler yang mengirimkan tugas ekstraksi metadata ke handler khusus berdasarkan format file dan karakteristik dataset. Desain ini memungkinkan ekstensibilitas dan adaptasi terhadap beragam tipe dan struktur data.

Mengapa penting

Pengenalan Croissant Baker mengatasi celah kritis dalam ekosistem data ML: kebutuhan akan pembuatan metadata yang berfungsi di lingkungan terkelola dan lokal. Dengan beroperasi secara lokal, alat ini menghindari masalah privasi, keamanan, dan logistik yang terkait dengan mengunggah data sensitif ke platform publik. Hal ini sangat penting untuk dataset bernilai tinggi di bidang kesehatan, keuangan, dan domain teregulasi lainnya.

Desain registry handler modular memberikan fleksibilitas dan ekstensibilitas. Saat format data baru muncul, komunitas dapat menyumbangkan handler, memastikan Croissant Baker tetap relevan. Tingkat kecocokan yang tinggi (97–100%) dengan ground truth menunjukkan bahwa pembuatan metadata otomatis dapat memenuhi standar kualitas yang diperlukan untuk metadata yang dapat diperiksa mesin.

Namun, evaluasi terbatas pada dataset yang diuji, dan validasi lebih lanjut pada rentang domain dan format yang lebih luas akan memperkuat temuan. Selain itu, kinerja alat ini pada dataset yang sangat besar di luar MIMIC-IV masih perlu ditelusuri. Pekerjaan selanjutnya dapat berfokus pada optimalisasi kinerja untuk sistem penyimpanan terdistribusi dan integrasi dengan alat versioning data.

Secara keseluruhan, Croissant Baker merupakan langkah signifikan menuju dataset ML yang lebih mudah ditemukan, terkelola, dan dapat digunakan kembali dengan mengotomatiskan pembuatan metadata terstandar secara lokal-first.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…