Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

TRL-Bench: Standardisasi Evaluasi Tingkat Representasi Lintas Paradigma untuk Encoder Tabular

Benchmark multi-granularitas untuk membandingkan encoder tabular pada tingkat representasi di seluruh granularitas kolom, baris, dan tabel
Wei Pang; Xiangru Jian; Hehan Li; Zhixuan Yu; Alex Xue; Jinyang Li; Zhengyuan Dong; Xinjian Zhao; Hao Xu; Chao Zhang; Reynold Cheng; M. Tamer Özsu; Tianshu Yu· 2026· DOI 10.48550/arXiv.2606.09323

Masalah inti

Encoder tabular biasanya dievaluasi di dalam pipeline end-to-end yang spesifik untuk tugas tertentu, sehingga perbandingan langsung antar paradigma pelatihan yang berbeda menjadi sulit bahkan ketika model beroperasi pada sinyal tabular yang serupa. Fragmentasi ini menghambat kemajuan karena kinerja yang dilaporkan mencampuradukkan kualitas encoder dengan desain head hilir, formulasi tugas, dan prapemrosesan data. TRL-Bench mengatasi hal ini dengan memperkenalkan benchmark multi-granularitas tabular representation learning (TRL) yang menstandardisasi evaluasi tingkat representasi lintas paradigma. Setiap encoder mengekspor embedding baris, kolom, atau tabel melalui wrapper yang didukungnya, dan head ringan yang dibagi bersama menyelidiki representasi ini di tiga suite: TRL-CTbench (kolom/tabel), TRL-Rbench (baris), dan TRL-DLTE (Data-Lake Table Enrichment komposisional yang mencakup ketiga granularitas). Benchmark ini menyediakan aset terkurasi dan reformulasi tugas, termasuk 50 tabel OpenML dengan 123 target terverifikasi, 16 penulisan ulang linkage pasangan baris, dan lake DLTE berisi 47.772 tabel yang diturunkan dari 1.379 tabel induk. Dengan menetapkan kondisi hilir, TRL-Bench m

Inovasi

Di seluruh 20 model dan 16 tugas, TRL-Bench menunjukkan bahwa setelah kondisi hilir distandardisasi, kualitas encoder bersifat spesifik terhadap kapabilitas, bukan tertangkap oleh satu papan peringkat tunggal. Pada TRL-CTbench, encoder teks generik sering memimpin pada tugas dengan sinyal teks permukaan yang kuat, sementara spesialis tabular menang ketika tujuan prapelatihan mereka selaras dengan tugas. Misalnya, pada tugas kolom/tabel dengan fitur tekstual, model berbasis teks seperti BERT memperoleh skor lebih tinggi, sedangkan model tabular seperti TabNet unggul pada tugas dengan sinyal numerik atau kategorikal yang selaras dengan prapelatihannya. Pada TRL-Rbench, prediksi dalam tabel dan linkage lintas tabel menyukai rezim pelatihan yang berbeda. Kinerja linkage atomik berkorelasi kuat dengan tahap pencocokan baris pada pipeline DLTE, dengan koefisien korelasi melebihi 0,8 pada beberapa pengaturan. Pada TRL-DLTE, pipeline terkuat menggabungkan spesialis yang sesuai kapabilitas alih-alih menggunakan ulang satu encoder. Kualitas end-to-end terbaik bergantung pada kecocokan komposisional non-aditif, bukan semata peringkat marginal per tahap, yang menunjukkan bahwa desain pipeline
Encoder tabular biasanya dievaluasi di dalam pipeline end-to-end yang spesifik untuk tugas tertentu, sehingga perbandingan langsung antar paradigma pelatihan yang berbeda menjadi sulit bahkan ketika model beroperasi pada sinyal tabular yang serupa. Fragmentasi ini menghambat kemajuan karena kinerja yang dilaporkan mencampuradukkan kualitas encoder dengan desain head hilir, formulasi tugas, dan prapemrosesan data. TRL-Bench mengatasi hal ini dengan memperkenalkan benchmark multi-granularitas tabular representation learning (TRL) yang menstandardisasi evaluasi tingkat representasi lintas paradigma. Setiap encoder mengekspor embedding baris, kolom, atau tabel melalui wrapper yang didukungnya, dan head ringan yang dibagi bersama menyelidiki representasi ini di tiga suite: TRL-CTbench (kolom/tabel), TRL-Rbench (baris), dan TRL-DLTE (Data-Lake Table Enrichment komposisional yang mencakup ketiga granularitas). Benchmark ini menyediakan aset terkurasi dan reformulasi tugas, termasuk 50 tabel OpenML dengan 123 target terverifikasi, 16 penulisan ulang linkage pasangan baris, dan lake DLTE berisi 47.772 tabel yang diturunkan dari 1.379 tabel induk. Dengan menetapkan kondisi hilir, TRL-Bench memungkinkan perbandingan yang adil atas sinyal yang dapat digunakan ulang dalam representasi tabular yang diekspor.
TRL-Bench mendefinisikan protokol evaluasi terstandardisasi di mana setiap encoder menghasilkan embedding pada satu atau lebih granularitas: baris, kolom, atau tabel. Embedding ini diekstraksi melalui wrapper spesifik model yang mematuhi antarmuka bersama. Head ringan yang dibagi bersama—seperti regresi logistik atau MLP dangkal—kemudian dilatih pada representasi tetap ini untuk menyelidiki kegunaannya di seluruh tugas. Benchmark ini terdiri dari tiga suite:

Mengapa penting

Temuan dari TRL-Bench memiliki beberapa implikasi bagi pembelajaran representasi tabular. Pertama, tidak adanya pemenang universal menunjukkan bahwa praktisi harus memilih encoder berdasarkan tugas dan granularitas spesifik, alih-alih mengandalkan satu papan peringkat tunggal. Kedua, korelasi kuat antara kinerja linkage atomik dan tahap pencocokan baris DLTE menyiratkan bahwa peningkatan pada representasi tingkat baris dapat merambat ke pipeline komposisional yang kompleks. Ketiga, kecocokan komposisional non-aditif pada DLTE menyoroti pentingnya optimasi bersama atau desain pipeline yang cermat, karena keuntungan marginal per tahap tidak selalu berarti peningkatan end-to-end. Benchmark ini juga menyediakan protokol umum untuk mengukur sinyal yang dapat digunakan ulang dalam representasi tabular yang diekspor di bawah kondisi hilir yang dibagi bersama, yang dapat mempercepat penelitian dengan memungkinkan perbandingan yang adil. Batasan mencakup fokus pada head ringan, yang mungkin tidak menangkap potensi penuh encoder ketika disetel end-to-end. Pekerjaan selanjutnya dapat memperluas TRL-Bench untuk mencakup tugas yang lebih beragam, data lake yang lebih besar, dan granularitas tambahan. Secara keseluruhan, TRL-Bench menetapkan fondasi untuk evaluasi sistematis encoder tabular dan mendorong pengembangan model yang spesifik terhadap kapabilitas.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…