Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Scout: Ekstraksi Dokumen Skalabel melalui Kemiripan Data

Kerangka penyempurnaan aturan Pareto-optimal yang menyamai akurasi LLM terdepan dengan biaya 61x–1000x lebih rendah
Yiming Lin; Chiyu Hao; Shreya Shankar; Aditya G. Parameswaran· 2026· DOI 10.48550/arXiv.2608.08261

Masalah inti

Mengekstraksi nilai dari koleksi dokumen besar menjadi dasar analisis data di banyak domain, dari berkas keuangan hingga literatur ilmiah. LLM terdepan mengekstraksi nilai tersebut secara akurat, tetapi memproses seluruh koleksi dengan satu LLM sangat mahal. Biaya ini sebagian besar dapat dihindari: koleksi dunia nyata menunjukkan kemiripan yang kaya, sehingga untuk kueri yang sama pada dokumen serupa, jawabannya cenderung berulang di lokasi yang serupa. LLM hanya perlu membaca rentang kecil itu, bukan seluruh dokumen.

Metode sebelumnya yang memanfaatkan kemiripan ini belum memadai. Metode tersebut mengasumsikan struktur dokumen yang kaku, atau mengasumsikan jawaban adalah himpunan substring dari input dan menggunakan program yang dihasilkan LLM untuk mengembalikannya secara langsung. Bahkan agen terdepan gagal menghasilkan program yang efektif untuk melokalisasi rentang jawaban secara langsung, karena ruang pencariannya besar dan program yang dipelajari dari sampel kecil cenderung overfit.

Penulis memperkenalkan Scout, alat yang menghasilkan program akurat dan hemat biaya—disebut aturan—untuk mengekstraksi data dalam skala besar. Dari beberapa dokumen sampel, Scout menghasilkan

Inovasi

Eksperimen pada enam dataset dunia nyata menunjukkan bahwa Scout menyamai akurasi baseline terkuat—agen LLM terdepan yang membaca setiap dokumen secara penuh—sekaligus 61x hingga lebih dari 1000x lebih murah pada koleksi 1.000 dokumen. Scout juga 61% lebih akurat daripada pendekatan berbasis program terbaik sebelumnya.

Penghematan biaya berasal dari kemampuan Scout membaca hanya rentang kecil dari setiap dokumen, bukan seluruh teks. Kesetaraan akurasi dengan agen LLM terdepan menunjukkan bahwa himpunan aturan yang disempurnakan menangkap logika ekstraksi yang diperlukan tanpa mengorbankan ketepatan.

Peningkatan akurasi 61% dibandingkan metode berbasis program sebelumnya menyoroti efektivitas strategi penyempurnaan dan bertingkat, yang mengatasi masalah overfit dan kekakuan pada pendekatan sebelumnya.

Mengekstraksi nilai dari koleksi dokumen besar menjadi dasar analisis data di banyak domain, dari berkas keuangan hingga literatur ilmiah. LLM terdepan mengekstraksi nilai tersebut secara akurat, tetapi memproses seluruh koleksi dengan satu LLM sangat mahal. Biaya ini sebagian besar dapat dihindari: koleksi dunia nyata menunjukkan kemiripan yang kaya, sehingga untuk kueri yang sama pada dokumen serupa, jawabannya cenderung berulang di lokasi yang serupa. LLM hanya perlu membaca rentang kecil itu, bukan seluruh dokumen.
Metode sebelumnya yang memanfaatkan kemiripan ini belum memadai. Metode tersebut mengasumsikan struktur dokumen yang kaku, atau mengasumsikan jawaban adalah himpunan substring dari input dan menggunakan program yang dihasilkan LLM untuk mengembalikannya secara langsung. Bahkan agen terdepan gagal menghasilkan program yang efektif untuk melokalisasi rentang jawaban secara langsung, karena ruang pencariannya besar dan program yang dipelajari dari sampel kecil cenderung overfit.

Mengapa penting

Wawasan kunci Scout adalah kemiripan dokumen dapat dimanfaatkan untuk mengurangi panggilan LLM secara drastis. Dengan menghasilkan himpunan aturan yang luas dari beberapa sampel dan menyempurnakannya menjadi subset Pareto-optimal, Scout mencapai trade-off akurasi-biaya yang menguntungkan. Bukti NP-hardness untuk penyempurnaan aturan membenarkan penggunaan aproksimasi greedy, yang memberikan jaminan yang dapat dibuktikan.

Strategi bertingkat menangani skenario realistis koleksi yang sebagian mirip. Dengan mengelompokkan dokumen tanpa LLM dan kembali ke himpunan aturan yang belum disempurnakan bila diperlukan, Scout mempertahankan akurasi bahkan ketika kemiripan tidak bersifat global. Hal ini membuat Scout dapat diterapkan pada koleksi dokumen heterogen yang tidak dapat diasumsikan memiliki satu struktur kaku.

Dibandingkan karya sebelumnya, Scout menghindari jebakan mengasumsikan struktur dokumen yang kaku atau mengandalkan program yang dihasilkan LLM yang overfit. Hasil empiris—pengurangan biaya 61x hingga lebih dari 1000x dengan akurasi setara—menunjukkan bahwa Scout adalah solusi praktis untuk ekstraksi dokumen skala besar. Penelitian selanjutnya dapat mengeksplorasi pengelompokan adaptif dan pembangkitan aturan untuk koleksi streaming.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…