Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Belajar Mengevaluasi Sebelum Memperbaiki: Induksi Rubrik Otomatis untuk Agen Penelitian Otomatis

AutoSciRub: Kerangka Kerja Berorientasi Evaluasi untuk Penelitian Ilmiah Otonom
Xuehai Wang; Haowei Qin; Tongxin Liu; Junkai Li; Buqiang Xu; Jintian Zhang; Yijun Chen; Zirui Xue; Shumin Dengยท 2026ยท DOI 10.48550/arXiv.2608.31076

Masalah inti

Agen penelitian ilmiah otonom semakin banyak diterapkan pada alur kerja ilmiah end-to-end, termasuk tinjauan literatur, analisis data, eksperimen, dan penyusunan laporan. Namun, tugas penelitian yang terbuka sering kali tidak merinci analisis, metode, dan kriteria keberhasilan yang diperlukan untuk menyelesaikan tugas. Akibatnya, agen dapat melewatkan analisis penting, memakai metode yang tidak tepat, atau menarik kesimpulan yang tidak cukup didukung bukti. Untuk mengatasi masalah ini, penulis memperkenalkan **AutoSciRub**, kerangka kerja berorientasi evaluasi yang menginduksi rubrik yang dapat dieksekusi dan spesifik tugas sebelum eksekusi penelitian, lalu menggunakannya untuk memandu eksekusi, verifikasi tingkat kriteria, serta revisi iteratif. Wawasan intinya adalah kriteria evaluasi yang eksplisit harus ditetapkan *sebelum* proses penelitian, bukan mengandalkan penilaian setelah fakta. Hal ini menggeser paradigma dari "perbaiki lalu evaluasi" menjadi "evaluasi sebelum memperbaiki".

Inovasi

Penulis mengevaluasi AutoSciRub pada dua tolok ukur: **ResearchClawBench** dan **AstaBench E2E Discovery**.

- Pada ResearchClawBench, AutoSciRub secara konsisten meningkatkan semua konfigurasi yang diuji, dengan kenaikan rata-rata **2,08 poin** pada tiga LLM tulang punggung di bawah harness Codex yang tetap, dan **2,95 poin** pada tiga harness agen dengan tulang punggung DeepSeek-V4-Flash yang tetap.
- Pada subset 20 tugas yang diambil secara acak dari AstaBench E2E Discovery, AutoSciRub mencapai peningkatan rata-rata **16,8 poin** pada tiga harness agen, sekaligus mempertahankan atau menambah jumlah tugas yang berhasil diselesaikan.

Hasil ini menunjukkan bahwa panduan berbasis evaluasi lebih dahulu merupakan mekanisme kontrol yang efektif dan dapat digeneralisasi untuk penelitian ilmiah otonom. Peningkatan tersebut konsisten pada berbagai model tulang punggung dan harness agen, yang menandakan ketangguhan pendekatan ini.

Agen penelitian ilmiah otonom semakin banyak diterapkan pada alur kerja ilmiah end-to-end, termasuk tinjauan literatur, analisis data, eksperimen, dan penyusunan laporan. Namun, tugas penelitian yang terbuka sering kali tidak merinci analisis, metode, dan kriteria keberhasilan yang diperlukan untuk menyelesaikan tugas. Akibatnya, agen dapat melewatkan analisis penting, memakai metode yang tidak tepat, atau menarik kesimpulan yang tidak cukup didukung bukti. Untuk mengatasi masalah ini, penulis memperkenalkan **AutoSciRub**, kerangka kerja berorientasi evaluasi yang menginduksi rubrik yang dapat dieksekusi dan spesifik tugas sebelum eksekusi penelitian, lalu menggunakannya untuk memandu eksekusi, verifikasi tingkat kriteria, serta revisi iteratif. Wawasan intinya adalah kriteria evaluasi yang eksplisit harus ditetapkan *sebelum* proses penelitian, bukan mengandalkan penilaian setelah fakta. Hal ini menggeser paradigma dari "perbaiki lalu evaluasi" menjadi "evaluasi sebelum memperbaiki".
AutoSciRub beroperasi dalam tiga tahap utama:

Mengapa penting

Kontribusi utama AutoSciRub adalah pergeseran dari evaluasi setelah fakta ke induksi rubrik sebelum eksekusi. Dengan membuat persyaratan implisit menjadi eksplisit, kerangka kerja ini mengurangi risiko analisis yang terlewat, metode yang tidak tepat, dan kesimpulan yang tidak didukung. Rubrik berfungsi sebagai kontrak antara maksud pengguna dan eksekusi agen, sehingga memungkinkan revisi yang tertarget.

Hasil menunjukkan bahwa manfaatnya lebih menonjol pada subset AstaBench E2E Discovery yang lebih menantang, dengan peningkatan rata-rata 16,8 poin, dibandingkan 2,08โ€“2,95 poin pada ResearchClawBench. Hal ini menunjukkan bahwa panduan berbasis evaluasi lebih dahulu sangat bernilai ketika tugas bersifat kompleks dan kurang spesifik.

Namun, pendekatan ini bergantung pada kualitas rubrik yang diinduksi. Jika rubrik tidak lengkap atau salah, agen masih dapat gagal memenuhi persyaratan yang sebenarnya. Penelitian selanjutnya dapat mengeksplorasi penyempurnaan rubrik secara interaktif dan pembelajaran dari umpan balik manusia. Selain itu, biaya komputasi untuk induksi dan verifikasi rubrik perlu dipertimbangkan pada lingkungan dengan sumber daya terbatas.

Secara keseluruhan, AutoSciRub merepresentasikan arah yang menjanjikan untuk mengendalikan agen penelitian otonom, dan kodenya tersedia di https://github.com/zjunlp/AutoSciRub.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ