Editorial Ilmu Komputer & AI
Belajar Mengevaluasi Sebelum Memperbaiki: Induksi Rubrik Otomatis untuk Agen Penelitian Otomatis
Masalah inti
Inovasi
Penulis mengevaluasi AutoSciRub pada dua tolok ukur: **ResearchClawBench** dan **AstaBench E2E Discovery**.
- Pada ResearchClawBench, AutoSciRub secara konsisten meningkatkan semua konfigurasi yang diuji, dengan kenaikan rata-rata **2,08 poin** pada tiga LLM tulang punggung di bawah harness Codex yang tetap, dan **2,95 poin** pada tiga harness agen dengan tulang punggung DeepSeek-V4-Flash yang tetap.
- Pada subset 20 tugas yang diambil secara acak dari AstaBench E2E Discovery, AutoSciRub mencapai peningkatan rata-rata **16,8 poin** pada tiga harness agen, sekaligus mempertahankan atau menambah jumlah tugas yang berhasil diselesaikan.
Hasil ini menunjukkan bahwa panduan berbasis evaluasi lebih dahulu merupakan mekanisme kontrol yang efektif dan dapat digeneralisasi untuk penelitian ilmiah otonom. Peningkatan tersebut konsisten pada berbagai model tulang punggung dan harness agen, yang menandakan ketangguhan pendekatan ini.
Mengapa penting
Kontribusi utama AutoSciRub adalah pergeseran dari evaluasi setelah fakta ke induksi rubrik sebelum eksekusi. Dengan membuat persyaratan implisit menjadi eksplisit, kerangka kerja ini mengurangi risiko analisis yang terlewat, metode yang tidak tepat, dan kesimpulan yang tidak didukung. Rubrik berfungsi sebagai kontrak antara maksud pengguna dan eksekusi agen, sehingga memungkinkan revisi yang tertarget.
Hasil menunjukkan bahwa manfaatnya lebih menonjol pada subset AstaBench E2E Discovery yang lebih menantang, dengan peningkatan rata-rata 16,8 poin, dibandingkan 2,08โ2,95 poin pada ResearchClawBench. Hal ini menunjukkan bahwa panduan berbasis evaluasi lebih dahulu sangat bernilai ketika tugas bersifat kompleks dan kurang spesifik.
Namun, pendekatan ini bergantung pada kualitas rubrik yang diinduksi. Jika rubrik tidak lengkap atau salah, agen masih dapat gagal memenuhi persyaratan yang sebenarnya. Penelitian selanjutnya dapat mengeksplorasi penyempurnaan rubrik secara interaktif dan pembelajaran dari umpan balik manusia. Selain itu, biaya komputasi untuk induksi dan verifikasi rubrik perlu dipertimbangkan pada lingkungan dengan sumber daya terbatas.
Secara keseluruhan, AutoSciRub merepresentasikan arah yang menjanjikan untuk mengendalikan agen penelitian otonom, dan kodenya tersedia di https://github.com/zjunlp/AutoSciRub.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ