Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

DENSE: Menyuling Trajektori Agen menjadi Pohon Jalan Pintas Berbasis Bukti untuk Penyempurnaan Diri

Kerangka tanpa reward yang mengubah jejak eksekusi berisik menjadi pohon jalan pintas bersarang yang dapat digunakan ulang untuk peningkatan diri agen
Siyuan Liu; Fan Yu; Dongyu Ru; Yizhu Liu; Yifan Yang; Xuezhi Cao; Xunliang Cai; Yixin Cao· 2026· DOI 10.48550/arXiv.2609.21423

Masalah inti

Penerapan agen secara daring mengakumulasi trajektori eksekusi dalam skala besar dan keragaman perilaku, yang kriteria anotasinya sulit ditentukan sebelumnya. Ekstraksi bukti yang berguna karenanya menuntut anotasi manual yang mahal atau sinyal verifier yang tidak skalabel, sehingga bukti berharga terkubur di antara eksekusi yang redundan, tidak lengkap, dan gagal. Hal ini memunculkan pertanyaan utama: tanpa reward pasca-eksekusi atau label kebenaran, bagaimana pengalaman yang dapat digunakan ulang dapat disuling dari trajektori itu sendiri?

Penulis memperkenalkan **DENSE** (Distilling Evidence from Nested Subtask Executions), yang mengorganisasi bukti turunan trajektori ke dalam pohon jalan pintas bersarang. Dengan menggabungkan upaya yang redundan, mengidentifikasi subtugas yang telah terselesaikan, dan mempertahankan langkah berguna bersama persyaratan yang masih tersisa, DENSE mengubah jejak eksekusi berisik menjadi umpan balik penyelesaian tugas yang terstruktur dan dapat digunakan ulang. Untuk mengevaluasi apakah umpan balik tersebut membantu agen mencoba ulang tugas yang sama, penulis merancang **REFIT**, yang mengukur perubahan tingkat keberhasilan antara upaya awal dan pe

Inovasi

Di antara metode umpan balik tanpa supervisi hasil eksternal, DENSE mencapai strict pass rate tertinggi pada empat model agen di **Terminal-Bench 2.1**. Metode ini meningkatkan hasil dibanding upaya awal sebesar **7,12–15,64 poin persentase**, sekaligus menggunakan **19,0–43,6% lebih sedikit token agen** pada percobaan ulang.

Pada tugas sulit, DENSE secara konsisten mengungguli self-reflection dalam cumulative pass rate di berbagai iterasi umpan balik pada keempat model. Ini menunjukkan bahwa pohon jalan pintas yang terstruktur dan berbasis bukti memberikan panduan yang lebih andal daripada kritik diri yang tidak terstruktur, terutama ketika tugas menuntut penalaran multi-langkah yang berkelanjutan.

Penghematan token cukup mencolok: karena DENSE menggabungkan upaya yang redundan dan memadatkan subtugas yang telah terselesaikan, percobaan ulang menghindari penjelajahan ulang jalan buntu, sehingga mengurangi biaya komputasi setiap siklus umpan balik. Kombinasi tingkat keberhasilan yang lebih tinggi dan penggunaan token yang lebih rendah menunjukkan bahwa bukti yang disuling lebih akurat dan lebih ringkas daripada pemutaran ulang trajektori mentah atau refleksi naif.

Pada keempat m

Penerapan agen secara daring mengakumulasi trajektori eksekusi dalam skala besar dan keragaman perilaku, yang kriteria anotasinya sulit ditentukan sebelumnya. Ekstraksi bukti yang berguna karenanya menuntut anotasi manual yang mahal atau sinyal verifier yang tidak skalabel, sehingga bukti berharga terkubur di antara eksekusi yang redundan, tidak lengkap, dan gagal. Hal ini memunculkan pertanyaan utama: tanpa reward pasca-eksekusi atau label kebenaran, bagaimana pengalaman yang dapat digunakan ulang dapat disuling dari trajektori itu sendiri?
Penulis memperkenalkan **DENSE** (Distilling Evidence from Nested Subtask Executions), yang mengorganisasi bukti turunan trajektori ke dalam pohon jalan pintas bersarang. Dengan menggabungkan upaya yang redundan, mengidentifikasi subtugas yang telah terselesaikan, dan mempertahankan langkah berguna bersama persyaratan yang masih tersisa, DENSE mengubah jejak eksekusi berisik menjadi umpan balik penyelesaian tugas yang terstruktur dan dapat digunakan ulang. Untuk mengevaluasi apakah umpan balik tersebut membantu agen mencoba ulang tugas yang sama, penulis merancang **REFIT**, yang mengukur perubahan tingkat keberhasilan antara upaya awal dan percobaan ulang yang dipandu umpan balik.

Mengapa penting

Wawasan utama DENSE adalah bahwa eksekusi yang gagal, redundan, dan tidak lengkap bukanlah derau yang harus dibuang, melainkan bukti yang harus disuling. Dengan mengorganisasi bukti turunan trajektori ke dalam pohon jalan pintas bersarang, metode ini mengubah beban—akumulasi jejak yang berantakan—menjadi aset untuk penyempurnaan diri.

Ketiadaan supervisi hasil eksternal menjadi pembeda utama. Reward model dan verifier memerlukan anotasi manusia atau sinyal terpelajar yang terpisah, dan keduanya sulit berskala seiring keragaman perilaku penerapan daring. DENSE menghindari hal ini dengan menambang trajektori itu sendiri, sehingga dapat diterapkan pada situasi ketika label kebenaran tidak tersedia.

Protokol REFIT menyediakan lensa evaluasi yang bersih: ia mengisolasi efek umpan balik terhadap keberhasilan percobaan ulang dan efisiensi token. Keuntungan yang dilaporkan pada Terminal-Bench 2.1, digabungkan dengan keunggulan konsisten atas self-reflection pada tugas sulit di berbagai iterasi, mendukung klaim bahwa bukti terstruktur mengungguli refleksi tidak terstruktur untuk peningkatan diri agen secara berkelanjutan.

Batasan dan pertanyaan terbuka masih ada. Makalah ini tidak merinci komposisi persis keempat model agen atau distribusi tugas lengkap Terminal-Bench 2.1 dalam abstrak yang disediakan. Generalisasi di luar tugas bergaya terminal, serta interaksi antara kedalaman pohon jalan pintas dan kompleksitas tugas, merupakan arah alami untuk penelitian selanjutnya. Meskipun demikian, hasil ini menempatkan DENSE sebagai mekanisme tanpa reward yang menjanjikan untuk mengubah riwayat eksekusi menjadi umpan balik penyelesaian tugas yang dapat digunakan ulang.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…