The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
Wenbo Pan; Zhichao Liu; Shujie Liu; Jingying Zeng; Chin-Yew Lin; Xianfeng Tang; Yan Lu; Qi He; Xiaohua Jia
- Summary
- This paper introduces the concept of "taste" for LLM agents—the ability to make good long-horizon decisions—and presents Taste-Bench, a benchmark of automatically mined decision forks from agent trajectories. Frontier models answer only 59…
- Method
- Penulis membangun Taste-Bench dengan menambang persimpangan keputusan dari lintasan yang dihasilkan oleh agen pada tugas rekayasa dan penelitian. Dua sumber persimpangan digunakan…
- Results
- Penulis mengevaluasi model terdepan pada Taste-Bench dan melaporkan bahwa model terbaik hanya menjawab **59,7%** pertanyaan dengan benar. Ini menunjukkan bahwa bahkan LLM tercanggih kesulitan dengan …