Editorial Ilmu Komputer & AI
Agen yang Berpenciptaan Rasa: Mengukur dan Meningkatkan Rasa dalam Tugas Jangka Panjang
Masalah inti
Agen large language model (LLM) semakin banyak digunakan pada tugas jangka panjang di bidang rekayasa dan penelitian, di mana satu eksekusi dapat melibatkan puluhan atau ratusan keputusan berurutan. Penulis berpendapat bahwa kualitas keputusan antara ini—seperti hipotesis mana yang diuji atau implementasi mana yang dibangun—menentukan hasil akhir. Mereka mendefinisikan kemampuan membuat keputusan jangka panjang yang baik sebagai **rasa** dari sebuah agen.
Tolok ukur yang ada mengukur keberhasilan ujung-ke-ujung pada tugas jangka panjang, tetapi tidak ada yang secara langsung mengukur rasa. Kesenjangan ini memotivasi pembangunan **Taste-Bench**, tolok ukur pertanyaan rasa yang diturunkan secara otomatis dari lintasan agen. Setiap pertanyaan menyajikan **persimpangan keputusan**: titik dalam lintasan di mana beberapa arah tersedia dan satu mengarah ke hasil yang lebih baik. Model yang dievaluasi harus memilih di antara arah tersebut tanpa melihat peristiwa berikutnya. Kontribusi makalah ini ada tiga: (1) metode untuk menambang persimpangan keputusan secara otomatis dari upaya paralel dan jalan memutar, (2) evaluasi model terdepan pada Taste-Bench, dan (3) demonstrasi bahwa rasa dapa
Inovasi
Penulis mengevaluasi model terdepan pada Taste-Bench dan melaporkan bahwa model terbaik hanya menjawab **59,7%** pertanyaan dengan benar. Ini menunjukkan bahwa bahkan LLM tercanggih kesulitan dengan pengambilan keputusan jangka panjang ketika diisolasi dari eksekusi.
Analisis lebih lanjut mengungkap dua temuan utama:
- **Posisi bukti penting**: Persimpangan yang bukti penentunya muncul lebih lambat dalam lintasan jauh lebih sulit bagi setiap model. Ini menunjukkan bahwa model kesulitan mengintegrasikan informasi yang secara temporal jauh dari titik keputusan.
- **Anggaran penalaran tidak membantu**: Meningkatkan anggaran penalaran (misalnya, mengizinkan lebih banyak token untuk chain-of-thought) tidak meningkatkan akurasi pada Taste-Bench. Ini menyiratkan bahwa hambatannya bukan komputasional melainkan kurangnya kemampuan pengambilan keputusan yang relevan.
Hasil ini menyoroti bahwa rasa adalah kemampuan yang berbeda dan menantang yang tidak tertangkap oleh tolok ukur yang ada.
Mengapa penting
Makalah ini menunjukkan bahwa rasa dapat dilatih. Dengan mendistilasi penilaian model guru yang telah melihat hasil dari persimpangan ke model siswa, siswa membuat keputusan yang lebih baik pada tugas yang belum pernah dilihat. Selain itu, peningkatan ini berujung pada keberhasilan ujung-ke-ujung pada tugas SWE-bench Pro yang disisihkan, menunjukkan bahwa rasa yang lebih baik mengarah pada kinerja keseluruhan yang lebih baik.
Penulis membahas implikasi untuk desain agen: meningkatkan rasa mungkin memerlukan pelatihan yang ditargetkan daripada sekadar memperbesar ukuran model atau anggaran penalaran. Mereka juga mencatat batasan, seperti proses penambangan otomatis yang berpotensi memasukkan noise, dan ketergantungan pada upaya paralel yang mungkin tidak selalu tersedia.
Arsitektur tingkat tinggi dari konstruksi Taste-Bench dan pipeline distilasi ditunjukkan di bawah ini:
Pekerjaan selanjutnya dapat mengeksplorasi strategi penambangan yang lebih canggih dan menerapkan pelatihan rasa ke domain yang lebih luas.
Siapa yang sebaiknya membaca
Membuka konten member…