Editorial Ilmu Komputer & AI
HARTS: Reinforcement Learning Agentik yang Efisien untuk Model Hybrid-Attention pada Pohon Rollout Arbitrer
Masalah inti
Reinforcement learning (RL) agentik sering menghasilkan pohon rollout tak beraturan di mana banyak lintasan root-to-leaf berbagi riwayat umum yang panjang. Melatih setiap lintasan secara independen menyebabkan prefiks bersama dihitung ulang berulang kali, sehingga membuang komputasi. Sistem yang ada dirancang terutama untuk model full-attention dan tidak menyediakan eksekusi hybrid-attention yang padat dan dapat diturunkan yang kompatibel dengan recomputation aktivasi.
Makalah ini memperkenalkan **HARTS** (*Hybrid-Attention RL over Tree Structures*), sebuah sistem yang menargetkan celah tersebut. HARTS dipresentasikan sebagai sistem pertama yang menunjukkan percepatan berbagi prefiks pohon rollout arbitrer pada model hybrid-attention nyata. Karya ini dimotivasi oleh pengamatan bahwa arsitektur hybrid-attention menggabungkan full attention dengan linear attention per chunk, dan bahwa kombinasi ini memerlukan pengelolaan state yang cermat ketika prefiks bersama dimampatkan alih-alih diputar ulang.
Masalah utamanya dapat dinyatakan sebagai berikut: diberikan pohon rollout dengan prefiks bersama, bagaimana seseorang dapat mengeksekusi forward dan backward pass pada semua cabang secar
Inovasi
Evaluasi menggunakan beban kerja Agentic RL yang dihasilkan dari tugas SWE-bench. Pada beban kerja ini, HARTS mencapai percepatan forward/backward/gradient **4,81โ4,87ร** dengan recomputation aktivasi pada berbagai konfigurasi paralel. Percepatan ini diatribusikan pada berbagi prefiks pada pohon rollout arbitrer dan pada eksekusi terpaket semua cabang dalam satu panggilan per putaran.
Perbedaan numerik antara HARTS dan baseline dilaporkan sebanding dengan variasi self-rerun baseline. Hal ini menunjukkan bahwa replay state terbatas dan handoff state yang dapat diturunkan mempertahankan perilaku numerik pada tingkat yang serupa dengan variasi antar-putaran biasa.
Selain itu, tren reward HARTS serupa dengan baseline selama 120 langkah pertama pelatihan -Bench. Hal ini menunjukkan bahwa keuntungan efisiensi tidak diperoleh dengan mengorbankan perilaku pembelajaran yang menurun pada fase awal pelatihan. Hasil dilaporkan pada berbagai konfigurasi paralel, mendukung keumuman klaim percepatan.
Mengapa penting
Kontribusi teknis utama HARTS adalah kombinasi pemampatan prefiks dengan eksekusi hybrid-attention yang padat dan dapat diturunkan. Dengan menghindari replay prefiks bersama, sistem mengurangi komputasi redundan yang jika tidak akan berskala dengan jumlah cabang yang berbagi prefiks. Algoritma per chunk waktu linear memastikan jumlah panggilan linear-attention sekuensial diminimalkan di bawah model eksekusi terpaket, yang penting untuk latensi dan throughput.
Pilihan desain kuncinya adalah mempertahankan partisi state per chunk. HARTS tidak mengulang proyeksi, komputasi MLP/MoE, atau output akhir; sistem hanya melakukan replay state terbatas untuk penyelarasan numerik. Hal ini menjaga komputasi tetap dekat dengan pelatihan per lintasan sekaligus memungkinkan batching tingkat pohon. Dukungan untuk recomputation aktivasi juga signifikan, karena memungkinkan penghematan memori tanpa merusak handoff state yang dapat diturunkan.
Penanganan routing MoE adalah aspek penting lainnya. Untuk routing MoE top- yang deterministik dan tanpa token-drop, multiplisitas semantik memulihkan bobot token objektif MoE dan statistik beban. Hal ini memastikan objektif MoE tetap konsisten bahkan ketika token dipaketkan lintas cabang.
Batasan tidak disebutkan secara eksplisit dalam abstrak, tetapi cakupannya adalah model hybrid-attention dan pohon rollout arbitrer. Klaim sebagai sistem pertama yang menunjukkan percepatan berbagi prefiks pohon rollout arbitrer pada model hybrid-attention nyata menunjukkan bahwa karya sebelumnya menargetkan model full-attention atau tidak mendukung eksekusi hybrid-attention yang padat dan dapat diturunkan dengan recomputation aktivasi. Karya selanjutnya dapat memperluas pendekatan ini ke varian attention lain atau ke beban kerja RL agentik yang lebih luas.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ