Editorial ilmu komputer
Iblis Ada di Antarmuka: Mengevaluasi Bagaimana Arsitektur Perkakas Membentuk Perilaku Agen Pengodean
Masalah inti
Seiring meningkatnya large language models (LLMs), sistem agentik menjadi semakin penting, dan perkakas merupakan dimensi desain yang kunci karena menentukan bagaimana agen mengakses informasi dan mengambil tindakan di lingkungannya. Penelitian sebelumnya tentang perkakas agen terutama berfokus pada memperluas apa yang dapat dilakukan agen—menambahkan kapabilitas, API, dan aksi baru—tetapi kurang memberi perhatian sistematis pada bagaimana kapabilitas tersebut diorganisasi dan diekspos kepada model. Penulis menyebut dimensi desain terakhir ini sebagai **arsitektur perkakas**.
Makalah ini mempelajari arsitektur perkakas pada agen pengodean melalui eksperimen terkontrol pada perbaikan isu tingkat repositori. Makalah ini membandingkan enam arsitektur perkakas yang mempertahankan informasi dan aksi dasar tetap serupa sambil memvariasikan bagaimana keduanya diorganisasi dan diekspos kepada model, pada tiga aktor dan total 11.700 lintasan. Pertanyaan utamanya adalah apakah arsitektur perkakas semata—independen dari kapabilitas mentah—mengubah perilaku agen. Hasilnya menunjukkan bahwa hal itu memang terjadi: bahkan ketika perkakas menyediakan kapabilitas serupa, arsitektur perkakas mengu
Inovasi
Eksperimen menunjukkan bahwa, bahkan ketika perkakas menyediakan kapabilitas serupa, arsitektur perkakas mengubah perilaku agen. Tiga temuan utama menonjol:
1. **Konsistensi:** Dibandingkan arsitektur dasar tempat agen hanya memiliki perkakas `bash`, antarmuka tingkat rendah yang lebih terstruktur meningkatkan konsistensi pada percobaan berulang hingga **4,7×**.
2. **Eksplorasi:** Pencarian bahasa alami memperluas eksplorasi repositori dan meningkatkan akses ke berkas yang relevan lebih dari **11%**.
3. **Efisiensi:** Antarmuka gaya Python CodeAct mencapai kinerja tugas serupa dengan **41,6% lebih sedikit langkah** dan **56,3% penggunaan token lebih rendah**.
Sebaliknya, perkakas penopang kognitif berbasis teks yang ringan, seperti perkakas yang memungkinkan agen mencatat penalaran antara, memiliki **efek terbatas** pada perilaku aktor. Asimetri ini patut dicatat: perubahan arsitektural yang membentuk ulang bagaimana informasi dan aksi diekspos kepada model menghasilkan pergeseran perilaku yang besar, sementara perkakas yang sekadar menambahkan catatan penalaran tidak.
Hasil konsistensi dapat diringkas sebagai peningkatan relatif:
\text{Consistency Gain} = \frac{\text{Consist
Mengapa penting
Hasil ini membingkai ulang desain perkakas untuk agen pengodean. Pertanyaan dominan dalam penelitian sebelumnya adalah *apa yang dapat dilakukan agen?*—memperluas ruang aksi. Makalah ini berargumen bahwa *bagaimana* aksi dan informasi tersebut diorganisasi dan diekspos—arsitektur perkakas—adalah dimensi desain yang sama pentingnya, dan sebelumnya kurang disistematisasi.
Temuan ini menunjukkan beberapa mekanisme. Antarmuka tingkat rendah yang terstruktur dapat mengurangi ambiguitas dalam cara agen memanggil operasi, sehingga perilaku lebih dapat diulang pada percobaan berulang (konsistensi hingga 4,7×). Pencarian bahasa alami dapat menurunkan hambatan kognitif untuk menjelajahi repositori, meningkatkan akses ke berkas yang relevan lebih dari 11%. Antarmuka gaya Python CodeAct dapat memungkinkan agen membatch dan menyusun aksi secara lebih efisien, menghasilkan kinerja tugas serupa dengan 41,6% lebih sedikit langkah dan 56,3% penggunaan token lebih rendah.
Hasil nol untuk perkakas penopang kognitif berbasis teks yang ringan sama informatifnya: sekadar memberi agen tempat untuk mencatat penalaran antara tidak, dengan sendirinya, mengubah perilaku aktor. Hal ini menunjukkan bahwa daya ungkit terletak pada antarmuka antara agen dan lingkungannya—bagaimana kapabilitas dimunculkan—bukan pada bantuan penalaran tambahan.
Alur konseptual perbandingan eksperimen dapat direpresentasikan sebagai:
Secara praktis, makalah ini menyiratkan bahwa pembangun agen harus memperlakukan arsitektur perkakas sebagai variabel desain kelas satu, sebanding dengan pilihan model atau desain prompt. Ukuran efek yang besar—konsistensi 4,7×, kenaikan eksplorasi >11%, 41,6% lebih sedikit langkah, 56,3% token lebih rendah—menunjukkan bahwa pilihan arsitektural dapat memberikan keuntungan substansial tanpa mengubah kapabilitas dasar yang tersedia bagi agen. Efek terbatas dari perkakas penopang kognitif semakin memperingatkan agar tidak mengasumsikan bahwa setiap perkakas tambahan memperbaiki perilaku; antarmuka, bukan sekadar keberadaan perkakas, yang membentuk agen.
Siapa yang sebaiknya membaca
Membuka konten member…