Editorial ilmu komputer
Mengapa CLAUDE.md Terus Bertambah Besar? Catastrophic Remembering dalam Agentic Coding
Masalah inti
Alur kerja agentic coding semakin bergantung pada berkas instruksi tingkat repositori, seperti `CLAUDE.md`, yang dibaca oleh agen sebelum bertindak pada basis kode. Di repositori nyata, berkas-berkas ini tumbuh tanpa batas, berhenti hanya ketika repositori dihentikan atau ketika seseorang menulis ulang berkas tersebut secara menyeluruh. Makalah ini melacak perilaku ini ke imperfect recall: menambahkan instruksi selalu murah, tetapi begitu rationale sebuah instruksi hilang, menghapusnya tanpa berisiko menimbulkan regresi kebenaran menjadi sangat mahal.
Penulis memformalkan biaya ini. Untuk prompt yang berisi instruksi, menghapus instruksi yang rationale-nya tidak lagi dapat dipulihkan memakan biaya dalam kasus terburuk, karena agen harus mempertimbangkan ruang kombinatorial perilaku yang mungkin bergantung padanya. Asimetri antara penambahan yang murah dan penghapusan yang mahal ini menghasilkan divergensi yang penulis sebut **catastrophic remembering**, kebalikan dari catastrophic forgetting yang menjadi dasar continual learning. Pertanyaan sentralnya dirumuskan secara lugas: jika bahasa Inggris adalah kode baru, mengapa kita belum punya komentar?
Inovasi
Hasil observasional mengonfirmasi pertumbuhan tak terbatas. Di 247.694 masa hidup instruksi pada 1.867 repositori, prompt agentic lebih dari tiga kali lipat sepanjang masa pakainya, bertambah **+226%** dalam ukuran. Rata-rata, setiap commit menambahkan **+4,9 instruksi bersih**. Penghapusan menjadi semakin kecil kemungkinannya seiring bertambahnya usia instruksi: log-hazard penghapusan adalah **-0,032 per commit**, yang berarti instruksi yang lebih tua semakin mengakar.
Inversi IFEval terkendali menunjukkan bahwa komentar dapat menghentikan pertumbuhan. Di dunia terverifikasi yang prompt optimalnya diketahui, komentar yang mengodekan penalaran laten menghapus **99,3%** instruksi berlebih, mengurangi pertumbuhan berlebih dari **+211,3% menjadi +1,4%**.
Transfer WildIFEval menunjukkan manfaat dunia nyata. Dengan menerapkan inversi yang sama pada WildIFEval, komentar prompt meningkatkan instruction-following agentic dunia nyata hingga **23,1%**. Secara bersama, hasil ini menetapkan mekanisme catastrophic remembering sekaligus mitigasi praktisnya.
Mengapa penting
Temuan ini membingkai ulang pemeliharaan prompt sebagai masalah rekayasa perangkat lunak, bukan trik prompting. Asimetri intinya bersifat ekonomis: menambahkan adalah sementara menghapus tanpa rationale adalah , sehingga pemelihara rasional menambahkan dan tidak pernah memangkas. Seiring waktu, prompt menjadi sedimen keputusan historis, dan pertumbuhannya hanya dibatasi oleh penghentian repositori atau penulisan ulang menyeluruh.
Remedi yang diusulkan secara konseptual sederhana tetapi signifikan secara struktural: perlakukan instruksi bahasa Inggris sebagai kode dan beri mereka komentar. Prompt comment yang mengodekan penalaran laten mempertahankan informasi yang diperlukan untuk mengevaluasi penghapusan, sehingga meruntuhkan biaya penghapusan efektif. Hasil IFEval, yang mengurangi instruksi berlebih sebesar 99,3%, menunjukkan bahwa ini bukan efek marginal melainkan koreksi hampir menyeluruh dalam pengaturan terkendali. Hasil WildIFEval, dengan peningkatan instruction-following hingga 23,1%, menunjukkan manfaatnya bertahan saat bersentuhan dengan tugas dunia nyata.
Kandidat taksonomi untuk karya ini mencakup **Architecture**, **Cybersecurity**, **Network**, dan **Cryptography**, karena berkas prompt agentic semakin banyak mengodekan instruksi operasional, relevan secara keamanan, dan tingkat protokol yang akumulasi senyapnya berimplikasi pada kebenaran dan keselamatan. Pertanyaan penutup makalah ini karena itu bersifat teknis sekaligus kultural: jika bahasa Inggris adalah kode baru, mengapa kita belum punya komentar?
Siapa yang sebaiknya membaca
Membuka konten memberโฆ