Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Apa yang Bertahan pada Model Berikutnya? Tolok Ukur Teknik Berbasis LLM terhadap Single-Prompt

Meta-analisis terhadap 35 makalah ICSE 2026 mengungkap bahwa 37–63% teknik LLM yang direkayasa kalah oleh satu prompt pada model yang lebih baru, memperlihatkan kerapuhan solusi sementara terhadap defisit model.
Nahian Salsabil; Joy Saha; Simantika Bhattacharjee Dristi; Nicholas Phair; Nusrat Jahan Mozumder; Matthew B. Dwyer; Sebastian Elbaum· 2026· DOI 10.48550/arXiv.2609.00468

Masalah inti

Komunitas penelitian rekayasa perangkat lunak (SE) telah dengan cepat mengintegrasikan Large Language Model (LLM) ke dalam teknik kompleks untuk menangani beragam tugas. Namun, nilai strategis dari investasi ini tidak pasti: seiring kemajuan generasi model frontier, kemampuan native mereka dapat membuat teknik yang ada menjadi usang. Makalah ini menyelidiki apakah perkakas rumit yang diusulkan dalam penelitian SE berbasis LLM terkini dapat dikalahkan oleh alternatif paling sederhana—satu prompt yang dihasilkan secara otomatis dan dijalankan pada model generasi yang lebih baru, tanpa penyempurnaan iteratif. Penulis menganalisis 35 makalah teknik berbasis LLM dari ICSE 2026 untuk menilai daya tahan kontribusi penelitian tersebut. Pertanyaan utamanya adalah: apa yang bertahan pada model berikutnya? Temuan ini bertujuan memberi tahu komunitas tentang proposisi biaya-manfaat dari teknik yang dirancang sebagai solusi sementara terhadap defisit model, dan menyoroti perlunya berfokus pada tantangan yang bertahan lama yang berskala sinergis dengan generasi model mendatang.

Inovasi

Analisis mengungkap bahwa untuk antara 37% dan 63% makalah, model yang lebih baru dengan satu prompt secara native mengalahkan perkakas yang direkayasa secara berat yang diusulkan hanya setahun sebelumnya. Rentang yang lebar ini mencerminkan variasi antar jenis tugas dan metrik evaluasi. Teknik konstruktif—seperti pembuatan atau perbaikan kode—ditemukan lebih mudah digantikan oleh satu prompt. Sebaliknya, sekumpulan makalah yang bertahan mengandalkan strategi yang memberikan wawasan tambahan kepada model, di mana LLM yang lebih baru memperkuat teknik yang diusulkan alih-alih menggantikannya. Teknik yang bertahan ini sering menggabungkan pengetahuan domain, analisis statis, atau umpan balik iteratif yang melengkapi kemampuan native model. Hasilnya menunjukkan bahwa efektivitas banyak teknik terkait erat dengan generasi model spesifik yang menjadi sasaran desainnya, dan bahwa peningkatan model dapat dengan cepat mengikis keunggulannya.
Komunitas penelitian rekayasa perangkat lunak (SE) telah dengan cepat mengintegrasikan Large Language Model (LLM) ke dalam teknik kompleks untuk menangani beragam tugas. Namun, nilai strategis dari investasi ini tidak pasti: seiring kemajuan generasi model frontier, kemampuan native mereka dapat membuat teknik yang ada menjadi usang. Makalah ini menyelidiki apakah perkakas rumit yang diusulkan dalam penelitian SE berbasis LLM terkini dapat dikalahkan oleh alternatif paling sederhana—satu prompt yang dihasilkan secara otomatis dan dijalankan pada model generasi yang lebih baru, tanpa penyempurnaan iteratif. Penulis menganalisis 35 makalah teknik berbasis LLM dari ICSE 2026 untuk menilai daya tahan kontribusi penelitian tersebut. Pertanyaan utamanya adalah: apa yang bertahan pada model berikutnya? Temuan ini bertujuan memberi tahu komunitas tentang proposisi biaya-manfaat dari teknik yang dirancang sebagai solusi sementara terhadap defisit model, dan menyoroti perlunya berfokus pada tantangan yang bertahan lama yang berskala sinergis dengan generasi model mendatang.
Studi ini melakukan tolok ukur sistematis terhadap 35 makalah teknik berbasis LLM yang diterbitkan di ICSE 2026. Untuk setiap makalah, penulis mengekstrak teknik yang diusulkan dan pengaturan evaluasinya. Mereka kemudian menghasilkan satu prompt yang dibuat secara otomatis yang menangkap esensi tugas, dan menjalankannya pada LLM generasi yang lebih baru tanpa penyempurnaan iteratif atau orkestrasi kompleks. Kinerja baseline single-prompt ini dibandingkan dengan hasil yang dilaporkan teknik asli. Perbandingan dirancang agar adil: model yang lebih baru digunakan secara zero-shot, tanpa fine-tuning atau rekayasa khusus tugas. Penulis juga mengategorikan teknik berdasarkan jenis tugas (misalnya, pembuatan kode, perbaikan, pengujian) untuk mengidentifikasi pola dalam hal substitusi. Kode sumber dan hasil tersedia untuk umum demi reproduktibilitas.

Mengapa penting

Temuan ini memunculkan pertanyaan kritis tentang proposisi biaya-manfaat penelitian SE berbasis LLM. Teknik yang dirancang sebagai solusi sementara terhadap defisit model—seperti trik prompt engineering atau pipeline multi-langkah yang mengompensasi konteks atau penalaran yang terbatas—mungkin tidak bertahan pada generasi model berikutnya. Penulis berargumen bahwa komunitas harus berfokus pada tantangan yang bertahan lama yang berskala sinergis dengan generasi model mendatang. Ini mencakup teknik yang memberikan wawasan tambahan kepada model, seperti mengintegrasikan metode formal, analisis program, atau keahlian manusia, yang kemungkinan tetap bernilai seiring model membaik. Studi ini juga menyoroti perlunya tolok ukur terhadap baseline sederhana untuk menghindari rekayasa berlebihan. Taksonomi teknik yang bertahan versus yang digantikan dapat memandu arah penelitian mendatang. Pada akhirnya, makalah ini menyerukan evaluasi ulang strategis tentang bagaimana teknik berbasis LLM dirancang dan dievaluasi, dengan menekankan ketahanan terhadap evolusi model.

Dengan 35 makalah, tingkat substitusi 37% setara dengan sekitar 13 makalah, sedangkan 63% setara dengan sekitar 22 makalah.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…