Editorial ilmu komputer
Large Language Models untuk Requirements Engineering: Evaluasi Empiris Lintas Tugas
Masalah inti
Informasi terkait requirements tersebar di berbagai artefak heterogen seperti umpan balik pengguna, diskusi pengembang, dan repositori perangkat lunak, sehingga ekstraksi pengetahuan requirements yang dapat ditindaklanjuti menjadi padat karya dan sulit diskalakan. Large Language Models (LLM) dapat mendukung banyak aktivitas Requirements Engineering (RE), mulai dari klasifikasi dan identifikasi traceability hingga pembuatan spesifikasi dan penjelasan. Namun, bukti yang ada terfragmentasi lintas tugas, jenis artefak, dan pengaturan evaluasi, dan studi jarang menawarkan evaluasi lintas tugas atau paket replikasi.
Untuk mengatasi kesenjangan ini, penulis menyajikan dua studi empiris yang saling melengkapi untuk mengevaluasi LLM pada lima aktivitas terkait RE. Pertama adalah eksperimen terkontrol pada lima LLM open-source ringan untuk klasifikasi requirements berbasis umpan balik dan pembuatan spesifikasi. Kedua adalah studi kasus industri eksploratif pada dua LLM frontier untuk identifikasi tautan traceability dan pembuatan penjelasan traceability menggunakan artefak proyek nyata. Klasifikasi dan identifikasi traceability dinilai dengan metrik kuantitatif, sedangkan tugas generasi die
Inovasi
Abstrak melaporkan bahwa kinerja LLM sangat bergantung pada tugas, berkisar dari sedang hingga tinggi. Tidak ada satu model pun yang secara konsisten mengungguli model lainnya di seluruh aktivitas yang dievaluasi. Ini menunjukkan bahwa adopsi yang efektif bergantung pada pemilihan model dan strategi prompting per tugas.
Hasil kuantitatif untuk klasifikasi dan identifikasi traceability tidak dirinci dalam abstrak selain ringkasan kualitatif. Demikian pula, hasil evaluasi manusia untuk pembuatan spesifikasi dan pembuatan penjelasan traceability diringkas sebagai bagian dari pola kinerja yang bergantung pada tugas secara keseluruhan. Temuan empiris utamanya adalah tidak adanya model yang dominan secara universal, yang menegaskan perlunya pemilihan model yang spesifik untuk tugas.
Karena abstrak sumber tidak memberikan skor per tugas, nama model, atau statistik dataset, digest ini tidak dapat melaporkan hasil numerik spesifik tanpa mengarangnya. Materi replikasi yang disebutkan sebagai kontribusi dimaksudkan untuk memungkinkan pihak lain mereproduksi dan memperluas temuan kuantitatif dan evaluasi manusia.
Mengapa penting
Evaluasi lintas tugas mengungkap bahwa kemampuan LLM untuk RE tidak monolitik. Kinerja bervariasi secara substansial menurut aktivitas, dan tidak adanya model yang secara konsisten unggul menyiratkan bahwa praktisi tidak boleh berasumsi bahwa satu model frontier atau ringan akan cukup untuk semua tugas RE. Sebaliknya, strategi adopsi harus sadar tugas, memasangkan model dan strategi prompting dengan aktivitas RE yang spesifik.
Desain dua studi memperkuat kontribusi dengan menggabungkan eksperimen terkontrol pada model open-source ringan dengan studi kasus industri eksploratif pada model frontier menggunakan artefak proyek nyata. Pendekatan ganda ini menyeimbangkan validitas internal dengan relevansi ekologis. Penyertaan materi replikasi mengatasi kelemahan yang diketahui dalam literatur: bukti yang terfragmentasi dan paket replikasi yang jarang.
Batasan meliputi sifat eksploratif dari studi kasus industri dan ketergantungan pada evaluasi manusia untuk tugas generasi, yang dapat menimbulkan subjektivitas. Abstrak tidak melaporkan effect size, interval kepercayaan, atau kesepakatan antar-penilai, sehingga ketangguhan temuan tugas generasi tidak dapat dinilai dari informasi yang tersedia. Pekerjaan selanjutnya dapat memperluas taksonomi aktivitas RE, menyertakan lebih banyak model, dan menstandardisasi protokol evaluasi.
Dari perspektif kesiapan praktis, hasilnya menunjukkan bahwa LLM saat ini memiliki kemampuan sedang hingga tinggi untuk beberapa aktivitas RE tetapi memerlukan pemilihan model dan prompting yang cermat. Organisasi sebaiknya menguji konfigurasi spesifik tugas daripada menerapkan satu model di seluruh siklus hidup RE.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ