Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

DSEffi-Bench: Menyingkap Kapabilitas Large Language Models dalam Generasi Kode Data Science yang Efisien

Benchmark pertama yang menyasar efisiensi eksekusi pada kode data science hasil LLM menunjukkan bahwa correctness saja gagal mencirikan efisiensi, dengan 79,1% defisit efisiensi berasal dari akar penyebab spesifik domain.
Zhihao Gong; Junzhe Yu; Dong Huang; Zeyu Sun; Jie M. Zhang; Dan Haoยท 2026ยท DOI 10.48550/arXiv.2608.30248

Masalah inti

Benchmark generasi kode data science (DS) saat ini menyamakan correctness dengan kualitas, mengabaikan perbedaan waktu eksekusi yang membentang beberapa orde antara solusi yang benar. Kesenjangan ini krusial: dua implementasi yang benar secara fungsional untuk tugas data science yang sama dapat berbeda waktu jalan hingga 10x atau lebih, namun benchmark yang ada memberi keduanya skor identik. Penulis memperkenalkan **DSEffi-Bench**, benchmark pertama yang secara khusus menyasar efisiensi eksekusi pada kode DS hasil LLM. Benchmark ini terdiri atas 1.000 instans di lebih dari 10 pustaka DS, dengan harness stress-testing dan referensi yang divalidasi manusia. Pertanyaan penelitian utamanya adalah apakah correctness saja dapat mencirikan efisiensi kode data science hasil LLM. Jawabannya, berdasarkan evaluasi 16 model di 3 tier, adalah tidak. Digest ini mengikuti struktur IMRAD untuk menyajikan metodologi, hasil, dan analisis benchmark ini.

Inovasi

Evaluasi 16 model di 3 tier menghasilkan beberapa temuan mencolok:

- **Correctness tidak memprediksi efisiensi**: GPT-5.4 memimpin dalam correctness (Pass = 66,9%) tetapi skor efisiensinya (BP = 71,7%) hampir menyamai GPT-5.4-mini (71,6%), yang menyelesaikan 47 tugas lebih sedikit. Ini menunjukkan bahwa menyelesaikan lebih banyak tugas dengan benar tidak selalu berarti kode yang lebih efisien.
- **Pemimpin efisiensi berbeda dari pemimpin correctness**: Kimi-K2.5 menempati peringkat terendah dalam correctness di antara model frontier (Pass = 40,2%) namun meraih skor efisiensi tertinggi (BP = 73,6%) di antara seluruh 16 model. Hasil kontraintuitif ini menegaskan bahwa efisiensi dan correctness sebagian besar merupakan kapabilitas yang ortogonal.
- **Distribusi taksonomi**: Taksonomi lima kategori yang dianotasi manusia menyingkap bahwa 79,1% defisit efisiensi melampaui kompleksitas algoritmik ke akar penyebab spesifik domain. Sisanya 20,9% dapat diatribusikan semata-mata pada kompleksitas algoritmik. Profil kegagalan yang berbeda muncul di antara tier model dan pustaka, menunjukkan bahwa masalah efisiensi tidak seragam tetapi bergantung pada pelatihan model dan desain API pust

Benchmark generasi kode data science (DS) saat ini menyamakan correctness dengan kualitas, mengabaikan perbedaan waktu eksekusi yang membentang beberapa orde antara solusi yang benar. Kesenjangan ini krusial: dua implementasi yang benar secara fungsional untuk tugas data science yang sama dapat berbeda waktu jalan hingga 10x atau lebih, namun benchmark yang ada memberi keduanya skor identik. Penulis memperkenalkan **DSEffi-Bench**, benchmark pertama yang secara khusus menyasar efisiensi eksekusi pada kode DS hasil LLM. Benchmark ini terdiri atas 1.000 instans di lebih dari 10 pustaka DS, dengan harness stress-testing dan referensi yang divalidasi manusia. Pertanyaan penelitian utamanya adalah apakah correctness saja dapat mencirikan efisiensi kode data science hasil LLM. Jawabannya, berdasarkan evaluasi 16 model di 3 tier, adalah tidak. Digest ini mengikuti struktur IMRAD untuk menyajikan metodologi, hasil, dan analisis benchmark ini.
DSEffi-Bench dibangun dengan tiga komponen inti:

Mengapa penting

Temuan dari DSEffi-Bench menantang asumsi yang berlaku bahwa correctness adalah proksi yang memadai untuk kualitas kode dalam data science. Pemisahan correctness dan efisiensi memiliki implikasi mendalam:

1. **Desain benchmark**: Benchmark mendatang harus memasukkan metrik efisiensi untuk menghindari memberi imbalan pada solusi yang tidak efisien. Metrik BP menyediakan cara berprinsip untuk mengukur efisiensi dengan syarat correctness.
2. **Evaluasi model**: Memeringkat model semata-mata berdasarkan correctness dapat menyesatkan. Efisiensi tinggi Kimi-K2.5 meskipun correctness-nya rendah menunjukkan bahwa sebagian model mungkin memprioritaskan objektif optimasi yang berbeda. Praktisi harus mempertimbangkan kedua dimensi saat memilih model untuk tugas data science.
3. **Analisis akar penyebab**: Taksonomi lima kategori menyingkap bahwa sebagian besar defisit efisiensi bersifat spesifik domain, bukan sekadar algoritmik. Ini berarti optimasi generik (misalnya mengurangi kompleksitas waktu) mungkin tidak mengatasi mayoritas masalah. Sebaliknya, pengetahuan spesifik pustaka dan praktik terbaik API sangat krusial.
4. **Peningkatan yang dapat ditindaklanjuti**: Dua eksperimen eksploratif menunjukkan bahwa diagnostik dapat menghasilkan keuntungan nyata. Optimasi terpandu taksonomi secara langsung mengatasi defisit yang teridentifikasi, sementara routing terkondisi pustaka memanfaatkan kekuatan model per pustaka. Yang terakhir mencapai efisiensi mendekati state-of-the-art dengan sebagian kecil biaya, menyoroti potensi penerapan yang hemat biaya.

Namun, studi ini memiliki batasan. Taksonomi, meskipun dianotasi manusia, mungkin tidak mencakup semua kemungkinan masalah efisiensi. Eksperimen peningkatan bersifat eksploratif dan memerlukan validasi lebih lanjut. Pekerjaan mendatang dapat memperluas benchmark ke lebih banyak pustaka dan tugas, serta menyelidiki metode otomatis untuk anotasi taksonomi.

Sebagai kesimpulan, DSEffi-Bench memberikan langkah kritis menuju pemahaman dan peningkatan efisiensi kode data science hasil LLM. Ini menyerukan pergeseran dari evaluasi yang hanya berfokus pada correctness ke fokus ganda pada correctness dan efisiensi, dengan diagnostik spesifik domain yang memandu optimasi.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ