Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

BatchBench: Tolok Ukur Berbasis Beban Kerja untuk Kebijakan Autoscaling dalam Pemrosesan Batch Big Data

Makalah posisi yang mengusulkan kerangka kerja tolok ukur terbuka untuk membandingkan secara adil autoscaler berbasis aturan, learned, dan agen LLM
Venkata Krishna Prasanth Budigi; Siri Chandana Sirigiriยท 2026ยท DOI 10.48550/arXiv.2605.12272

Masalah inti

Autoscaling telah menjadi ekspektasi dasar untuk pemrosesan big data cloud-native. Ruang desainnya telah berkembang dari heuristik berbasis aturan menjadi pengendali learned dan, yang terbaru, agen large language model (LLM). Meskipun ada pertumbuhan ini, komunitas kekurangan tolok ukur bersama untuk membandingkan paradigma-paradigma tersebut. Evaluasi yang ada mengandalkan kueri sintetis bergaya TPC, pos blog vendor dengan baseline proprietary, atau pemutaran ulang trace yang sempit. Akibatnya, setiap kebijakan baru melaporkan angka yang menguntungkan terhadap baseline yang berbeda, pada beban kerja yang berbeda, dengan model biaya yang berbeda, sehingga perbandingan antar-makalah menjadi praktis tidak mungkin.

Makalah ini adalah makalah posisi: makalah ini mengusulkan BatchBench, kerangka kerja tolok ukur terbuka yang dirancang untuk menempatkan kebijakan autoscaling berbasis aturan, learned, dan agentic pada pijakan eksperimental yang setara. Kontribusinya adalah desain kerangka kerja, bukan hasil empiris. Penulis berargumen bahwa tolok ukur berbasis beban kerja diperlukan untuk memajukan bidang ini, dan mereka menguraikan permukaan evaluasi yang diharapkan, pertanyaan peneliti

Inovasi

Sebagai makalah posisi, BatchBench tidak menyajikan hasil empiris. Sebaliknya, makalah ini menjelaskan permukaan evaluasi yang diharapkan dan bagaimana kerangka kerja ini akan memungkinkan perbandingan yang adil. Penulis menguraikan hasil yang diharapkan berikut:

- **Validasi taksonomi beban kerja**: Enam kelas beban kerja akan divalidasi terhadap trace nyata menggunakan KS dan EMD, memastikan bahwa beban kerja yang dihasilkan secara statistik tidak dapat dibedakan dari yang nyata.
- **Perbandingan kebijakan**: Harness lima sumbu akan menghasilkan profil kinerja multi-dimensi untuk setiap kebijakan, mengungkap trade-off antara biaya, SLA, responsivitas, thrash, dan interpretabilitas.
- **Akuntansi biaya LLM**: Dengan menyertakan biaya inferensi LLM, kerangka kerja ini akan menyoroti biaya sebenarnya dari autoscaler agentic, yang mungkin tersembunyi dalam evaluasi lain.
- **Reproduksibilitas**: Antarmuka terstandardisasi dan implementasi open source akan memungkinkan peneliti mereproduksi dan memperluas hasil.

Makalah ini juga mengidentifikasi pertanyaan penelitian terbuka, seperti: Bagaimana autoscaler berbasis LLM dibandingkan dengan yang learned dan berbasis aturan di bawah din

Autoscaling telah menjadi ekspektasi dasar untuk pemrosesan big data cloud-native. Ruang desainnya telah berkembang dari heuristik berbasis aturan menjadi pengendali learned dan, yang terbaru, agen large language model (LLM). Meskipun ada pertumbuhan ini, komunitas kekurangan tolok ukur bersama untuk membandingkan paradigma-paradigma tersebut. Evaluasi yang ada mengandalkan kueri sintetis bergaya TPC, pos blog vendor dengan baseline proprietary, atau pemutaran ulang trace yang sempit. Akibatnya, setiap kebijakan baru melaporkan angka yang menguntungkan terhadap baseline yang berbeda, pada beban kerja yang berbeda, dengan model biaya yang berbeda, sehingga perbandingan antar-makalah menjadi praktis tidak mungkin.
Makalah ini adalah makalah posisi: makalah ini mengusulkan BatchBench, kerangka kerja tolok ukur terbuka yang dirancang untuk menempatkan kebijakan autoscaling berbasis aturan, learned, dan agentic pada pijakan eksperimental yang setara. Kontribusinya adalah desain kerangka kerja, bukan hasil empiris. Penulis berargumen bahwa tolok ukur berbasis beban kerja diperlukan untuk memajukan bidang ini, dan mereka menguraikan permukaan evaluasi yang diharapkan, pertanyaan penelitian terbuka, dan peta jalan untuk makalah empiris berikutnya. Implementasi referensi sedang dalam pengembangan aktif dan akan dirilis sebagai open source.

Mengapa penting

Penulis membahas batasan praktik evaluasi yang ada dan bagaimana BatchBench mengatasinya. Mereka berargumen bahwa tanpa tolok ukur bersama, komunitas tidak dapat membuat kemajuan kumulatif. Harness evaluasi lima sumbu adalah kontribusi kunci karena menangkap berbagai dimensi kinerja autoscaling, mencegah kebijakan mengoptimalkan satu metrik dengan mengorbankan yang lain. Penyertaan biaya inferensi LLM sangat tepat waktu mengingat lonjakan agen berbasis LLM baru-baru ini.

Antarmuka agen terstandardisasi adalah kontribusi penting lainnya, karena memungkinkan perbandingan apples-to-apples di seluruh paradigma. Penulis mengakui bahwa merancang antarmuka semacam itu menantang karena beragamnya sifat kebijakan autoscaling, tetapi mereka mengusulkan API yang fleksibel yang dapat mengakomodasi berbagai jenis kebijakan.

Makalah ini diakhiri dengan peta jalan untuk makalah empiris berikutnya. Peta jalan ini mencakup: (1) mengimplementasikan kerangka kerja referensi, (2) mengisinya dengan kebijakan representatif dari setiap paradigma, (3) menjalankan eksperimen ekstensif di seluruh taksonomi beban kerja, dan (4) menganalisis hasil untuk memperoleh wawasan dan praktik terbaik. Penulis mengundang komunitas untuk berkontribusi pada implementasi open source.

Arsitektur tingkat tinggi BatchBench diilustrasikan di bawah ini:

Kerangka kerja ini dirancang agar dapat diperluas dan modular, memungkinkan penambahan kelas beban kerja dan sumbu evaluasi di masa depan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ