Editorial ilmu komputer
BatchBench: Tolok Ukur Berbasis Beban Kerja untuk Kebijakan Autoscaling dalam Pemrosesan Batch Big Data
Masalah inti
Autoscaling telah menjadi ekspektasi dasar untuk pemrosesan big data cloud-native. Ruang desainnya telah berkembang dari heuristik berbasis aturan menjadi pengendali learned dan, yang terbaru, agen large language model (LLM). Meskipun ada pertumbuhan ini, komunitas kekurangan tolok ukur bersama untuk membandingkan paradigma-paradigma tersebut. Evaluasi yang ada mengandalkan kueri sintetis bergaya TPC, pos blog vendor dengan baseline proprietary, atau pemutaran ulang trace yang sempit. Akibatnya, setiap kebijakan baru melaporkan angka yang menguntungkan terhadap baseline yang berbeda, pada beban kerja yang berbeda, dengan model biaya yang berbeda, sehingga perbandingan antar-makalah menjadi praktis tidak mungkin.
Makalah ini adalah makalah posisi: makalah ini mengusulkan BatchBench, kerangka kerja tolok ukur terbuka yang dirancang untuk menempatkan kebijakan autoscaling berbasis aturan, learned, dan agentic pada pijakan eksperimental yang setara. Kontribusinya adalah desain kerangka kerja, bukan hasil empiris. Penulis berargumen bahwa tolok ukur berbasis beban kerja diperlukan untuk memajukan bidang ini, dan mereka menguraikan permukaan evaluasi yang diharapkan, pertanyaan peneliti
Inovasi
Sebagai makalah posisi, BatchBench tidak menyajikan hasil empiris. Sebaliknya, makalah ini menjelaskan permukaan evaluasi yang diharapkan dan bagaimana kerangka kerja ini akan memungkinkan perbandingan yang adil. Penulis menguraikan hasil yang diharapkan berikut:
- **Validasi taksonomi beban kerja**: Enam kelas beban kerja akan divalidasi terhadap trace nyata menggunakan KS dan EMD, memastikan bahwa beban kerja yang dihasilkan secara statistik tidak dapat dibedakan dari yang nyata.
- **Perbandingan kebijakan**: Harness lima sumbu akan menghasilkan profil kinerja multi-dimensi untuk setiap kebijakan, mengungkap trade-off antara biaya, SLA, responsivitas, thrash, dan interpretabilitas.
- **Akuntansi biaya LLM**: Dengan menyertakan biaya inferensi LLM, kerangka kerja ini akan menyoroti biaya sebenarnya dari autoscaler agentic, yang mungkin tersembunyi dalam evaluasi lain.
- **Reproduksibilitas**: Antarmuka terstandardisasi dan implementasi open source akan memungkinkan peneliti mereproduksi dan memperluas hasil.
Makalah ini juga mengidentifikasi pertanyaan penelitian terbuka, seperti: Bagaimana autoscaler berbasis LLM dibandingkan dengan yang learned dan berbasis aturan di bawah din
Mengapa penting
Penulis membahas batasan praktik evaluasi yang ada dan bagaimana BatchBench mengatasinya. Mereka berargumen bahwa tanpa tolok ukur bersama, komunitas tidak dapat membuat kemajuan kumulatif. Harness evaluasi lima sumbu adalah kontribusi kunci karena menangkap berbagai dimensi kinerja autoscaling, mencegah kebijakan mengoptimalkan satu metrik dengan mengorbankan yang lain. Penyertaan biaya inferensi LLM sangat tepat waktu mengingat lonjakan agen berbasis LLM baru-baru ini.
Antarmuka agen terstandardisasi adalah kontribusi penting lainnya, karena memungkinkan perbandingan apples-to-apples di seluruh paradigma. Penulis mengakui bahwa merancang antarmuka semacam itu menantang karena beragamnya sifat kebijakan autoscaling, tetapi mereka mengusulkan API yang fleksibel yang dapat mengakomodasi berbagai jenis kebijakan.
Makalah ini diakhiri dengan peta jalan untuk makalah empiris berikutnya. Peta jalan ini mencakup: (1) mengimplementasikan kerangka kerja referensi, (2) mengisinya dengan kebijakan representatif dari setiap paradigma, (3) menjalankan eksperimen ekstensif di seluruh taksonomi beban kerja, dan (4) menganalisis hasil untuk memperoleh wawasan dan praktik terbaik. Penulis mengundang komunitas untuk berkontribusi pada implementasi open source.
Arsitektur tingkat tinggi BatchBench diilustrasikan di bawah ini:
Kerangka kerja ini dirancang agar dapat diperluas dan modular, memungkinkan penambahan kelas beban kerja dan sumbu evaluasi di masa depan.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ