Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Autoscaling Agentik melalui Orkestrasi Worker-Pool untuk Klasifikasi Teks Berbasis LLM di Lingkungan Cloud Computing

Kerangka kerja yang agnostik terhadap classifier dan secara dinamis menskalakan worker agen untuk menyeimbangkan akurasi, latensi, dan efisiensi sumber daya untuk beban inferensi LLM yang bursty.
Bablu Kumar; Anshul Verma; Rajkumar Buyya· 2026· DOI 10.48550/arXiv.2609.14898

Masalah inti

Large language model (LLM) semakin banyak digunakan untuk klasifikasi teks skala besar, namun latensi inferensi yang tinggi, pola kedatangan yang bursty, dan intensitas komputasionalnya menciptakan tantangan signifikan bagi alokasi sumber daya statis di lingkungan cloud. Penyediaan statis menyebabkan over-provisioning—memboroskan biaya dan energi—atau under-provisioning—menyebabkan pelanggaran latensi dan penurunan throughput. Makalah ini mengatasi kesenjangan tersebut dengan mengusulkan **kerangka kerja autoscaling agentik** yang secara dinamis mengorkestrasi pool worker agen untuk melayani tugas klasifikasi teks berbasis LLM. Kerangka kerja ini dirancang agar agnostik terhadap classifier, mendukung model zero-shot maupun fine-tuned tanpa mengubah logika autoscaling. Penulis mengevaluasi kerangka kerja ini pada dua dataset (AG News dan SMS Spam Collection) menggunakan classifier BART dan DeBERTa, dibandingkan dengan alokasi statis dan baseline standalone RoBERTa/DistilBERT. Pertanyaan penelitian intinya adalah: *Dapatkah orkestrasi worker-pool elastis meningkatkan efisiensi sumber daya sekaligus mempertahankan akurasi klasifikasi yang tinggi untuk klasifikasi teks berbasis LLM?*

Inovasi

Hasil eksperimen menunjukkan bahwa kerangka kerja yang diusulkan secara konsisten mengungguli pendekatan baseline dalam efisiensi sumber daya sekaligus mempertahankan performa klasifikasi yang tinggi. Pada **dataset AG News**, Autoscaling+BART mencapai **akurasi 84,5%**, sedangkan Autoscaling+DeBERTa meningkatkannya menjadi **90,5%**. Pada **dataset SMS Spam Collection**, Autoscaling+DeBERTa mencapai **akurasi 99,5%**, sementara Autoscaling+BART mencapai **akurasi 84,5%** dengan waktu eksekusi lebih rendah. Dibandingkan dengan alokasi statis, kerangka kerja autoscaling mengurangi konsumsi sumber daya dengan menyesuaikan pool worker secara dinamis agar sesuai dengan intensitas beban kerja. Baseline standalone RoBERTa dan DistilBERT, yang tidak memanfaatkan autoscaling, menunjukkan latensi lebih tinggi atau akurasi lebih rendah pada beban kerja yang bursty. Hasil ini menunjukkan bahwa orkestrasi worker-pool elastis dapat secara efektif menangani tugas inferensi LLM yang berlatensi tinggi dan bursty tanpa mengorbankan kualitas klasifikasi. Yang patut dicatat, desain yang agnostik terhadap classifier memungkinkan penggantian model dasar secara mulus, sebagaimana dibuktikan oleh profil
Large language model (LLM) semakin banyak digunakan untuk klasifikasi teks skala besar, namun latensi inferensi yang tinggi, pola kedatangan yang bursty, dan intensitas komputasionalnya menciptakan tantangan signifikan bagi alokasi sumber daya statis di lingkungan cloud. Penyediaan statis menyebabkan over-provisioning—memboroskan biaya dan energi—atau under-provisioning—menyebabkan pelanggaran latensi dan penurunan throughput. Makalah ini mengatasi kesenjangan tersebut dengan mengusulkan **kerangka kerja autoscaling agentik** yang secara dinamis mengorkestrasi pool worker agen untuk melayani tugas klasifikasi teks berbasis LLM. Kerangka kerja ini dirancang agar agnostik terhadap classifier, mendukung model zero-shot maupun fine-tuned tanpa mengubah logika autoscaling. Penulis mengevaluasi kerangka kerja ini pada dua dataset (AG News dan SMS Spam Collection) menggunakan classifier BART dan DeBERTa, dibandingkan dengan alokasi statis dan baseline standalone RoBERTa/DistilBERT. Pertanyaan penelitian intinya adalah: *Dapatkah orkestrasi worker-pool elastis meningkatkan efisiensi sumber daya sekaligus mempertahankan akurasi klasifikasi yang tinggi untuk klasifikasi teks berbasis LLM?*
Kerangka kerja yang diusulkan terdiri dari empat komponen utama: (1) **priority task queue** yang menyangga permintaan klasifikasi yang masuk dan mengurutkannya berdasarkan prioritas; (2) **pool dinamis worker agen** yang menjalankan inferensi LLM; (3) **pengumpul metrik real-time** yang memantau panjang antrean, utilisasi worker, dan latensi; serta (4) **autoscaler lapisan aplikasi** yang menyesuaikan jumlah worker aktif berdasarkan metrik yang dikumpulkan. Autoscaler menggunakan kebijakan kontrol yang melakukan scale out ketika panjang antrean melebihi ambang batas dan scale in ketika utilisasi turun di bawah ambang batas, dengan hysteresis untuk menghindari osilasi. Kerangka kerja ini agnostik terhadap classifier: LLM diperlakukan sebagai black box, sehingga beralih dari BART ke DeBERTa tidak memerlukan perubahan pada logika autoscaling. Arsitekturnya diilustrasikan di bawah ini:

Mengapa penting

Temuan ini menyoroti beberapa wawasan kunci. Pertama, **autoscaling sangat penting** untuk klasifikasi teks berbasis LLM karena alokasi statis tidak dapat mengatasi beban kerja yang bursty: alokasi statis membuang sumber daya selama periode idle atau melanggar SLA latensi selama puncak. Kedua, **desain yang agnostik terhadap classifier** memungkinkan praktisi memilih model terbaik untuk trade-off akurasi-latensi mereka tanpa merekayasa ulang logika autoscaling. Misalnya, DeBERTa menghasilkan akurasi lebih tinggi pada kedua dataset, tetapi BART menawarkan waktu eksekusi lebih rendah pada SMS Spam, sehingga cocok untuk aplikasi yang sensitif terhadap latensi. Ketiga, **pendekatan agentik**—di mana worker adalah agen otonom yang dikelola oleh autoscaler pusat—memberikan pemisahan concerns yang bersih dan memfasilitasi skalabilitas. Namun, makalah ini tidak mengeksplorasi dampak kebijakan autoscaling yang berbeda (misalnya berbasis reinforcement learning) atau implikasi biaya di lingkungan cloud multi-tenant. Pekerjaan selanjutnya dapat menyelidiki penyetelan ambang batas adaptif dan integrasi dengan platform serverless. Secara keseluruhan, kerangka kerja ini menunjukkan bahwa orkestrasi worker-pool elastis adalah solusi hemat biaya untuk klasifikasi teks berbasis LLM yang skalabel, dengan potensi perluasan ke tugas NLP lain seperti peringkasan dan penerjemahan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…