Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Mengevaluasi Trade-off LLM untuk Otomasi Perusahaan: Pelajaran dari Generasi Alur Kerja di Platform Perusahaan Produksi

Studi tingkat produksi terhadap enam LLM di 2.784 eksekusi mengungkap bagaimana dekomposisi pipeline piecewise membuat model yang lebih kecil layak untuk generasi alur kerja perusahaan.
Xavier Wrenn; Radoslav Raykov; Aleksandar Angelov; Hirokuni Kitahara; Yuji Watanabe; Anca Sailerยท 2026ยท DOI 10.48550/arXiv.2608.03311

Masalah inti

Manajemen kepatuhan perusahaan menghadapi tekanan yang meningkat untuk beradaptasi dengan cepat terhadap kerangka regulasi yang berkembang seperti DORA, AI RMF, dan FedRAMP, sambil memenuhi SLA remediasi yang ketat. Orkestrator statis tradisional sering gagal di lingkungan hybrid cloud di mana penilaian berbasis peristiwa menuntut kode otomasi beradaptasi dengan konteks runtime dalam hitungan detik. Makalah ini menjawab kesenjangan tersebut dengan menyajikan pelajaran yang diperoleh dari evaluasi enam large language model (LLM) untuk generasi alur kerja berbasis AI di platform perusahaan produksi.

Pertanyaan penelitian utamanya adalah apakah LLM dapat secara andal menghasilkan alur kerja otomasi yang dapat dieksekusi yang memenuhi validitas struktural (kebenaran skema JSON dan rendering UI yang tepat) dan kebenaran semantik (pemenuhan logis dari maksud pengguna). Penulis melakukan benchmark model di 29 skenario otomasi TI dunia nyata, dua arsitektur pipeline generasi, dan delapan eksekusi independen per konfigurasi prompt-model-pipeline, menghasilkan total 2.784 eksekusi. Studi ini dimotivasi oleh kebutuhan akan otomasi yang agnostik model dan skalabel dalam rekayasa cloud, di man

Inovasi

Pipeline monolitik mencapai tingkat keberhasilan struktural berkisar dari 31,5% hingga 82,8% di seluruh model, dengan sebagian besar model kesulitan pada generasi JSON yang kompleks. Pipeline piecewise menaikkan keberhasilan struktural menjadi 74,1โ€“97,8% di seluruh model, menunjukkan peningkatan yang substansial dalam keandalan.

Di antara model individu, mistral-medium-2505 dan gpt-oss-120b mencapai tingkat keberhasilan struktural tertinggi masing-masing pada 96,1% dan 97,8%. Namun, mistral-medium-2505 membawa premi biaya 19x dibandingkan mistral-small. Menariknya, mistral-small mencapai keberhasilan struktural 95,7% hanya dengan USD 0,01 per alur kerja, membuatnya layak produksi di bawah pipeline piecewise. Biaya di seluruh model berkisar dari USD 0,008 hingga USD 0,20 per alur kerja, dan latensi tetap di bawah 50 detik untuk penggunaan interaktif.

Hasil menunjukkan bahwa dekomposisi piecewise memungkinkan model yang lebih kecil dan lebih murah mencapai kelayakan produksi, menghilangkan ketergantungan pada model frontier yang mahal. Tabel berikut merangkum metrik utama:

| Model | Pipeline | Keberhasilan Struktural | Biaya (USD/alur kerja) |
|-------|----------|-----------------

Manajemen kepatuhan perusahaan menghadapi tekanan yang meningkat untuk beradaptasi dengan cepat terhadap kerangka regulasi yang berkembang seperti DORA, AI RMF, dan FedRAMP, sambil memenuhi SLA remediasi yang ketat. Orkestrator statis tradisional sering gagal di lingkungan hybrid cloud di mana penilaian berbasis peristiwa menuntut kode otomasi beradaptasi dengan konteks runtime dalam hitungan detik. Makalah ini menjawab kesenjangan tersebut dengan menyajikan pelajaran yang diperoleh dari evaluasi enam large language model (LLM) untuk generasi alur kerja berbasis AI di platform perusahaan produksi.
Pertanyaan penelitian utamanya adalah apakah LLM dapat secara andal menghasilkan alur kerja otomasi yang dapat dieksekusi yang memenuhi validitas struktural (kebenaran skema JSON dan rendering UI yang tepat) dan kebenaran semantik (pemenuhan logis dari maksud pengguna). Penulis melakukan benchmark model di 29 skenario otomasi TI dunia nyata, dua arsitektur pipeline generasi, dan delapan eksekusi independen per konfigurasi prompt-model-pipeline, menghasilkan total 2.784 eksekusi. Studi ini dimotivasi oleh kebutuhan akan otomasi yang agnostik model dan skalabel dalam rekayasa cloud, di mana biaya, latensi, dan pemilihan model merupakan trade-off produksi yang kritis.

Mengapa penting

Pelajaran penerapan studi ini menekankan perlunya memisahkan validitas struktural dari kebenaran semantik. Validitas struktural memastikan alur kerja yang dihasilkan benar secara sintaksis dan dirender dengan tepat di UI, sedangkan kebenaran semantik memastikan alur kerja secara logis memenuhi maksud pengguna. Pipeline piecewise terutama meningkatkan validitas struktural dengan memecah generasi kompleks menjadi sub-tugas yang dapat dikelola. Namun, kebenaran semantik mungkin masih memerlukan validasi tambahan atau tinjauan human-in-the-loop.

Trade-off biaya-latensi sangat penting untuk penerapan produksi. Meskipun model frontier seperti mistral-medium-2505 dan gpt-oss-120b menawarkan keberhasilan struktural yang sedikit lebih tinggi, premi biaya mereka mungkin tidak dapat dibenarkan untuk semua kasus penggunaan. Pipeline piecewise memungkinkan pendekatan agnostik model, memungkinkan organisasi memilih model berdasarkan biaya, latensi, dan ketersediaan tanpa mengorbankan keandalan struktural.

Wawasan arsitektural kunci adalah bahwa dekomposisi mengurangi kompleksitas setiap langkah generasi, yang sangat bermanfaat untuk model yang lebih kecil. Ini sejalan dengan tren yang lebih luas dalam menggunakan model khusus yang lebih kecil untuk sub-tugas tertentu daripada mengandalkan satu model monolitik. Penulis memberikan solusi untuk otomasi yang skalabel dalam rekayasa cloud, tetapi juga mencatat bahwa kebenaran semantik tetap menjadi tantangan terbuka. Pekerjaan di masa depan dapat mengeksplorasi validasi semantik otomatis atau fine-tuning model yang lebih kecil untuk domain kepatuhan tertentu.

Batasan studi ini termasuk fokus pada satu platform produksi dan serangkaian 29 skenario tertentu. Generalisasi ke lingkungan perusahaan lain dapat bervariasi. Namun demikian, temuan ini menawarkan panduan yang dapat ditindaklanjuti bagi organisasi yang ingin mengintegrasikan LLM ke dalam alur kerja otomasi kepatuhan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ