Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Berpikir Sebelum Grid-Search: Triage Floor-First untuk LLM Serving

Alur kerja berbasis residual yang menggantikan sapuan konfigurasi buta dengan batas bawah analitis pada biaya sumber daya langkah decode
Yihua Liuยท 2026ยท DOI 10.48550/arXiv.2607.05876

Masalah inti

Optimasi LLM serving telah bergeser menjadi kebiasaan yang mahal: benchmark grid konfigurasi yang luas, dan ketika target latensi tidak tercapai, jangkau profiler yang lebih berat. Makalah ini berargumen untuk disiplin sebaliknya. Estimasi dibingkai sebagai lapisan analitis dari profiling; tanpanya, optimasi merosot menjadi grid search. Klaim utamanya adalah bahwa batas bawah bentuk tertutup yang murah pada biaya per langkah dapat memberi tahu insinyur *di mana* suatu pengukuran seharusnya jatuh sebelum profiler mana pun dibuka, sehingga perkakas mahal hanya dieskalasi pada residual yang melebihi ambang yang dinyatakan.

Alur kerja, yang disebut **Floor First**, adalah triage berbasis residual. Setiap langkah decode dimodelkan sebagai vektor sumber daya lima dimensi:

Menjumlahkan dalam satu sumber daya dan memaksimalkan antar sumber daya menghasilkan batas bawah optimistis; jumlah biasa menghasilkan batas atas pesimistis. Biaya terukur sebenarnya dikurung oleh interval

. Di mana suatu pengukuran jatuh di dalam interval itu langsu

Inovasi

Studi kasusnya adalah model MoE/MLA 671B bergaya DeepSeek-V3.2 pada 16 GPU NVIDIA H20. Ridge point H20 sekitar **74 FLOP/byte**, versus sekitar **590 FLOP/byte** untuk H100 โ€” menjadikan H20 bagian yang sangat berorientasi decode.

Batas bawah tersebut menghasilkan tiga temuan konkret:

1. **Decoding TP16 dibatasi kapasitas KV** hingga sekitar **70 permintaan 8K bersamaan**.
2. **Sparse attention menghilangkan suku bandwidth KV** tetapi tidak menghilangkan dinding kapasitas.
3. Tata letak **EP16 + DP-attention** menerima lalu lintas bobot batch yang sama sedikit lebih buruk dengan imbalan dinding kapasitas yang lebih tinggi sekitar satu orde, yaitu sekitar **644** permintaan bersamaan.

Terhadap keunggulan kapasitas itu, **latensi single-stream lebih menguntungkan TP sebesar 2,4x**. Kedua tata letak karena itu bukan jawaban yang bersaing untuk satu pertanyaan; keduanya adalah jawaban untuk titik operasi yang berbeda. Ini menjelaskan mengapa deployment produksi pada perangkat keras identik telah mengirim tata letak attention yang berlawanan tanpa ada yang salah.

Optimasi LLM serving telah bergeser menjadi kebiasaan yang mahal: benchmark grid konfigurasi yang luas, dan ketika target latensi tidak tercapai, jangkau profiler yang lebih berat. Makalah ini berargumen untuk disiplin sebaliknya. Estimasi dibingkai sebagai lapisan analitis dari profiling; tanpanya, optimasi merosot menjadi grid search. Klaim utamanya adalah bahwa batas bawah bentuk tertutup yang murah pada biaya per langkah dapat memberi tahu insinyur *di mana* suatu pengukuran seharusnya jatuh sebelum profiler mana pun dibuka, sehingga perkakas mahal hanya dieskalasi pada residual yang melebihi ambang yang dinyatakan.
Alur kerja, yang disebut **Floor First**, adalah triage berbasis residual. Setiap langkah decode dimodelkan sebagai vektor sumber daya lima dimensi:

Mengapa penting

Hasil ini membingkai ulang perselisihan yang berulang dalam LLM serving. Ketika dua tim pada perangkat keras yang sama memilih tata letak attention yang berlawanan, penjelasan yang biasa adalah preferensi rekayasa atau perbedaan beban kerja yang tersembunyi. Floor First menawarkan penjelasan yang lebih tajam: penilaian tata letak adalah fungsi yang dapat dihitung dari titik operasi. TP16 menang pada latensi single-stream; EP16 + DP-attention menang pada tinggi dinding kapasitas. Mana yang benar bergantung pada apakah deployment sensitif latensi atau sensitif throughput.

Argumen yang lebih luas adalah tentang metode. Grid search memperlakukan ruang konfigurasi sebagai buram dan membayar keburaman itu dengan jam GPU. Batas bawah yang dihitung dari vektor sumber daya lima dimensi hampir tidak memakan biaya dan memberi tahu insinyur apakah suatu pengukuran sudah mendekati optimal atau menyembunyikan residual nyata. Profiler tetap berharga, tetapi dieskalasi berdasarkan bukti alih-alih dijangkau secara default.

Desain komposisional penting untuk daya tahan. Seiring varian attention dan state-space berkembang biak, alur kerja yang menerima varian baru dengan mendeklarasikan satu modul menghindari siklus penulisan ulang yang menghantui harness benchmarking khusus. Pemasangan kalkulator tanpa dependensi plus agent skill juga menunjuk arah praktis untuk loop optimasi agentic: beri agen prior analitis, dan ia berhenti mencari secara buta.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ