Editorial Ilmu Komputer & AI
Post-Training LLM sebagai Pemeliharaan Brownfield: Perspektif Industri tentang Dataware Engineering
Masalah inti
Post-training industri dibingkai di sini sebagai **rezim brownfield**. Tim tidak memulai dari awal yang bersih; mereka mewarisi checkpoint yang sudah diterapkan dan harus menghasilkan perbaikan yang ditargetkan di bawah anggaran komputasi dan campuran yang tetap tanpa menurunkan perilaku model lainnya. Artefak yang dipelihara semakin menjadi **dataware**: perilaku yang diatur oleh campuran post-training yang dikurasi, diperbarui melalui *mixture patch* terbatas alih-alih pelatihan ulang dari awal.
Makalah ini menyaring perspektif pemelihara ini dari upaya peningkatan pembuatan kode di industri. Alih-alih menyajikan satu resep pemenang, penulis mengidentifikasi tiga tantangan berulang yang mendominasi praktik:
1. **Desain campuran zero-sum** โ menambahkan data untuk satu kemampuan cenderung menggeser anggaran untuk kemampuan lain, sehingga keuntungan dipertukarkan, bukan sekadar ditambahkan.
2. **Yield sebagai metrik pengikat** โ sumber daya yang langka bukanlah keluaran mentah guru, melainkan fraksi yang terkonversi menjadi data pelatihan yang dapat digunakan.
3. **Integrasi end-to-end di bawah ketidakpastian** โ perbaikan harus bertahan melalui seluruh pipeline dan evaluasi stok
Inovasi
Patch yang direkayasa yield menghasilkan keuntungan terukur dan signifikan secara statistik dari satu checkpoint tetap per kondisi, di seluruh 16 evaluasi stokastik setiap benchmark.
| Benchmark | Metrik | Peningkatan |
|---|---|---|
| CodeForces | pass@1 | **+2,59 poin** |
| CodeForces | pass@3 | **+3,11 poin** |
| LiveCodeBench v6 (disisihkan) | pass@1 | **+6,11 poin** |
| LiveCodeBench v6 (disisihkan) | pass@3 | **+8,05 poin** |
Dua fitur dari hasil ini penting bagi pemelihara industri. Pertama, keuntungannya **signifikan secara statistik** di bawah protokol stokastik 16 kali jalan, yang merupakan standar yang menurut penulis harus dipenuhi klaim industri. Kedua, delta LiveCodeBench v6 yang disisihkan melebihi delta CodeForces dalam domain, menunjukkan intervensi yield tidak sekadar overfit pada benchmark utama.
Sama pentingnya adalah apa yang *tidak* bergerak: suite regresi internal **AIME dan MATH tetap dalam toleransi**. Dalam rezim brownfield, patch yang meningkatkan pembuatan kode tetapi menurunkan penalaran matematis bukanlah kemenangan โ itu adalah regresi yang harus ditangkap sebelum diterapkan. Kepatuhan toleransi yang dilaporkan karena itu adalah bagian dari hasil,
Mengapa penting
Ketiga tantangan membentuk sistem yang terkopel, dan memperlakukannya secara terpisah adalah mode kegagalan industri yang umum.
**Desain campuran zero-sum.** Karena anggaran komputasi dan campuran tetap, setiap penambahan juga merupakan pengurangan. Pemelihara tidak bisa sekadar menambahkan data kode berkualitas tinggi; mereka harus bernalar tentang kemampuan apa yang tergeser. Ini membingkai ulang kurasi campuran sebagai masalah *alokasi portofolio* di bawah kelangkaan alih-alih masalah pengumpulan data.
**Yield sebagai metrik pengikat.** Peningkatan yield 2,84ร โ dicapai dengan guru solusi yang sama dan empat upaya per masalah kandidat โ menunjukkan bahwa hambatan sering terletak pada *konversi*, bukan pada *kapasitas generasi*. Memperbesar panggilan guru tanpa meningkatkan yield membakar anggaran pada kandidat yang ditolak. Yield karena itu adalah metrik yang menentukan apakah anggaran tetap berubah menjadi supervisi yang diterima.
**Integrasi end-to-end di bawah ketidakpastian.** Patch yang terlihat bagus secara terpisah dapat gagal saat diintegrasikan, dan evaluasi stokastik adalah satu-satunya cara jujur untuk mendeteksinya. Protokol 16 kali jalan dan pengaman AIME/MATH mengoperasionalkan ini: mereka mengubah klaim yang tidak pasti menjadi keputusan.
Argumen yang lebih luas adalah tantangan-tantangan ini tidak diselesaikan oleh resep yang lebih baik melainkan oleh **disiplin rekayasa untuk memprogram dataware** โ campuran yang diberi versi, patch terbatas, instrumentasi yield, dan gerbang regresi. Artefak yang dipelihara adalah campuran itu, dan keahlian pemelihara adalah mengetahui patch mana yang harus diterapkan berikutnya.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ