Editorial ilmu komputer
Corrective Forcing: Pasca-pelatihan Terpadu untuk Difusi dan Flow dalam Peningkatan Kualitas Suara Generatif
Masalah inti
Model difusi dan flow telah muncul sebagai paradigma generatif yang menjanjikan untuk peningkatan kualitas suara. Namun, model-model ini mengalami ketidaksesuaian mendasar antara pelatihan dan inferensi: selama pelatihan, model dioptimalkan pada keadaan jalur analitis, sedangkan pada inferensi model mengevaluasi dirinya sendiri secara rekursif pada keadaan rollout yang dihasilkan sendiri sepanjang lintasan sampling yang didiskretisasi. Perbedaan ini menyebabkan kesalahan prediksi dan diskretisasi menumpuk selama proses sampling, sehingga menurunkan kualitas keluaran.
Makalah ini memperkenalkan **Corrective Forcing (CoF)**, sebuah paradigma pasca-pelatihan yang mengatasi ketidaksesuaian tersebut dengan memaksa model difusi dan flow belajar dari rollout yang dihasilkan sendiri dan mengoreksi prediksinya. CoF dirancang agar dapat diterapkan pada formulasi difusi maupun flow melalui parameterisasi prediksi suara bersih yang sama, sehingga menjadi tujuan pasca-pelatihan yang terpadu. Penulis mengevaluasi CoF dengan dua instansiasi representatif: **SB-VE** (model difusi variance-exploding) dan **OT-CFM** (optimal-transport conditional flow matching), yang menunjukkan peningkatan kualita
Inovasi
Penulis melakukan eksperimen dengan dua instansiasi: **SB-VE** dan **OT-CFM**. Hasilnya menunjukkan peningkatan kualitas perseptual dan kesetiaan rekonstruksi. Secara spesifik, CoF menghasilkan kinerja yang lebih baik dibandingkan model baseline tanpa pasca-pelatihan, sebagaimana diukur dengan metrik peningkatan kualitas suara standar (meskipun abstrak tidak mencantumkan nilai metrik spesifik).
Temuan kunci adalah bahwa CoF memberikan kinerja yang tangguh pada berbagai jumlah langkah sampling. Ini sangat penting karena model difusi dan flow sering menurun ketika jumlah langkah sampling dikurangi untuk inferensi yang lebih cepat. Kemampuan CoF mempertahankan kualitas pada berbagai jumlah langkah menunjukkan bahwa metode ini secara efektif mengurangi penumpukan kesalahan diskretisasi.
Eksperimen tersebut memvalidasi sifat terpadu CoF: tujuan pasca-pelatihan yang sama meningkatkan model difusi (SB-VE) maupun flow (OT-CFM), yang menegaskan bahwa parameterisasi prediksi suara bersih yang sama memungkinkan penerapan lintas formulasi.
Mengapa penting
Ketidaksesuaian pelatihan–inferensi pada model difusi dan flow merupakan tantangan yang sudah dikenal. CoF mengatasinya dengan melatih langsung pada rollout yang dihasilkan sendiri, yang secara konseptual mirip dengan scheduled sampling atau pembelajaran penguatan dari keluaran model, tetapi disesuaikan untuk pengaturan generatif waktu kontinu. Penggunaan jadwal sampling dinamis memastikan model terpapar pada berbagai kondisi inferensi, sehingga mencegah overfitting pada diskretisasi tetap.
Regularisasi evolusi lokal melalui transisi kontrafaktual merupakan kontribusi baru. Ini mendorong pembaruan langkah demi langkah model agar konsisten dengan prediksi yang telah dikoreksi, yang kemungkinan menstabilkan lintasan sampling dan mengurangi penumpukan kesalahan. Dengan menyatakan keluaran melalui parameterisasi prediksi suara bersih yang sama, CoF mencapai unifikasi lintas formulasi difusi dan flow, sehingga menyederhanakan adopsinya.
Batasan dan pekerjaan masa depan tidak dibahas secara eksplisit dalam abstrak, tetapi arah potensial mencakup perluasan CoF ke tugas generatif lain (misalnya, generasi gambar atau audio) dan penyelidikan jaminan teoretis untuk pengurangan kesalahan. Kandidat taksonomi (Architecture, Cybersecurity, Network, Cryptography) tampak tidak terkait dengan pekerjaan ini; domain utamanya adalah peningkatan kualitas suara generatif.
Siapa yang sebaiknya membaca
Membuka konten member…