Editorial Ilmu Komputer & AI
AutoAdapt: Penerapan AutoML untuk Fine-Tuning Hemat Parameter pada Model Kode Pra-latih
Masalah inti
Large Language Models (LLM) telah menunjukkan kemampuannya menyelesaikan tugas di berbagai domain, termasuk rekayasa perangkat lunak. Namun skalanya justru menjadi alasan sulitnya penerapan: dengan jumlah parameter yang sangat besar, fine-tuning penuh menjadi tidak praktis secara komputasi, karena menuntut penyimpanan gradien, status optimizer, dan checkpointing pada skala yang tidak dapat ditanggung banyak kelompok riset maupun sebagian besar tim industri. Metode Parameter-Efficient Fine-Tuning (PEFT), khususnya fine-tuning adapter, diusulkan sebagai jawaban pragmatis. Alih-alih memperbarui seluruh matriks bobot , adapter menyisipkan modul kecil yang dapat dilatih dan membiarkan backbone pra-latih tetap beku, sehingga proporsi parameter yang dapat dilatih memenuhi:
Adapter biasanya mewujudkan hal ini melalui proyeksi bottleneck dengan koneksi residual, sehingga keluaran sublayer beku ditransformasikan sebagai:
Masalah yang diidentifikasi dalam makalah ini bukanlah mekanisme adapter itu sendiri, melainkan cara konfigura
Inovasi
Hasil empiris menunjukkan bahwa AutoAdapt mengungguli konfigurasi adapter yang dirancang manual. Peningkatan utamanya besar dan, yang penting, tersebar di berbagai keluarga tugas alih-alih terkonsentrasi pada satu tolok ukur. AutoAdapt mencapai peningkatan hingga 5% -score untuk deteksi klon dan deteksi cacat, serta hingga 25% peningkatan MRR untuk pencarian kode. Asimetri antara kedua angka tersebut informatif: tugas bergaya klasifikasi atas kode sudah memiliki baseline adapter yang disetel manual dan cukup kompetitif, sehingga perolehan lima poin merepresentasikan kemajuan yang bermakna namun terbatas, sedangkan pencarian kode โ masalah perankingan yang metriknya sensitif terhadap urutan relatif kumpulan kandidat โ menyediakan ruang perbaikan jauh lebih besar, dan AutoAdapt menangkap seperempat penuh peningkatan MRR dibandingkan alternatif konfigurasi seragam.
Selain melampaui adapter yang disetel manual, AutoAdapt juga mengungguli teknik PEFT lain, seperti Prefix Tuning dan LoRA. Perbandingan ini penting karena metode-metode itulah yang biasanya dipilih praktisi secara default. Mengalahkannya bukan sekadar soal hasil undian hyperparameter yang sedikit lebih baik; hal itu m
Mengapa penting
Analisis menyeluruh mengungkap bahwa faktor seperti adaptasi lapisan selektif, pemilihan modul (misalnya attention versus lapisan feed-forward), normalisasi, dan dropout berpengaruh signifikan terhadap performa di berbagai tugas. Analisis ini adalah kontribusi makalah yang paling mudah dialihkan, karena mengubah artefak pencarian menjadi seperangkat prinsip desain yang dapat diinterpretasikan bagi para praktisi PEFT.
**Adaptasi lapisan selektif.** Kemampuan membiarkan lapisan tetap beku โ opsi pada setiap gen lapisan โ bukan sekadar pengisi ruang. Opsi ini memungkinkan pencarian mengekspresikan intuisi bahwa sebagian lapisan model kode pra-latih sudah menyandikan representasi yang sesuai untuk tugas target dan tidak boleh diganggu, sementara sejumlah kecil lapisan lain memikul beban adaptasi tugas. Hal ini membingkai ulang fine-tuning sebagai masalah alokasi sumber daya di sepanjang kedalaman, bukan perturbasi seragam atas seluruh tumpukan.
**Pemilihan modul.** Perbedaan antara mengadaptasi sublayer attention versus feed-forward terbukti berdampak, dan dampaknya bervariasi menurut tugas. Adaptasi pada tingkat attention dan pada tingkat feed-forward melayani peran fungsional yang berbeda, dan pencarian menemukan mana yang dihargai oleh tugas tertentu. Konsekuensinya, jawaban atas pertanyaan "di mana sebaiknya saya menempatkan adapter?" tidak dapat diberikan secara a priori dan seragam โ jawaban itu merupakan sifat empiris dari pasangan tugasโmodel, dan justru inilah jenis pertanyaan yang dirancang untuk dijawab oleh NAS.
**Normalisasi dan dropout.** Dua hyperparameter yang secara tradisional dianggap "membosankan" muncul sebagai tuas performa yang signifikan di berbagai tugas. Karena adapter disisipkan ke dalam jaringan yang beku, interaksi antara keluaran adapter dan normalisasi di sekitarnya menjadi lebih penting daripada dalam fine-tuning penuh, di mana statistik normalisasi itu sendiri juga ikut diperbarui. Demikian pula, dropout mengendalikan tekanan regularisasi pada himpunan parameter terlatih yang sangat kecil, di mana risiko overfitting secara struktural berbeda dari fine-tuning penuh.
**Keteralihan (transferability).** Temuan yang mungkin paling berguna secara praktis adalah bahwa hasilnya memberi petunjuk adanya kemungkinan mentransfer konfigurasi adapter ke dataset dan tugas yang serupa, sehingga menyederhanakan pencarian pengaturan PEFT yang optimal. Jika konfigurasi yang ditemukan pada satu tugas kode dapat digeneralisasi ke tugas terkait, pencarian evolusioner yang mahal dapat diamortisasi: bayar biaya pencarian sekali, lalu gunakan kembali konfigurasi tersebut sebagai inisialisasi kuat atau sebagai resep tetap untuk masalah-masalah tetangga. Ini secara substansial mengubah sisi ekonomi pendekatan ini, menggesernya dari kemewahan per tugas menjadi aset organisasi yang dapat dipakai ulang.
**Implikasi dan keterbatasan.** Secara metodologis, karya ini berargumen bahwa batas antara "arsitektur" dan "hyperparameter" bersifat artifisial untuk PEFT berbasis adapter: rank, penempatan, normalisasi, dan dropout bersama-sama membentuk arsitektur yang ringan, dan mencari arsitektur tersebut merupakan penerapan NAS yang sah. Secara praktis, rezim parameter di bawah 2,5% menyiratkan bahwa tim dapat melakukan fine-tuning model kode yang kompetitif pada perangkat keras sederhana. Keterbatasannya mengikuti desain yang sama: NAS evolusioner memerlukan evaluasi fine-tuning berulang, sehingga pencarian itu sendiri rakus komputasi meskipun model yang dihasilkan tidak; konfigurasi yang ditemukan bersifat spesifik terhadap tugas dan model; serta hasil keteralihannya bersifat sugestif, bukan jaminan generalisasi formal pada domain kode yang sembarang. Validitas eksternal yang lebih luas โ model, bahasa, dan tugas rekayasa perangkat lunak tambahan โ tetap menjadi pertanyaan lanjutan yang wajar.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ