Editorial Ilmu Komputer & AI
Evaluasi Softmax Homomorfik yang Cepat dan Akurat
Masalah inti
Enkripsi homomorfik (HE) memungkinkan Pembelajaran Mesin sebagai Layanan yang aman dan menjaga privasi dengan memungkinkan komputasi langsung pada data terenkripsi. Di antara komponen jaringan saraf, fungsi Softmax sangat menantang untuk dievaluasi secara homomorfik karena bersifat multivariat dan melibatkan eksponensial pada rentang nilai yang sangat besar:
Algoritma homomorfik yang ada masih terbatas, terutama dalam dimensi besar, sementara aplikasi seperti Model Bahasa Besar (LLM) memerlukan Softmax pada vektor berdimensi besar. Karya ini menargetkan celah tersebut dengan merancang algoritma Softmax homomorfik dengan skalabilitas kuat baik dalam rentang maupun dimensi sambil mempertahankan akurasi numerik yang tinggi. Metrik yang disebutkan adalah kedalaman multiplikatif, ukuran biaya yang sesuai untuk komputasi homomorfik. Untuk rentang masukan tetap, metode yang diusulkan mencapai kedalaman multiplikatif , di mana adalah dimensi Softmax. Ini juga disesuaikan untuk pengaturan di mana banyak panggilan Softmax dievaluasi secara bersamaan, seperti dalam inferensi LLM.
Inovasi
Eksperimen membandingkan algoritma yang diusulkan dengan solusi Softmax homomorfik terkini. Peningkatan praktis yang dilaporkan adalah faktor 2,5 hingga 8. Akurasi numerik sekitar presisi 16-bit dalam kasus terburuk dan sekitar 20 bit rata-rata. Hasilnya juga mendukung perilaku linear yang diklaim dalam dimensi Softmax.
Untuk evaluasi paralel, versi banyak-ciphertext menghitung 8192 panggilan Softmax berdimensi 256 secara paralel dalam 486 detik pada CPU berutas tunggal, yang setara dengan amortisasi 0,06 detik per panggilan Softmax. Dalam pengaturan LLM, semua panggilan Softmax dari model bahasa besar LLaMa 32-lapisan (versi 7B) dengan panjang konteks 128 membutuhkan sekitar 1,5 menit pada GPU RTX-6000. Panggilan Softmax terakhir dalam dimensi 32768 untuk pembuatan token membutuhkan waktu kurang dari 3 detik.
Hasil ini menunjukkan skalabilitas yang kuat baik dalam rentang maupun dimensi sambil mempertahankan akurasi numerik yang sangat baik. Para penulis menyimpulkan bahwa kepraktisan yang mendekati mungkin dapat diakses dengan perangkat keras khusus.
Mengapa penting
Signifikansi karya ini terletak pada menjadikan Softmax homomorfik praktis untuk vektor berdimensi besar dan untuk beban kerja gaya LLM yang dikemas. Strategi normalisasi-dan-kuadrat mengatasi ketegangan utama dalam Softmax homomorfik: eksponensial pada rentang yang luas tidak stabil secara numerik, sementara normalisasi sangat mahal dalam kedalaman multiplikatif. Dengan menyisipkan dan menguraikan operasi-operasi ini, algoritma mencapai kedalaman untuk rentang tetap dan kedalaman amortisasi per ciphertext ketika banyak panggilan Softmax dikemas bersama.
Hasil empiris memperkuat skalabilitas teoretis. Peningkatan kecepatan 2,5x-8x dibandingkan metode sebelumnya, dikombinasikan dengan presisi kasus terburuk 16-bit dan presisi rata-rata 20-bit, menunjukkan pertukaran akurasi-biaya yang menguntungkan. Kemampuan untuk menghitung 8192 panggilan Softmax berdimensi 256 dalam 486 detik pada CPU berutas tunggal dan menangani LLaMa 7B dengan 32 lapisan dan panjang konteks 128 pada GPU RTX-6000 dalam sekitar 1,5 menit menunjukkan bahwa inferensi terenkripsi mendekati kelayakan praktis. Softmax pembuatan token terakhir dalam dimensi 32768 dalam waktu kurang dari 3 detik sangat relevan untuk penerapan LLM interaktif.
Pertimbangan yang tersisa meliputi ketergantungan pada perangkat keras khusus untuk kepraktisan lebih lanjut dan pertukaran biasa antara presisi, rentang, dan kedalaman multiplikatif. Meskipun demikian, algoritma ini menyediakan fondasi yang skalabel untuk komponen LLM yang menjaga privasi dan layanan AI lainnya yang memerlukan evaluasi Softmax yang aman.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ