Editorial ilmu komputer
Open AccessOA2026
CARVY-FL: Anticluster Klien untuk Voting yang Robust dalam Federated Learning yang Terbukti Aman
Mengestimasi tipe distribusi klien dari pembaruan satu epoch dan menggunakan anticlustering untuk meningkatkan akurasi tersertifikasi serta margin suara pada data non-IID yang terpisah kelas
Masaki Nakada; Honoka Anada; Tatsuya Kaneko; Hiroshi Nakamura; Shinya Takamaeda-Yamazaki; Hideki Takaseยท 2026ยท DOI 10.48550/arXiv.2608.28992
Masalah inti
Federated learning (FL) memungkinkan pelatihan kolaboratif tanpa berbagi data mentah secara langsung, tetapi tetap rentan terhadap klien berbahaya. FL berbasis voting meningkatkan ketahanan dengan mempartisi klien ke dalam kelompok, melatih satu model per kelompok, dan mengagregasi prediksi melalui voting pluralitas. Namun, pada data non-IID yang terpisah kelas, pengelompokan yang mengabaikan distribusi dapat menghasilkan akurasi tersertifikasi (certified accuracy, CA) yang sangat bervariasi. Penulis mengidentifikasi variabilitas ini sebagai kelemahan utama: ketika klien dikelompokkan tanpa memperhatikan distribusi datanya, sebagian kelompok dapat didominasi oleh satu kelas atau sekumpulan kelas yang sempit, sehingga melemahkan kemampuan ansambel untuk mengalahkan prediksi adversarial. Makalah ini mengusulkan CARVY-FL untuk mengatasi kesenjangan tersebut dengan membuat pengelompokan sadar distribusi sekaligus mempertahankan jaminan CA formal dari FL berbasis voting. Karya ini diposisikan terhadap FLCert, metode FL berbasis voting sebelumnya, dan mengevaluasi ketahanan pada BadNets dengan penggantian model, sebuah model ancaman backdoor yang kuat.
Inovasi
Eksperimen dilakukan pada MNIST dan Fashion-MNIST dengan data non-IID yang terpisah kelas. Penulis membandingkan CARVY-FL dengan FLCert, metode FL berbasis voting sebelumnya. Hasil yang dilaporkan menunjukkan bahwa CARVY-FL mencapai akurasi tersertifikasi (CA) yang lebih tinggi daripada FLCert pada kedua dataset. Pada BadNets dengan penggantian model, CARVY-FL meningkatkan AUC dari 100-ASR masing-masing sebesar 11,1% dan 14,9%. Metrik 100-ASR kemungkinan merujuk pada tingkat keberhasilan serangan ketika 100% klien berbahaya mencoba backdoor, dan AUC mengukur area di bawah kurva keberhasilan serangan terhadap ambang pertahanan tertentu. Peningkatan ini menunjukkan bahwa pengelompokan berbasis anticlustering membuat ansambel voting lebih tangguh terhadap serangan backdoor dengan meningkatkan margin suara. Makalah ini tidak melaporkan angka CA yang tepat dalam abstrak, tetapi klaim kualitatifnya adalah CA lebih tinggi daripada FLCert di seluruh pengaturan yang diuji. Hasil ini mendukung hipotesis bahwa pengelompokan yang sadar distribusi mengurangi varians CA pada data non-IID yang terpisah kelas.
Federated learning (FL) memungkinkan pelatihan kolaboratif tanpa berbagi data mentah secara langsung, tetapi tetap rentan terhadap klien berbahaya. FL berbasis voting meningkatkan ketahanan dengan mempartisi klien ke dalam kelompok, melatih satu model per kelompok, dan mengagregasi prediksi melalui voting pluralitas. Namun, pada data non-IID yang terpisah kelas, pengelompokan yang mengabaikan distribusi dapat menghasilkan akurasi tersertifikasi (certified accuracy, CA) yang sangat bervariasi. Penulis mengidentifikasi variabilitas ini sebagai kelemahan utama: ketika klien dikelompokkan tanpa memperhatikan distribusi datanya, sebagian kelompok dapat didominasi oleh satu kelas atau sekumpulan kelas yang sempit, sehingga melemahkan kemampuan ansambel untuk mengalahkan prediksi adversarial. Makalah ini mengusulkan CARVY-FL untuk mengatasi kesenjangan tersebut dengan membuat pengelompokan sadar distribusi sekaligus mempertahankan jaminan CA formal dari FL berbasis voting. Karya ini diposisikan terhadap FLCert, metode FL berbasis voting sebelumnya, dan mengevaluasi ketahanan pada BadNets dengan penggantian model, sebuah model ancaman backdoor yang kuat.
CARVY-FL beroperasi dalam dua tahap utama: (1) estimasi tipe distribusi klien dan (2) pengelompokan berbasis anticlustering. Pada tahap pertama, setiap klien melakukan satu epoch pelatihan lokal dan mengirimkan pembaruan modelnya ke server. Server menggunakan pembaruan satu epoch tersebut untuk mengestimasi tipe distribusi setiap klien, yaitu kelas mana yang ada dan bagaimana distribusinya. Hal ini menghindari kebutuhan klien mengungkapkan data mentah atau histogram kelas secara penuh. Pada tahap kedua, server mempartisi klien ke dalam kelompok menggunakan anticlustering, sebuah kerangka optimisasi yang memaksimalkan keragaman dalam kelompok. Tujuannya adalah memastikan setiap kelompok berisi campuran tipe distribusi sehingga tidak ada kelompok yang didominasi oleh satu pecahan yang terpisah kelas. Dengan pengelompokan yang tetap, CARVY-FL mempertahankan jaminan CA berbasis voting sekaligus meningkatkan margin suara. Secara formal, untuk pengelompokan tertentu dan input uji , prediksi ansambel adalah voting pluralitas atas model kelompok :
Mengapa penting
Wawasan kunci CARVY-FL adalah bahwa mengelompokkan klien tanpa mempertimbangkan distribusi datanya dapat menciptakan kelompok yang sangat berkorelasi dalam kesalahannya, yang melemahkan jaminan CA berbasis voting. Dengan mengestimasi tipe distribusi dari pembaruan satu epoch dan menggunakan anticlustering untuk memaksimalkan keragaman dalam kelompok, CARVY-FL mengurangi korelasi kesalahan dan meningkatkan margin suara. Hal ini mempertahankan jaminan CA formal sekaligus meningkatkan ketahanan empiris. Pendekatan ini komplementer terhadap pertahanan yang ada seperti agregasi robust dan deteksi anomali, dan beroperasi pada tingkat pembentukan kelompok alih-alih pada tingkat agregasi pembaruan. Batasannya mencakup ketergantungan pada pembaruan satu epoch untuk estimasi distribusi, yang dapat bising di bawah komputasi heterogen atau kendala komunikasi, serta asumsi bahwa data non-IID yang terpisah kelas adalah model ancaman utama. Pekerjaan selanjutnya dapat memperluas metode ini ke pengaturan non-IID lain, mengintegrasikannya dengan secure aggregation, dan mengevaluasi pada dataset yang lebih besar serta jenis serangan yang lebih beragam. Kandidat taksonomi untuk karya ini mencakup Architecture, Cybersecurity, Network, dan Cryptography, yang mencerminkan persinggungannya dengan sistem terdistribusi, keamanan, dan pembelajaran yang menjaga privasi.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ