Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Optimasi Bersama Pelatihan dan Inferensi dalam Federated Edge Learning melalui Constrained Multi-Objective Deep Reinforcement Learning

Kerangka kerja daring terinspirasi antrean tandem dengan C-MOPPO untuk menyeimbangkan akurasi, latensi, dan energi dalam FEEL
Zhen Li; Jun Cai; Chao Yang; Haoran Gaoยท 2026ยท DOI 10.48550/arXiv.2605.25916

Masalah inti

Federated edge learning (FEEL) telah muncul sebagai paradigma yang menjanjikan untuk mewujudkan edge intelligence (EI) dengan memungkinkan pelatihan model secara kolaboratif di seluruh perangkat edge sekaligus melindungi privasi data. Namun, pendekatan yang ada sering memperlakukan pelatihan dan inferensi sebagai proses terpisah, sehingga mengabaikan keterkaitan erat di antara keduanya dalam lingkungan edge dunia nyata. Makalah ini mengatasi kesenjangan tersebut dengan mengusulkan kerangka kerja optimasi daring yang mengelola pelatihan federasi dan inferensi secara bersama pada perangkat edge dengan sumber daya terbatas. Penulis memperkenalkan mekanisme konversi terinspirasi antrean tandem yang menjembatani permintaan inferensi dan data pelatihan, serta memasukkan kebaruan data dan model ke dalam formulasi akurasi untuk menangkap dinamika temporal. Tujuannya adalah memaksimalkan akurasi inferensi sekaligus meminimalkan latensi dan konsumsi energi, yang dirumuskan sebagai masalah optimasi multi-tujuan yang bersifat NP-hard dan semakin rumit karena pengaturan daring.

Inovasi

Eksperimen ekstensif menunjukkan bahwa C-MOPPO mencapai trade-off yang seimbang di antara tujuan-tujuan dan secara signifikan mengungguli baseline pada berbagai konfigurasi sistem. Penulis mengevaluasi C-MOPPO terhadap beberapa tolok ukur, termasuk alokasi acak, heuristik greedy, dan metode DRL satu tujuan. Temuan utama meliputi: (1) C-MOPPO mencapai akurasi inferensi hingga 23% lebih tinggi dibandingkan baseline terbaik sekaligus mengurangi latensi sebesar 18% dan konsumsi energi sebesar 15%; (2) constrained policy optimization memperkaya Pareto front, menyediakan himpunan solusi non-dominan yang lebih padat; (3) mekanisme antrean tandem secara efektif beradaptasi terhadap pola permintaan inferensi yang dinamis, mempertahankan akurasi tinggi bahkan pada beban kerja yang melonjak. Eksperimen mempertimbangkan jumlah perangkat edge yang bervariasi (10โ€“50), distribusi data yang berbeda (IID dan non-IID), serta berbagai kendala sumber daya. Hasilnya secara konsisten menunjukkan bahwa C-MOPPO berskala baik dan mempertahankan kinerja yang tangguh di seluruh pengaturan tersebut.
Federated edge learning (FEEL) telah muncul sebagai paradigma yang menjanjikan untuk mewujudkan edge intelligence (EI) dengan memungkinkan pelatihan model secara kolaboratif di seluruh perangkat edge sekaligus melindungi privasi data. Namun, pendekatan yang ada sering memperlakukan pelatihan dan inferensi sebagai proses terpisah, sehingga mengabaikan keterkaitan erat di antara keduanya dalam lingkungan edge dunia nyata. Makalah ini mengatasi kesenjangan tersebut dengan mengusulkan kerangka kerja optimasi daring yang mengelola pelatihan federasi dan inferensi secara bersama pada perangkat edge dengan sumber daya terbatas. Penulis memperkenalkan mekanisme konversi terinspirasi antrean tandem yang menjembatani permintaan inferensi dan data pelatihan, serta memasukkan kebaruan data dan model ke dalam formulasi akurasi untuk menangkap dinamika temporal. Tujuannya adalah memaksimalkan akurasi inferensi sekaligus meminimalkan latensi dan konsumsi energi, yang dirumuskan sebagai masalah optimasi multi-tujuan yang bersifat NP-hard dan semakin rumit karena pengaturan daring.

Untuk mengatasi masalah optimasi bersama tersebut, penulis mengubahnya menjadi multi-objective Markov decision process (MOMDP) dan mengembangkan algoritma constrained multi-objective proximal policy optimization (C-MOPPO). MOMDP didefinisikan oleh tuple

, dengan ruang keadaan
mencakup keadaan perangkat, tumpukan antrean, dan kebaruan model/data; ruang aksi
mencakup pemilihan mode (pelatihan vs. inferensi), alokasi sumber daya komunikasi dan komputasi; vektor imbalan
menangkap ketiga tujuan; dan adalah faktor diskon. C-MOPPO pertama-tama mempelajari sekumpulan kebijakan dengan preferensi berbeda di antara ketiga tujuan, lalu memanfaatkan constrained policy optimization untuk memperkaya Pareto front dan memperoleh solusi berkualitas tinggi yang padat. Algoritma ini memperbarui parameter kebijakan secara iteratif dengan menyelesaikan:

Mengapa penting

Kontribusi utama makalah ini terletak pada optimasi bersama pelatihan dan inferensi dalam FEEL, yang merupakan masalah baru dan praktis. Mekanisme konversi terinspirasi antrean tandem adalah inovasi kunci yang menjembatani kedua proses, dan dimasukkannya kebaruan data dan model ke dalam formulasi akurasi menangkap dinamika temporal yang penting untuk penerapan di dunia nyata. Algoritma C-MOPPO secara efektif mengatasi masalah optimasi multi-tujuan NP-hard dalam pengaturan daring dengan menggabungkan DRL multi-tujuan dan constrained policy optimization. Namun, penulis mengakui adanya batasan: kerangka kerja saat ini mengasumsikan himpunan perangkat edge yang statis dan tidak mempertimbangkan mobilitas atau pergantian perangkat. Pekerjaan selanjutnya dapat memperluas pendekatan ini untuk menangani partisipasi perangkat yang dinamis dan arsitektur model yang heterogen. Selain itu, overhead komunikasi untuk pertukaran pembaruan model dan preferensi dapat dioptimalkan lebih lanjut. Secara keseluruhan, karya ini memberikan fondasi yang kuat untuk optimasi bersama dalam federated edge learning dan menunjukkan potensi DRL multi-tujuan terbatas dalam aplikasi edge intelligence.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ