Editorial Ilmu Komputer & AI
Open AccessOA2026
Routing Multipath per Hop Adaptif Lalu Lintas pada Jaringan UAV Multi-Hop
Formulasi Dec-POMDP dan solusi pembelajaran penguatan multi-agen MAPPO-DM untuk pengiriman paket tepat waktu pada jaringan MEC yang direlai UAV
Zhenyu Zhao; Tiankui Zhang; Xiaoxia Xu; Yuanpeng Zheng; Junjie Li; Wenjuan Xingยท 2026ยท DOI 10.48550/arXiv.2608.25383
Masalah inti
Pada jaringan mobile edge computing (MEC) yang direlai uncrewed aerial vehicle (UAV), tugas komputasi menghasilkan lalu lintas dengan kebutuhan latensi dan ukuran data yang beragam. Keputusan routing karena itu perlu beradaptasi dengan karakteristik lalu lintas sekaligus kondisi jaringan yang berubah. Dibandingkan routing jalur tunggal, routing multipath lebih cocok untuk lalu lintas heterogen semacam ini karena menyediakan beberapa opsi penerusan dan memungkinkan pemecahan lalu lintas yang fleksibel. Namun, routing multipath konvensional biasanya memecah lalu lintas pada jalur end-to-end yang telah ditentukan, sehingga sulit merespons fluktuasi tautan dan perubahan topologi di jaringan UAV dengan cepat. Untuk mengatasi masalah ini, penulis mengusulkan metode routing multipath per hop adaptif lalu lintas untuk jaringan UAV multi-hop, di mana setiap UAV secara dinamis mendistribusikan lalu lintas di antara beberapa kandidat hop berikutnya. Masalah routing dirumuskan untuk meningkatkan rasio pengiriman paket tepat waktu sekaligus menurunkan rasio kehilangan paket, dan dimodelkan sebagai decentralized partially observable Markov decision process (Dec-POMDP).
Inovasi
Hasil simulasi menunjukkan bahwa MAPPO-DM mengungguli metode baseline dan mempertahankan kinerja yang tangguh pada berbagai kondisi jaringan. Evaluasi berfokus pada dua metrik utama: rasio pengiriman paket tepat waktu dan rasio kehilangan paket. Pada skenario yang diuji, MAPPO-DM mencapai pengiriman tepat waktu yang lebih tinggi dan kehilangan paket yang lebih rendah dibandingkan baseline. Ketangguhan pendekatan ini ditunjukkan oleh kinerja yang konsisten pada berbagai kondisi jaringan, yang mengindikasikan bahwa strategi pemecahan per hop yang adaptif lalu lintas dapat digeneralisasi di luar satu titik operasi. Abstrak tidak melaporkan nilai numerik spesifik untuk peningkatan tersebut; sumber hanya menyatakan bahwa MAPPO-DM mengungguli baseline dan tetap tangguh pada berbagai kondisi.
Pada jaringan mobile edge computing (MEC) yang direlai uncrewed aerial vehicle (UAV), tugas komputasi menghasilkan lalu lintas dengan kebutuhan latensi dan ukuran data yang beragam. Keputusan routing karena itu perlu beradaptasi dengan karakteristik lalu lintas sekaligus kondisi jaringan yang berubah. Dibandingkan routing jalur tunggal, routing multipath lebih cocok untuk lalu lintas heterogen semacam ini karena menyediakan beberapa opsi penerusan dan memungkinkan pemecahan lalu lintas yang fleksibel. Namun, routing multipath konvensional biasanya memecah lalu lintas pada jalur end-to-end yang telah ditentukan, sehingga sulit merespons fluktuasi tautan dan perubahan topologi di jaringan UAV dengan cepat. Untuk mengatasi masalah ini, penulis mengusulkan metode routing multipath per hop adaptif lalu lintas untuk jaringan UAV multi-hop, di mana setiap UAV secara dinamis mendistribusikan lalu lintas di antara beberapa kandidat hop berikutnya. Masalah routing dirumuskan untuk meningkatkan rasio pengiriman paket tepat waktu sekaligus menurunkan rasio kehilangan paket, dan dimodelkan sebagai decentralized partially observable Markov decision process (Dec-POMDP).
Masalah routing dibentuk sebagai Dec-POMDP, yang menangkap sifat terdesentralisasi dari keputusan penerusan per hop di bawah observabilitas parsial atas keadaan jaringan. Untuk menyelesaikannya, penulis mengembangkan algoritma pembelajaran penguatan multi-agen (MARL) yang disebut Multi-Agent Proximal Policy Optimization with Dirichlet Modeling (MAPPO-DM). MAPPO-DM mengikuti kerangka centralized-training-and-decentralized-execution (CTDE): selama pelatihan, kritik terpusat dapat mengakses informasi global, sedangkan selama eksekusi setiap UAV bertindak hanya berdasarkan observasi lokalnya. Aksi pemecahan lalu lintas kontinu dimodelkan menggunakan distribusi Dirichlet, yang secara alami merepresentasikan simpleks probabilitas atas kandidat hop berikutnya. Hal ini memungkinkan setiap UAV mengalokasikan sebagian lalu lintas ke beberapa hop berikutnya dalam satu langkah keputusan, bukan memilih satu jalur tunggal.
Mengapa penting
Wawasan kunci dari karya ini adalah bahwa pergeseran dari pemilihan jalur end-to-end ke pemecahan lalu lintas per hop memungkinkan adaptasi yang lebih cepat terhadap fluktuasi tautan dan perubahan topologi di jaringan UAV multi-hop. Dengan memodelkan aksi pemecahan kontinu menggunakan distribusi Dirichlet, MAPPO-DM menghindari ruang aksi kombinatorial yang akan muncul dari enumerasi kombinasi jalur diskret, sekaligus tetap memungkinkan alokasi fleksibel di antara beberapa kandidat hop berikutnya. Formulasi Dec-POMDP selaras dengan kendala praktis bahwa setiap UAV hanya memiliki observabilitas parsial atas jaringan, dan kerangka CTDE memungkinkan pelatihan yang stabil tanpa memerlukan eksekusi terpusat. Ketangguhan yang dilaporkan pada berbagai kondisi jaringan menunjukkan bahwa kebijakan yang dipelajari tidak overfit terhadap topologi atau pola lalu lintas tertentu. Namun, sumber tidak menyediakan studi ablasi terperinci, analisis konvergensi, atau perbandingan terhadap berbagai baseline MARL dalam abstrak; detail tersebut diperlukan untuk menilai sepenuhnya keunggulan metode ini. Secara keseluruhan, pendekatan ini menawarkan arah yang menjanjikan untuk routing adaptif lalu lintas di jaringan MEC yang direlai UAV, di mana kebutuhan latensi heterogen dan topologi dinamis adalah hal yang lazim.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ