Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Berbagi Fabric dengan Komunikasi Kolektif: Dua Penalti Penyimpanan dalam Pelatihan Deep Learning

Bagaimana fabric jaringan bersama antara kolektif NCCL/RCCL dan I/O filesystem paralel menimbulkan stall DataLoader berekor berat dan kontensi traffic-class, serta bagaimana staging NVMe node-local melalui DYAD menghilangkan keduanya.
Chen Wang; Wenzhao Wu; Hyojin Kim; Jae-Sung Yeom· 2026· DOI 10.48550/arXiv.2609.06506

Masalah inti

Pelatihan deep learning (DL) terdistribusi pada sistem high-performance computing (HPC) semakin bergantung pada satu fabric jaringan untuk membawa komunikasi kolektif (misalnya all-reduce NCCL/RCCL) sekaligus I/O filesystem paralel (misalnya Lustre, VAST). Konvergensi arsitektur ini efisien dari sisi pengkabelan dan pemanfaatan port switch, tetapi menimbulkan kontensi yang dapat menurunkan throughput pelatihan. Penulis mempelajari beban kerja pelatihan Graph Neural Network (GNN) nyata pada sistem Slingshot-11 untuk mengukur biaya berbagi ini. Mereka mengidentifikasi dua penalti yang berbeda: (1) stall DataLoader berekor berat yang disebabkan oleh I/O penyimpanan yang melintasi fabric bersama, dan (2) kontensi traffic-class pada komunikasi kolektif ketika penyimpanan dan kolektif berbagi traffic class yang sama. Klaim utama makalah ini adalah kedua penalti memiliki akar penyebab yang sama—I/O penyimpanan yang melintasi fabric bersama—dan staging NVMe node-local melalui DYAD (proyek Flux Framework) menghilangkan keduanya dengan menjaga I/O penyimpanan keluar dari jalur tersebut. Pekerjaan ini dilatarbelakangi oleh pengamatan bahwa waktu tunggu DataLoader yang tipikal kecil (15 ms pad

Inovasi

Eksperimen mengungkap dua penalti penyimpanan yang berbeda. Pertama, stall DataLoader berekor berat: waktu tunggu DataLoader yang tipikal hanya 15 ms pada kondisi steady state, namun melonjak hingga beberapa detik pada 28% iterasi Lustre dan 12% iterasi VAST. Perilaku berekor berat ini menyebabkan straggler signifikan dalam loop pelatihan. Kedua, kontensi traffic-class pada komunikasi kolektif: dalam benchmark terisolasi, I/O Lustre menstall all-reduce hingga 145x. Kontensi ini hanya terjadi ketika penyimpanan dan komunikasi kolektif berbagi traffic class yang sama. Kedua biaya ini muncul dari mekanisme yang berbeda: latensi stall I/O memengaruhi setiap jalur penyimpanan yang melintasi fabric bersama, sedangkan kontensi jaringan all-reduce hanya terjadi ketika penyimpanan dan komunikasi kolektif berbagi traffic class yang sama.

DYAD menghilangkan kedua efek tersebut dengan menjaga I/O penyimpanan keluar dari fabric bersama. Sepanjang satu epoch pelatihan penuh, DYAD mencapai percepatan 7,4x dibandingkan pembacaan Lustre langsung dan percepatan 1,06x dibandingkan VAST. Pada epoch kedua, setelah cache lokal sepenuhnya panas, stall DataLoader dihilangkan sepenuhnya, sehingga DYAD men

Pelatihan deep learning (DL) terdistribusi pada sistem high-performance computing (HPC) semakin bergantung pada satu fabric jaringan untuk membawa komunikasi kolektif (misalnya all-reduce NCCL/RCCL) sekaligus I/O filesystem paralel (misalnya Lustre, VAST). Konvergensi arsitektur ini efisien dari sisi pengkabelan dan pemanfaatan port switch, tetapi menimbulkan kontensi yang dapat menurunkan throughput pelatihan. Penulis mempelajari beban kerja pelatihan Graph Neural Network (GNN) nyata pada sistem Slingshot-11 untuk mengukur biaya berbagi ini. Mereka mengidentifikasi dua penalti yang berbeda: (1) stall DataLoader berekor berat yang disebabkan oleh I/O penyimpanan yang melintasi fabric bersama, dan (2) kontensi traffic-class pada komunikasi kolektif ketika penyimpanan dan kolektif berbagi traffic class yang sama. Klaim utama makalah ini adalah kedua penalti memiliki akar penyebab yang sama—I/O penyimpanan yang melintasi fabric bersama—dan staging NVMe node-local melalui DYAD (proyek Flux Framework) menghilangkan keduanya dengan menjaga I/O penyimpanan keluar dari jalur tersebut. Pekerjaan ini dilatarbelakangi oleh pengamatan bahwa waktu tunggu DataLoader yang tipikal kecil (15 ms pada kondisi steady state) tetapi melonjak hingga beberapa detik pada sebagian signifikan iterasi (28% untuk Lustre, 12% untuk VAST), dan bahwa I/O Lustre dapat menstall all-reduce hingga 145x dalam benchmark terisolasi.
Penulis melakukan eksperimen pada sistem Slingshot-11 menggunakan beban kerja pelatihan GNN nyata. Mereka membandingkan tiga konfigurasi penyimpanan: pembacaan Lustre langsung, pembacaan VAST langsung, dan staging NVMe node-local berbasis DYAD. DYAD adalah pustaka staging yang sadar data yang mencegat I/O penyimpanan dan menyimpan data di NVMe node-local, sehingga menghindari fabric bersama untuk lalu lintas penyimpanan. Metodologi mencakup:

Mengapa penting

Temuan ini menyoroti ketegangan mendasar dalam desain sistem HPC: berbagi fabric jaringan antara komunikasi kolektif dan I/O penyimpanan dapat menyebabkan penalti kinerja yang parah untuk pelatihan DL. Kedua penalti—stall DataLoader berekor berat dan kontensi traffic-class—memiliki mekanisme berbeda tetapi akar penyebab yang sama: I/O penyimpanan yang melintasi fabric bersama. Hal ini menunjukkan bahwa mengisolasi lalu lintas penyimpanan dari komunikasi kolektif adalah kunci untuk mencapai pelatihan yang dapat diprediksi dan berkinerja tinggi.

Pendekatan DYAD berupa staging NVMe node-local secara efektif memisahkan I/O penyimpanan dari fabric bersama. Dengan menyimpan data di NVMe lokal, DYAD tidak hanya mengurangi latensi tetapi juga menghilangkan variabilitas yang menyebabkan stall berekor berat. Percepatan 7,4x dibandingkan Lustre dan 1,31x dibandingkan VAST (setelah pemanasan cache) menunjukkan potensi pendekatan ini. Namun, efektivitas DYAD bergantung pada ketersediaan NVMe node-local dan kapasitas cache yang cukup untuk menampung working set. Untuk beban kerja dengan dataset yang sangat besar yang melebihi kapasitas cache lokal, manfaatnya dapat berkurang.

Kandidat taksonomi makalah ini meliputi Architecture, Cybersecurity, Network, dan Cryptography. Meskipun pekerjaan ini terutama tentang arsitektur jaringan dan sistem penyimpanan, pekerjaan ini juga memiliki implikasi untuk keamanan siber (misalnya isolasi lalu lintas) dan kriptografi (misalnya komunikasi kolektif yang aman). Pekerjaan selanjutnya dapat mengeksplorasi penetapan traffic-class adaptif, manajemen cache dinamis, dan integrasi dengan solusi staging lainnya.

Sebagai kesimpulan, makalah ini memberikan demonstrasi yang jelas tentang biaya berbagi fabric dan solusi praktis melalui DYAD. Kode tersedia untuk publik di https://github.com/flux-framework/dyad, memungkinkan reproduksibilitas dan penelitian lebih lanjut.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…