Editorial Ilmu Komputer & AI
Berbagi Fabric dengan Komunikasi Kolektif: Dua Penalti Penyimpanan dalam Pelatihan Deep Learning
Masalah inti
Inovasi
Eksperimen mengungkap dua penalti penyimpanan yang berbeda. Pertama, stall DataLoader berekor berat: waktu tunggu DataLoader yang tipikal hanya 15 ms pada kondisi steady state, namun melonjak hingga beberapa detik pada 28% iterasi Lustre dan 12% iterasi VAST. Perilaku berekor berat ini menyebabkan straggler signifikan dalam loop pelatihan. Kedua, kontensi traffic-class pada komunikasi kolektif: dalam benchmark terisolasi, I/O Lustre menstall all-reduce hingga 145x. Kontensi ini hanya terjadi ketika penyimpanan dan komunikasi kolektif berbagi traffic class yang sama. Kedua biaya ini muncul dari mekanisme yang berbeda: latensi stall I/O memengaruhi setiap jalur penyimpanan yang melintasi fabric bersama, sedangkan kontensi jaringan all-reduce hanya terjadi ketika penyimpanan dan komunikasi kolektif berbagi traffic class yang sama.
DYAD menghilangkan kedua efek tersebut dengan menjaga I/O penyimpanan keluar dari fabric bersama. Sepanjang satu epoch pelatihan penuh, DYAD mencapai percepatan 7,4x dibandingkan pembacaan Lustre langsung dan percepatan 1,06x dibandingkan VAST. Pada epoch kedua, setelah cache lokal sepenuhnya panas, stall DataLoader dihilangkan sepenuhnya, sehingga DYAD men
Mengapa penting
Temuan ini menyoroti ketegangan mendasar dalam desain sistem HPC: berbagi fabric jaringan antara komunikasi kolektif dan I/O penyimpanan dapat menyebabkan penalti kinerja yang parah untuk pelatihan DL. Kedua penalti—stall DataLoader berekor berat dan kontensi traffic-class—memiliki mekanisme berbeda tetapi akar penyebab yang sama: I/O penyimpanan yang melintasi fabric bersama. Hal ini menunjukkan bahwa mengisolasi lalu lintas penyimpanan dari komunikasi kolektif adalah kunci untuk mencapai pelatihan yang dapat diprediksi dan berkinerja tinggi.
Pendekatan DYAD berupa staging NVMe node-local secara efektif memisahkan I/O penyimpanan dari fabric bersama. Dengan menyimpan data di NVMe lokal, DYAD tidak hanya mengurangi latensi tetapi juga menghilangkan variabilitas yang menyebabkan stall berekor berat. Percepatan 7,4x dibandingkan Lustre dan 1,31x dibandingkan VAST (setelah pemanasan cache) menunjukkan potensi pendekatan ini. Namun, efektivitas DYAD bergantung pada ketersediaan NVMe node-local dan kapasitas cache yang cukup untuk menampung working set. Untuk beban kerja dengan dataset yang sangat besar yang melebihi kapasitas cache lokal, manfaatnya dapat berkurang.
Kandidat taksonomi makalah ini meliputi Architecture, Cybersecurity, Network, dan Cryptography. Meskipun pekerjaan ini terutama tentang arsitektur jaringan dan sistem penyimpanan, pekerjaan ini juga memiliki implikasi untuk keamanan siber (misalnya isolasi lalu lintas) dan kriptografi (misalnya komunikasi kolektif yang aman). Pekerjaan selanjutnya dapat mengeksplorasi penetapan traffic-class adaptif, manajemen cache dinamis, dan integrasi dengan solusi staging lainnya.
Sebagai kesimpulan, makalah ini memberikan demonstrasi yang jelas tentang biaya berbagi fabric dan solusi praktis melalui DYAD. Kode tersedia untuk publik di https://github.com/flux-framework/dyad, memungkinkan reproduksibilitas dan penelitian lebih lanjut.
Siapa yang sebaiknya membaca
Membuka konten member…