Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Penarikan Image Paralel dengan Memori Terbatas untuk Image Kontainer Berukuran Besar

Disk-Backed Parallel Pull (DBPP) menghilangkan hambatan penyusunan ulang di memori pada containerd 2.2, memungkinkan penarikan image AI/ML 48,5 GiB tanpa OOM dengan memori daemon puncak 8,7โ€“25,3ร— lebih rendah.
Sri Saran Balaji Vellore Rajakumar; Henry Wang; Ankur Singh; James Thompsonยท 2026ยท DOI 10.48550/arXiv.2607.05596

Masalah inti

Beban kerja AI/ML semakin banyak dijalankan sebagai kontainer, di mana image kontainer harus diunduh ke host sebelum beban kerja dapat dimulai. Penarikan image dingin ini berada di jalur kritis setiap kali pekerjaan pelatihan atau inferensi diperbesar atau host diperbarui, dan untuk beban kerja GPU hal ini telah menjadi komponen dominan waktu startup karena image AI/ML mencapai 31โ€“48 GiB terkompresi. Runtime kontainer hulu, containerd 2.2, memecah layer menjadi potongan-potongan yang diambil secara bersamaan melalui HTTP range request, tetapi potongan yang tiba di luar urutan menumpuk di heap runtime sampai konsumen sekuensial mengurasnya secara berurutan. Tumpukan ini tumbuh seiring ukuran image, dan pada node GPU di mana memori host dibagi dengan framework dan bobot model, hal ini menyebabkan penghentian out-of-memory (OOM) pada runtime itu sendiri. Penulis menyajikan Disk-Backed Parallel Pull (DBPP), alternatif untuk penyusunan ulang berurutan di memori yang digunakan containerd 2.2. DBPP menulis setiap potongan langsung ke offset byte targetnya di disk, menghilangkan ketergantungan urutan dan membatasi memori terlepas dari ukuran image. Karena setiap layer mendarat di disk seba

Inovasi

Dalam eksperimen terkendali pada lima image skala produksi (hingga 48,5 GiB), DBPP mengurangi memori daemon puncak sebesar 8,7โ€“25,3ร— sambil mempertahankan throughput penarikan yang sebanding. Pada node dengan memori terbatas, containerd 2.2 di-OOM-kill saat menarik image 31,4 GiB sementara DBPP menyelesaikan penarikan yang sama. Faktor pengurangan memori berkisar dari 8,7ร— hingga 25,3ร—, bergantung pada ukuran image dan pola kedatangan potongan. Throughput tetap sebanding, artinya pendekatan berbasis disk tidak menimbulkan penalti kinerja yang signifikan. Skenario OOM-kill sangat mencolok: containerd 2.2 gagal sepenuhnya pada image 31,4 GiB di bawah batasan memori, sementara DBPP berhasil. Ini menunjukkan bahwa DBPP tidak hanya mengurangi memori tetapi juga memungkinkan penarikan yang jika tidak demikian mustahil pada node dengan memori terbatas. Eksperimen mencakup image hingga 48,5 GiB, yang representatif untuk image AI/ML berukuran besar. Memori daemon puncak diukur sebagai maximum resident set size daemon containerd selama penarikan. Throughput diukur sebagai waktu untuk menyelesaikan penarikan, dinormalisasi berdasarkan ukuran image. Hasilnya menunjukkan bahwa DBPP mencapai pen
Beban kerja AI/ML semakin banyak dijalankan sebagai kontainer, di mana image kontainer harus diunduh ke host sebelum beban kerja dapat dimulai. Penarikan image dingin ini berada di jalur kritis setiap kali pekerjaan pelatihan atau inferensi diperbesar atau host diperbarui, dan untuk beban kerja GPU hal ini telah menjadi komponen dominan waktu startup karena image AI/ML mencapai 31โ€“48 GiB terkompresi. Runtime kontainer hulu, containerd 2.2, memecah layer menjadi potongan-potongan yang diambil secara bersamaan melalui HTTP range request, tetapi potongan yang tiba di luar urutan menumpuk di heap runtime sampai konsumen sekuensial mengurasnya secara berurutan. Tumpukan ini tumbuh seiring ukuran image, dan pada node GPU di mana memori host dibagi dengan framework dan bobot model, hal ini menyebabkan penghentian out-of-memory (OOM) pada runtime itu sendiri. Penulis menyajikan Disk-Backed Parallel Pull (DBPP), alternatif untuk penyusunan ulang berurutan di memori yang digunakan containerd 2.2. DBPP menulis setiap potongan langsung ke offset byte targetnya di disk, menghilangkan ketergantungan urutan dan membatasi memori terlepas dari ukuran image. Karena setiap layer mendarat di disk sebagai file lengkap yang dapat di-seek, DBPP menjalankan verifikasi digest SHA-256 dan dekompresi secara bersamaan, dua lintasan yang harus dijalankan containerd satu demi satu. Gagasan dasarnya melampaui image kontainer: pipeline apa pun yang menyangga data di memori hanya untuk menegakkan urutan dapat memindahkan penyangga itu ke disk begitu penyimpanan pendukungnya cukup cepat, menukar sumber daya yang langka dan diperebutkan dengan sumber daya yang melimpah.
Pergeseran metodologis inti dalam DBPP adalah penggantian penyusunan ulang berurutan di memori dengan penulisan posisional langsung ke disk. Pada containerd 2.2, setiap layer dipecah menjadi potongan-potongan yang diambil secara bersamaan melalui HTTP range request. Potongan-potongan ini tiba di luar urutan dan disangga di heap runtime sampai konsumen sekuensial dapat mengurasnya secara berurutan. Jejak memori penyangga ini sebanding dengan jumlah potongan di luar urutan yang belum selesai, yang tumbuh seiring ukuran image dan jitter jaringan. DBPP sebaliknya menulis setiap potongan langsung ke offset byte targetnya di disk, menggunakan informasi offset yang dikodekan dalam HTTP range request. Ini menghilangkan ketergantungan urutan sepenuhnya: potongan dapat ditulis saat tiba, dan file layer akhir disusun di disk tanpa penyusunan ulang di memori. Karena setiap layer mendarat di disk sebagai file lengkap yang dapat di-seek, DBPP dapat menjalankan verifikasi digest SHA-256 dan dekompresi secara bersamaan. Pada containerd 2.2, kedua lintasan ini harus dijalankan satu demi satu: pertama seluruh layer disusun ulang di memori, lalu verifikasi digest dilakukan, lalu dekompresi. DBPP menumpang-tindihkan operasi-operasi ini, mengurangi jalur kritis. Batas memori tidak bergantung pada ukuran image: satu-satunya memori yang dibutuhkan adalah penyangga tetap kecil per potongan yang sedang diproses, ditambah page cache sistem file, yang dapat direklaim. Penulis mengevaluasi DBPP pada lima image skala produksi, hingga 48,5 GiB, dalam eksperimen terkendali. Mereka mengukur memori daemon puncak dan throughput penarikan, dan mereka menguji pada node dengan memori terbatas di mana containerd 2.2 di-OOM-kill saat menarik image 31,4 GiB. Pengaturan eksperimen mencakup node GPU di mana memori host dibagi dengan framework dan bobot model, yang mewakili skenario penerapan target.

Mengapa penting

Pendekatan DBPP mengatasi ketegangan mendasar dalam pengambilan data paralel: konkurensi memperkenalkan kedatangan di luar urutan, tetapi banyak konsumen memerlukan data yang berurutan. Solusi tradisionalnya adalah menyangga data di luar urutan di memori sampai dapat disusun ulang. Penyangga ini tumbuh seiring tingkat konkurensi dan varians waktu kedatangan, dan ia mengonsumsi sumber daya yang langka: memori host. Pada node GPU, memori host dibagi dengan framework dan bobot model, sehingga sangat diperebutkan. DBPP menyelesaikan ketegangan ini dengan memindahkan penyangga penyusunan ulang ke disk. Disk adalah sumber daya yang melimpah dibandingkan memori host, dan SSD NVMe modern menyediakan throughput yang cukup untuk mengimbangi pengambilan jaringan. Wawasan kuncinya adalah begitu penyimpanan pendukung cukup cepat, penyangga dapat dipindahkan dari memori ke disk, menukar sumber daya yang langka dan diperebutkan dengan sumber daya yang melimpah. Gagasan ini melampaui image kontainer: pipeline apa pun yang menyangga data di memori hanya untuk menegakkan urutan dapat memperoleh manfaat dari pendekatan ini. Contohnya termasuk streaming video, replikasi basis data, dan sistem file terdistribusi. Verifikasi digest dan dekompresi secara bersamaan adalah optimasi lain yang dimungkinkan oleh pendekatan berbasis disk. Karena setiap layer adalah file lengkap yang dapat di-seek di disk, digest dapat dihitung dengan membaca file secara sekuensial, dan dekompresi dapat dilakukan secara streaming. Pada containerd 2.2, lintasan-lintasan ini diserialkan karena layer tidak tersedia sebagai file sampai penyusunan ulang selesai. DBPP menumpang-tindihkannya, mengurangi jalur kritis. Batas memori tidak bergantung pada ukuran image, yang berarti DBPP berskala hingga image berukuran sembarang. Satu-satunya memori yang dibutuhkan adalah penyangga tetap kecil per potongan yang sedang diproses, ditambah page cache sistem file, yang dapat direklaim di bawah tekanan memori. Ini membuat DBPP cocok untuk lingkungan dengan memori terbatas, seperti perangkat edge atau node GPU yang padat. Penulis mencatat bahwa gagasan dasarnya bersifat umum: pipeline apa pun yang menyangga data di memori hanya untuk menegakkan urutan dapat memindahkan penyangga itu ke disk begitu penyimpanan pendukungnya cukup cepat. Ini menunjukkan prinsip arsitektur yang lebih luas untuk sistem yang menangani volume data besar dengan memori terbatas.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ