Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Pipeline I/O-Dominan Terpisah untuk Ekstraksi Embedding Whole-Slide Image Skala Besar

Arsitektur tiga tahap yang sadar I/O dan membingkai ulang ekstraksi embedding WSI sebagai masalah sistem yang berpusat pada data
Mayanka Chandrashekar; Xi Zhang; Ethan Seefried; Tirthankar Ghosal; John Gounley; Heidi Hansonยท 2026ยท DOI 10.48550/arXiv.2608.27278

Masalah inti

Whole-slide image (WSI) menjadi inti patologi komputasional, namun skala gigapikselnya membuat inferensi model fondasi secara langsung tidak praktis. Pemrosesan berbasis patch karenanya menjadi unit komputasi yang praktis, tetapi pada skala besar pembuatan dan penanganan kumpulan patch yang masif menimbulkan overhead I/O dan orkestrasi signifikan yang sering mendominasi kinerja end-to-end. Penulis berargumen bahwa ekstraksi embedding WSI bukan beban kerja yang murni terikat komputasi; melainkan masalah sistem yang berpusat pada data di mana perpindahan data, staging, dan persistensi menjadi perhatian utama. Hal ini memotivasi pipeline terpisah yang sadar I/O yang mengisolasi perpindahan data dari komputasi, memungkinkan pengiriman patch yang efisien dan inferensi multi-node yang skalabel dengan komunikasi minimal. Sistem yang dihasilkan menghasilkan basis data vektor terdistribusi di mana embedding secara persisten digabungkan dengan metadata kaya (atribut pasien, slide, dan patch), memungkinkan penyaringan, pengambilan, dan penggunaan kembali hilir yang efisien untuk tugas seperti pengambilan, klasifikasi, dan pembelajaran few-shot, terutama di lingkungan dengan sumber daya rendah

Inovasi

Penulis menunjukkan bahwa pemisahan I/O, komputasi, dan ingest memungkinkan ekstraksi embedding WSI berthroughput tinggi pada skala besar. Dengan mencirikan amplop penskalaan, mereka menunjukkan bahwa penyimpanan mendominasi di luar konkurensi sedang. Temuan ini signifikan karena bertentangan dengan asumsi umum bahwa ekstraksi embedding terikat komputasi. Sebaliknya, hambatan bergeser ke perpindahan data dan persistensi seiring meningkatnya konkurensi. Basis data vektor terdistribusi yang dihasilkan secara persisten menggabungkan embedding dengan metadata kaya (atribut pasien, slide, dan patch), memungkinkan penyaringan, pengambilan, dan penggunaan kembali hilir yang efisien. Basis data representasi ini ringkas dan dapat digunakan kembali untuk tugas seperti pengambilan, klasifikasi, dan pembelajaran few-shot, terutama menguntungkan lingkungan dengan sumber daya rendah di mana komputasi ulang mahal. Sistem ini mencapai inferensi multi-node yang skalabel dengan komunikasi minimal, memvalidasi desain terpisah.
Whole-slide image (WSI) menjadi inti patologi komputasional, namun skala gigapikselnya membuat inferensi model fondasi secara langsung tidak praktis. Pemrosesan berbasis patch karenanya menjadi unit komputasi yang praktis, tetapi pada skala besar pembuatan dan penanganan kumpulan patch yang masif menimbulkan overhead I/O dan orkestrasi signifikan yang sering mendominasi kinerja end-to-end. Penulis berargumen bahwa ekstraksi embedding WSI bukan beban kerja yang murni terikat komputasi; melainkan masalah sistem yang berpusat pada data di mana perpindahan data, staging, dan persistensi menjadi perhatian utama. Hal ini memotivasi pipeline terpisah yang sadar I/O yang mengisolasi perpindahan data dari komputasi, memungkinkan pengiriman patch yang efisien dan inferensi multi-node yang skalabel dengan komunikasi minimal. Sistem yang dihasilkan menghasilkan basis data vektor terdistribusi di mana embedding secara persisten digabungkan dengan metadata kaya (atribut pasien, slide, dan patch), memungkinkan penyaringan, pengambilan, dan penggunaan kembali hilir yang efisien untuk tugas seperti pengambilan, klasifikasi, dan pembelajaran few-shot, terutama di lingkungan dengan sumber daya rendah.
Pipeline yang diusulkan menguraikan alur kerja menjadi tiga tahap berbeda:

Mengapa penting

Wawasan kuncinya adalah bahwa ekstraksi embedding WSI harus diperlakukan sebagai masalah sistem yang berpusat pada data daripada beban kerja yang murni terikat komputasi. Pipeline terpisah mengisolasi perpindahan data dari komputasi, memungkinkan setiap tahap dioptimalkan secara independen. Pilihan arsitektur ini memungkinkan pengiriman patch yang efisien dan inferensi multi-node yang skalabel dengan komunikasi minimal. Penggabungan persisten embedding dengan metadata dalam basis data vektor ter-shard menciptakan basis data representasi yang dapat digunakan kembali yang mendukung pengambilan, klasifikasi, dan pembelajaran few-shot tanpa komputasi ulang. Hal ini sangat berharga di lingkungan dengan sumber daya rendah di mana komputasi dan penyimpanan terbatas. Analisis penskalaan mengungkapkan bahwa penyimpanan mendominasi di luar konkurensi sedang, menunjukkan bahwa optimasi di masa depan harus berfokus pada staging yang sadar I/O, kompresi, dan strategi sharding. Karya ini juga menyoroti pentingnya overhead orkestrasi dalam pipeline skala besar. Dengan membingkai ulang masalah, penulis memberikan cetak biru untuk membangun sistem ekstraksi embedding WSI yang efisien dan skalabel yang dapat diterapkan di lingkungan terdistribusi. Kandidat taksonomi (Arsitektur, Keamanan Siber, Jaringan, Kriptografi) tidak dibahas secara langsung dalam sumber, tetapi aspek arsitektur sistem selaras dengan komputasi terdistribusi dan rekayasa data.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ