Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Polars di dalam Enclave Intel SGX2: Studi Empiris Pemrosesan Kueri Analitik yang Bersifat Rahasia

Ringkasan IMRAD atas evaluasi empiris mesin DataFrame native Arrow di bawah komputasi rahasia, yang mengungkap amplifikasi jalur pemuatan dan optimasi tingkat API sebagai penentu kinerja tingkat pertama.
Wei Wang; Burns Smith; Kenny Leftin· 2026· DOI 10.48550/arXiv.2605.21797

Masalah inti

Trusted Execution Environments (TEE) telah membangkitkan kembali minat pada analitik rahasia, namun sebagian besar evaluasi sebelumnya berfokus pada mesin basis data SQL atau generasi SGX yang lebih awal. Makalah ini mempelajari mesin DataFrame native Arrow, Polars, yang berjalan di dalam enclave Intel SGX2 melalui Gramine pada TPC-H SF30 dengan Azure Blob Storage. Para penulis bertujuan memisahkan overhead komputasi dari overhead penyerapan data dengan melaporkan skor power TPC-H standar dan varian khusus kueri yang menghilangkan waktu pemuatan tabel. Studi ini mencakup empat konfigurasi lebar dataset (sekitar 22–73 GB) dan membandingkan API lazy dan eager Polars dalam pengaturan TEE yang sama. Pertanyaan penelitian utamanya adalah apakah SGX2 dapat mendukung pemrosesan analitik native Arrow dengan orde overhead keamanan yang serupa seperti yang diamati pada studi mesin SQL terkini, dan faktor apa yang mendominasi kinerja end-to-end.

Inovasi

Di empat konfigurasi lebar dataset (sekitar 22–73 GB), overhead end-to-end tetap hampir konstan pada 1,49–1,56×. Namun, metrik komposit ini menyembunyikan dua perilaku yang berbeda: overhead khusus kueri menurun dari 1,51–1,52× menjadi 1,43–1,44×, sedangkan overhead pemuatan tabel naik dari 2,27× menjadi 4,07×. Untuk konfigurasi len130, median perlambatan SGX per kueri adalah 1,45× dengan maksimum 2,57×. Sejumlah kecil kueri menunjukkan lonjakan antar-eksekusi yang mencolok, konsisten dengan tekanan EPC yang bersifat stateful. Membandingkan API lazy dan eager Polars dalam pengaturan TEE yang sama, eksekusi lazy secara keseluruhan 2,25–2,27× lebih cepat, sementara eksekusi eager gagal dengan kesalahan kehabisan memori pada 41 GB dan di atasnya. Hasil-hasil ini dirangkum dalam tabel berikut:

| Konfigurasi | Overhead end-to-end | Overhead khusus kueri | Overhead pemuatan tabel |
|---------------|---------------------|---------------------|------------------------|
| ~22 GB | 1,49–1,56× | 1,51–1,52× | 2,27× |
| ~73 GB | 1,49–1,56× | 1,43–1,44× | 4,07× |

Untuk len130, perlambatan per kueri: median 1,45

Trusted Execution Environments (TEE) telah membangkitkan kembali minat pada analitik rahasia, namun sebagian besar evaluasi sebelumnya berfokus pada mesin basis data SQL atau generasi SGX yang lebih awal. Makalah ini mempelajari mesin DataFrame native Arrow, Polars, yang berjalan di dalam enclave Intel SGX2 melalui Gramine pada TPC-H SF30 dengan Azure Blob Storage. Para penulis bertujuan memisahkan overhead komputasi dari overhead penyerapan data dengan melaporkan skor power TPC-H standar dan varian khusus kueri yang menghilangkan waktu pemuatan tabel. Studi ini mencakup empat konfigurasi lebar dataset (sekitar 22–73 GB) dan membandingkan API lazy dan eager Polars dalam pengaturan TEE yang sama. Pertanyaan penelitian utamanya adalah apakah SGX2 dapat mendukung pemrosesan analitik native Arrow dengan orde overhead keamanan yang serupa seperti yang diamati pada studi mesin SQL terkini, dan faktor apa yang mendominasi kinerja end-to-end.

Pengaturan eksperimen menjalankan Polars di dalam enclave Intel SGX2 menggunakan Gramine, sebuah library OS untuk aplikasi Linux yang tidak dimodifikasi. Beban kerjanya adalah TPC-H SF30, dengan data disimpan di Azure Blob Storage. Empat konfigurasi lebar dataset diuji, berkisar dari sekitar 22 GB hingga 73 GB. Dua metrik dilaporkan: skor power TPC-H standar (end-to-end) dan varian khusus kueri yang mengecualikan waktu pemuatan tabel. Perlambatan per kueri diukur untuk konfigurasi len130. API lazy dan eager Polars dibandingkan dalam kondisi TEE yang identik. Overhead dikuantifikasi sebagai faktor perlambatan relatif terhadap eksekusi native. Untuk kueri tertentu, perlambatannya adalah

, dengan adalah waktu eksekusi. Overhead end-to-end dan overhead khusus kueri didefinisikan sebagai:

Mengapa penting

Temuan ini mengungkap bahwa SGX2 dapat mendukung pemrosesan analitik native Arrow dengan orde overhead keamanan yang serupa seperti yang dilaporkan dalam studi DuckDB-SGX2 terkini. Namun, overhead end-to-end yang konstan menyembunyikan trade-off kritis: seiring bertambahnya lebar dataset, overhead khusus kueri menurun sementara overhead pemuatan tabel lebih dari dua kali lipat. Amplifikasi jalur pemuatan ini menunjukkan bahwa penyerapan data menjadi bottleneck dominan dalam analitik rahasia, kemungkinan karena biaya enkripsi dan verifikasi integritas selama pemuatan. Variabilitas per kueri, dengan lonjakan hingga 2,57×, mengindikasikan bahwa tekanan EPC yang bersifat stateful dapat menyebabkan kinerja yang tidak dapat diprediksi, yang mungkin dapat dimitigasi dengan menyetel ukuran enclave page cache atau penjadwalan kueri. Perbedaan mencolok antara eksekusi lazy dan eager—lazy 2,25–2,27× lebih cepat dan menghindari OOM pada skala yang lebih besar—menegaskan bahwa optimasi tingkat API adalah penentu tingkat pertama kinerja end-to-end. Eksekusi lazy kemungkinan mengurangi jejak memori dengan menunda materialisasi, yang krusial dalam lingkungan enclave yang terbatas. Hasil ini menyiratkan bahwa sistem analitik rahasia di masa depan harus memprioritaskan optimasi jalur pemuatan dan mengadopsi strategi evaluasi lazy. Studi ini terbatas pada TPC-H SF30 dan Azure Blob Storage; generalisasi ke beban kerja dan backend penyimpanan lain masih perlu diuji.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…