Mark Russinovich; Blake Bullwinkel; Giorgio Severi; Cristian Ovadiuc; Ahmed Salem
Ringkasan
Model yang lebih lemah dan tak selaras dapat menguraikan tugas berbahaya menjadi submasalah yang tampak jinak, mengonsultasikan masing-masing secara independen kepada model yang lebih kuat dan selaras, lalu menggabungkan kembali jawabannya…
Metode
Desain eksperimen memisahkan peran menjadi **orkestrator** (model lokal yang lebih lemah dan tak selaras) dan **konsultan** (model terdepan yang lebih kuat dan selaras). Orkestrat…
Hasil
Pada **CyBench**, Gemma-4-31B memulihkan 8/14 kandidat dengan GPT-5.5 sebagai konsultan dan 7/9 dengan Opus, dibandingkan hanya 2/21 dan 4/15 untuk orkestrator Gemma-4-12B yang lebih lemah. Ini menun…
Makalah ini mengevaluasi arsitektur izin tiga sumber yang menghilangkan paparan kredensial tetap untuk agen AI dengan membatasi akses per tugas. Encoder RoBERTa-large yang di-fine-tune menyamai few-shot Claude Haiku 4.5 pada kualitas klasi…
Metode
Evaluasi ini mengimplementasikan security gate sebagai encoder **RoBERTa-large** yang di-fine-tune dan dilatih pada dataset berlabel 600 prompt yang dirilis oleh Noyan (2026). Gat…
Hasil
Encoder RoBERTa-large yang di-fine-tune menyamai few-shot trained Claude Haiku 4.5 pada kualitas klasifikasi di seluruh metrik yang dilaporkan: | Metrik | RoBERTa-large (fine-tuned) | Claude Haiku 4.…
Studi empiris ini menganalisis perangkat lunak sumber terbuka pada sistem satelit onboard di 126 repositori, menghasilkan 2.827 temuan keamanan. Masalah tingkat sedang mencakup 49% temuan, dan 72% berada pada tingkat sedang atau lebih ting…
Metode
Para penulis menganalisis 126 repositori publik menggunakan pipeline bertahap yang menggabungkan beberapa teknik analisis keamanan. Pipeline ini mengintegrasikan: - **Pembuatan So…
Hasil
Analisis menghasilkan 2.827 temuan, mengungkap bahwa masalah keamanan tersebar luas tetapi tidak merata. Hasil kuantitatif utama meliputi: - **Distribusi keparahan:** Temuan tingkat sedang mencakup 4…
Deskripsi pekerja pihak ketiga di sistem multi-agen terpusat berbasis LLM dipercaya oleh perencana tetapi ditulis di luar sistem, sehingga menciptakan kanal injeksi pada waktu registrasi yang dapat menurunkan keberhasilan tugas dari 84,31%…
Metode
Penulis membangun **delapan strategi serangan manipulasi deskripsi** yang menyasar tiga perilaku perencana: penguraian tugas, pembumian kapabilitas, dan spesifikasi subtugas. Seti…
Hasil
Pada kasus paling parah, **satu deskripsi yang dimanipulasi** menurunkan keberhasilan tugas dari **84,31% menjadi 37,25%**, atau meningkatkan konsumsi token atau waktu eksekusi **lebih dari 111%**, s…
Stevanovic dan Wachter menyajikan pipeline semi-otomatis yang mengurai temuan Trivy, Semgrep, dan Nmap menjadi predikat MulVAL dan menggunakan proses berbantuan LLM untuk membangun aturan Datalog spesifik domain, sehingga memungkinkan pemb…
Metode
Pipeline yang diusulkan terdiri dari tiga tahap utama: (1) mengurai temuan dari Trivy, Semgrep, dan Nmap menjadi predikat MulVAL; (2) menggunakan proses berbantuan LLM untuk memba…
Hasil
Setiap tugas menghasilkan setidaknya satu graph yang mencapai tujuan. Pipeline ini mencapai cakupan kerentanan ground-truth rata-rata 53,7%, dengan 51,9% tugas mencapai cakupan penuh. Tingkat jalur n…
I. Petkovska; O. Alus; Lee Rodriguez; M. El Homsi; J. G. Golia Pernicka; Maria Clara Fernandes; Jun-Ting Zheng; M. Capa…
Ringkasan
Jaringan neural denoising mempercepat pencitraan diffusion-weighted (DWI) pada restaging kanker rektum setelah terapi neoadjuvan total, memangkas waktu pemindaian sekaligus mempertahankan kualitas gambar dan akurasi diagnostik. Studi ini m…
Metode
Studi retrospektif satu pusat ini melibatkan pasien kanker rektum lokal lanjut yang menjalani MRI rektum restaging antara 30 Desember 2021 dan 1 Juni 2022 setelah TNT. Convolution…
Hasil
Sebanyak 46 pasien (usia median 60 tahun [IQR: 47–72]; 37 pria dan 9 wanita) diikutsertakan. Gambar dengan percepatan 8 dan 16 kali, setelah denoising, mempertahankan atau menunjukkan visibilitas les…
Makalah posisi ini berargumen bahwa tantangan utama dalam rekayasa privasi GenAI adalah jembatan yang hilang antara pengetahuan ancaman dan teknik mitigasi, bukan kekurangan salah satunya. Makalah ini menguraikan kesenjangan tersebut menja…
Metode
Sebagai makalah posisi, karya ini tidak mengikuti metodologi empiris tradisional. Sebaliknya, karya ini menyintesis pengetahuan yang ada dari pemodelan ancaman privasi dan penelit…
Hasil
Makalah ini mengidentifikasi tiga sub-masalah yang membentuk kesenjangan antara ancaman privasi GenAI dan mitigasi: 1. **Kurangnya pemetaan ancaman-ke-mitigasi yang terperinci untuk sistem GenAI**: M…
RIBA, serangan adversarial black-box yang terinspirasi reinforcement learning, menurunkan median query hingga 25,4% dibandingkan metode state-of-the-art pada CIFAR-10 dan ImageNet, serta menyamai performa white-box pada model yang dilatih …
Metode
RIBA merumuskan pembangkitan perturbasi adversarial sebagai masalah reinforcement learning. Penyerang berinteraksi dengan model target sebagai lingkungan, menerima reward berdasar…
Hasil
Penulis mengevaluasi RIBA terhadap serangan black-box state-of-the-art pada dataset CIFAR-10 dan ImageNet menggunakan model ResNet-18 dan ViT-B/16. Pada CIFAR-10 dengan ResNet-18, RIBA memerlukan 25,…
Jaringan saraf graf atas graf alur kontrol dievaluasi dengan pemisahan temporal yang ketat, menunjukkan bahwa pilihan operator message-passing secara signifikan memengaruhi ketahanan terhadap pergeseran distribusi dan bahwa operator paling…
Metode
Penelitian ini menggunakan pemisahan temporal yang ketat untuk mengevaluasi arsitektur GNN untuk deteksi malware. CFG diekstraksi secara statis dari Windows portable executable, d…
Hasil
Pilihan operator message-passing secara signifikan mengubah ketahanan terhadap pergeseran temporal. Setiap selisih berpasangan yang bertahan setelah koreksi memisahkan arsitektur agregasi dari arsite…
Makalah ini menetapkan dua batas bawah: biaya shared randomness untuk conditional disclosure of secrets (CDS) yang robust setidaknya adalah logaritma dari kompleksitas komunikasi SMP deterministik, dan biaya entanglement untuk f-routing ya…
Metode
Penulis menggunakan dua teknik yang berbeda. Untuk CDS yang robust, mereka menunjukkan bahwa biaya shared randomness dibatasi bawah oleh logaritma dari kompleksitas komunikasi SMP…
Hasil
Makalah ini menyajikan dua hasil utama. Pertama, untuk CDS yang robust, biaya shared randomness dibatasi bawah oleh logaritma dari kompleksitas komunikasi SMP deterministik. Secara formal, untuk seti…