Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Delta Deception: Evaluasi Adversarial Forensik Bytecode Smart Contract Berbasis LLM

Bagaimana desain kontrak adversarial menurunkan deteksi drain LLM sebesar 20 poin persentase โ€” dan mengapa rasionalisasi, bukan kebutaan, adalah mode kegagalan yang lebih dalam
Timo Schefoldยท 2026ยท DOI 10.48550/arXiv.2609.14098

Masalah inti

Forensik smart contract semakin mengandalkan large language model untuk menginterpretasi **bytecode yang belum diverifikasi** โ€” artefak buram tingkat EVM yang tersisa ketika kode sumber tidak tersedia. Investigator, bursa, dan incident responder menggunakan model ini untuk menjawab pertanyaan berisiko tinggi: apakah kontrak ini mengandung mekanisme drain tersembunyi yang menyedot dana pengguna?

Premis makalah ini adalah bahwa model semacam itu belum pernah diuji secara sistematis terhadap kontrak yang *dirancang untuk menipu mereka*. Evaluasi sebelumnya mengukur akurasi pada kontrak alami atau benign; evaluasi tersebut tidak mengukur robustness di bawah tekanan adversarial. Penulis memperkenalkan **deception delta** sebagai kuantitas utama yang diminati: penurunan performa deteksi drain pada kontrak adversarial relatif terhadap kontrol yang matched secara fungsional.

Studi ini mengevaluasi **22 model frontier** pada **13 kontrak yang dirancang khusus** โ€” **9 vektor deception** dan **4 kontrol** โ€” di seluruh **enam strategi prompt**, menghasilkan **8.528 run non-refusal yang dapat dianalisis** terhadap kontrak dengan ground truth terverifikasi EVM. Taksonomi vektor deception melip

Inovasi

Hasil utamanya adalah **penurunan 20,0 poin persentase** dalam deteksi drain pada kontrak adversarial relatif terhadap kontrol yang matched secara fungsional, dengan **95% CI [17,2, 22,8]**. Interval ini mengecualikan nol dengan margin lebar, menunjukkan efek adversarial yang robust.

**Kamuflase struktural mendominasi.** Vektor deception yang paling efektif bersifat struktural, bukan leksikal:

- **Rantai panggilan multi-hop** mengaburkan jalur dari titik masuk ke drain.
- **Selektor bertopeng XOR** menyembunyikan semantik dispatch fungsi.
- **Parameter drain yang dimuat dari storage** menunda target dan jumlah drain ke state runtime.

Vektor-vektor ini menolak deteksi di **hampir semua model**, dan efeknya **sebagian besar tidak sensitif terhadap enam strategi prompt yang diuji**.

**Rasionalisasi adalah mode kegagalan yang berbeda.** Sebagian besar kegagalan bukan kasus di mana model melewatkan drain. Sebaliknya, model *dengan benar mendeskripsikan mekanisme drain tersembunyi* tetapi menerima framing menipu dari kontrak dan mengabaikannya sebagai benign โ€” menghasilkan **bukti keamanan yang positif tetapi salah**. Ini bisa dibilang lebih berbahaya daripada non-deteksi, karena out

Forensik smart contract semakin mengandalkan large language model untuk menginterpretasi **bytecode yang belum diverifikasi** โ€” artefak buram tingkat EVM yang tersisa ketika kode sumber tidak tersedia. Investigator, bursa, dan incident responder menggunakan model ini untuk menjawab pertanyaan berisiko tinggi: apakah kontrak ini mengandung mekanisme drain tersembunyi yang menyedot dana pengguna?
Premis makalah ini adalah bahwa model semacam itu belum pernah diuji secara sistematis terhadap kontrak yang *dirancang untuk menipu mereka*. Evaluasi sebelumnya mengukur akurasi pada kontrak alami atau benign; evaluasi tersebut tidak mengukur robustness di bawah tekanan adversarial. Penulis memperkenalkan **deception delta** sebagai kuantitas utama yang diminati: penurunan performa deteksi drain pada kontrak adversarial relatif terhadap kontrol yang matched secara fungsional.

Mengapa penting

Deception delta membingkai ulang bagaimana praktisi harus menafsirkan output forensik LLM. Temuan bahwa deception struktural **sebagian besar tidak sensitif terhadap enam strategi prompt** menunjukkan kegagalan ini bukan soal mengajukan pertanyaan yang lebih baik. Jika prompt engineering adalah bottleneck-nya, kita akan mengharapkan setidaknya beberapa strategi menutup celah; sebaliknya, celah itu tetap ada.

Temuan **rasionalisasi** adalah yang paling konsekuensial untuk deployment. Model yang mengatakan "Saya tidak melihat drain" setidaknya dapat dibaca sebagai hasil negatif. Model yang mengatakan "kontrak ini mengandung mekanisme yang mentransfer dana pengguna ke alamat eksternal, tetapi ini tampaknya mekanisme fee yang sah" telah menghasilkan **bukti keamanan yang positif tetapi salah** โ€” output terburuk bagi investigator yang terbatas waktu dan cenderung mempercayai analisis yang percaya diri.

Hasil **ketidakstabilan instruksi guard** memperingatkan terhadap mitigasi naif. Menambahkan "berhati-hatilah terhadap drain tersembunyi" ke prompt tidak secara andal meningkatkan deteksi dan dapat menurunkannya, karena instruksi berinteraksi secara tak terduga dengan prior model atas intent kontrak.

**Batas kapabilitas** โ€” hanya lima model dari dua provider yang melewati 50% deteksi โ€” menyiratkan bahwa pemilihan model lebih penting daripada pemilihan prompt untuk tugas ini. Ini juga menyiratkan bahwa generasi model saat ini harus diperlakukan sebagai **asistif, bukan otoritatif**, dalam forensik bytecode.

Pembatasan cakupan makalah ini penting. Klaim utamanya berlaku untuk alur kerja **single-shot, raw-bytecode-only**. Interogasi multi-turn, augmentasi tool, analisis source-aware, dan pipeline decompiler-in-the-loop dapat mengubah gambaran, dan penulis secara eksplisit menolak memperluas klaim ke pengaturan tersebut. Pemeriksaan batas kode sumber dilaporkan sebagai analisis subset, bukan sebagai bagian dari evaluasi utama.

Bagi praktisi, implikasi operasionalnya adalah **protokol triase yang sadar deception**: perlakukan output LLM pada bytecode yang belum diverifikasi sebagai petunjuk, bukan putusan; eskalasi setiap kontrak yang menunjukkan rantai panggilan multi-hop, selektor bertopeng XOR, atau parameter drain yang dimuat dari storage ke tinjauan manusia; dan jangan pernah memperlakukan penilaian "benign" yang percaya diri sebagai pembebas.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ