Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

Penyelarasan Instruksi untuk Pembelajaran Representasi Kode Biner

Memanfaatkan informasi debug kompilator sebagai objektif tambahan untuk mempertajam embedding biner tingkat fungsi
Huaijin Wang; Shuai Wangยท 2026ยท DOI 10.48550/arXiv.2608.11766

Masalah inti

Pembelajaran representasi kode biner adalah masalah mendasar dalam keamanan perangkat lunak dan rekayasa balik. Metode yang ada terutama mempelajari embedding tingkat fungsi yang menangkap hubungan semantik berbutir kasar antar fungsi biner, tetapi sebagian besar mengabaikan korespondensi tingkat instruksi yang berbutir halus. Keterbatasan ini melewatkan sinyal supervisi berharga yang tersedia dari informasi debug kompilator, yang dapat mendukung pembelajaran representasi kode biner yang lebih akurat dan interpretabel.

Penulis mengusulkan pemanfaatan pengetahuan penyelarasan instruksi untuk lebih meningkatkan pembelajaran representasi kode biner. Studi pendahuluan mereka mengungkapkan bahwa model yang di-finetune untuk kemiripan kode biner tingkat fungsi menunjukkan penyelarasan instruksi yang jauh lebih baik daripada model pra-latihnya, yang menunjukkan korelasi kuat antara penyelarasan instruksi dan kualitas embedding tingkat fungsi. Didorong oleh pengamatan ini, mereka merancang pendekatan pelatihan yang secara eksplisit memasukkan penyelarasan instruksi sebagai objektif pelatihan tambahan.

Inovasi

Penulis melaporkan bahwa pelatihan penyelarasan instruksi meningkatkan akurasi pengambilan dan memberikan sinyal yang lebih diskriminatif untuk penilaian kemiripan model. Dalam studi pendahuluan mereka, model yang di-finetune untuk kemiripan kode biner tingkat fungsi menunjukkan penyelarasan instruksi yang jauh lebih baik daripada model pra-latihnya, yang menunjukkan korelasi kuat antara penyelarasan instruksi dan kualitas embedding tingkat fungsi. Eksperimen menunjukkan bahwa memasukkan penyelarasan instruksi sebagai objektif tambahan menghasilkan peningkatan terukur dalam kinerja pengambilan, meskipun hasil numerik spesifik tidak dirinci dalam abstrak.
Pembelajaran representasi kode biner adalah masalah mendasar dalam keamanan perangkat lunak dan rekayasa balik. Metode yang ada terutama mempelajari embedding tingkat fungsi yang menangkap hubungan semantik berbutir kasar antar fungsi biner, tetapi sebagian besar mengabaikan korespondensi tingkat instruksi yang berbutir halus. Keterbatasan ini melewatkan sinyal supervisi berharga yang tersedia dari informasi debug kompilator, yang dapat mendukung pembelajaran representasi kode biner yang lebih akurat dan interpretabel.
Penulis mengusulkan pemanfaatan pengetahuan penyelarasan instruksi untuk lebih meningkatkan pembelajaran representasi kode biner. Studi pendahuluan mereka mengungkapkan bahwa model yang di-finetune untuk kemiripan kode biner tingkat fungsi menunjukkan penyelarasan instruksi yang jauh lebih baik daripada model pra-latihnya, yang menunjukkan korelasi kuat antara penyelarasan instruksi dan kualitas embedding tingkat fungsi. Didorong oleh pengamatan ini, mereka merancang pendekatan pelatihan yang secara eksplisit memasukkan penyelarasan instruksi sebagai objektif pelatihan tambahan.

Mengapa penting

Temuan ini menunjukkan bahwa korespondensi tingkat instruksi yang berbutir halus, yang sering diabaikan dalam pembelajaran representasi tingkat fungsi, membawa sinyal supervisi yang berharga. Dengan memanfaatkan informasi debug kompilator untuk memperoleh pengetahuan penyelarasan instruksi, metode yang diusulkan menjembatani kesenjangan antara embedding fungsi berbutir kasar dan semantik instruksi berbutir halus. Hal ini menghasilkan representasi kode biner yang lebih akurat dan interpretabel. Korelasi yang diamati antara penyelarasan instruksi dan kualitas embedding tingkat fungsi menyiratkan bahwa penyelarasan dapat berfungsi sebagai sinyal diagnostik atau pelatihan yang berguna untuk model analisis biner di masa depan. Pendekatan ini sangat relevan untuk tugas keamanan perangkat lunak dan rekayasa balik, di mana penilaian kemiripan yang tepat sangat penting. Namun, abstrak tidak merinci dataset, baseline, atau metrik yang digunakan, sehingga diperlukan detail lebih lanjut untuk menilai secara penuh generalisasi hasilnya.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ