Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Qwen-Audio-3.1-Realtime: Menuju Interaksi Suara Agentic yang Andal

Kerangka Think–Act–Speak yang menaikkan keberhasilan tugas ke 82,0% dan menurunkan respons palsu terhadap suara latar dari 73,0% ke 13,0%
Lujia Bao; Qian Chen; Luyao Cheng; Chong Deng; Yuxiang Kong; Xiangang Li; Xu Li; Jiaqing Liu; Chao-Hong Tan; Haoyu Wang; Wen Wang; Xilou Wang; Haoxiang Xu; Junhao Xu; Liang Yi; Binbin Zhang; Qinglin Zhang; Qiquan Zhang· 2026· DOI 10.48550/arXiv.2609.25176

Masalah inti

Asisten suara waktu nyata bukan lagi sekadar pengenal ucapan sederhana atau antarmuka text-to-speech. Mereka harus menalar permintaan yang terus berkembang, menjalankan tindakan melalui alat, dan mematuhi aturan percakapan seperti kapan harus berbicara, kapan harus diam, dan kapan harus menyela. Penulis mengidentifikasi tiga kebutuhan yang saling terkait — **Think**, **Act**, dan **Speak and Coordinate** — dan berargumen bahwa sistem sebelumnya mengoptimalkannya secara terpisah, sehingga menghasilkan asisten yang menalar dengan buruk, gagal memakai alat secara andal, atau merespons pada momen yang tidak tepat.

Qwen-Audio-3.1-Realtime dipresentasikan sebagai jawaban terpadu atas kebutuhan tersebut. Makalah ini mengevaluasi model pada enam sumbu: penalaran audio, pemahaman multibahasa, penggunaan alat, perilaku percakapan, interaksi full-duplex, dan keamanan. Klaim empiris utamanya konkret: dibandingkan Qwen-Audio-3.0-Realtime, versi 3.1 menaikkan keberhasilan tugas secara keseluruhan dari **78,4% ke 82,0%** pada adaptasi speech-to-text half-duplex dari -Voice, dan pada speech-to-speech Full-Duplex-Bench v1.5 menurunkan tingkat respons terhadap suara latar dari **73,0% ke 13,0

Inovasi

Makalah ini melaporkan evaluasi pada penalaran audio, pemahaman multibahasa, penggunaan alat, perilaku percakapan, interaksi full-duplex, dan keamanan. Dua perbandingan utama terhadap Qwen-Audio-3.0-Realtime diberikan.

Pada adaptasi speech-to-text half-duplex dari -Voice, keberhasilan tugas secara keseluruhan meningkat dari **78,4%** ke **82,0%**, naik 3,6 poin persentase. Tolok ukur ini menguji kemampuan Think dan Act: asisten harus menafsirkan permintaan lisan, menalarnya, dan menyelesaikan tugas.

Pada speech-to-speech Full-Duplex-Bench v1.5, tingkat respons terhadap suara latar turun dari **73,0%** ke **13,0%**. Ini penurunan 60 poin persentase, dan secara langsung mengukur kemampuan Speak and Coordinate: asisten yang merespons suara latar gagal membedakan pengguna dari audio sekitar. Besarnya perubahan menunjukkan bahwa tahap koordinasi, bukan hanya front end akustik, melakukan kerja yang substansial.

Prototipe Voice Harness dipresentasikan secara terpisah, bukan sebagai hasil berskor. Prototipe ini memakai Qwen-Audio-3.0-Realtime sebagai foreground dan memperluas interaksi lisan ke tugas persisten melalui koordinasi foreground–background dan memori, yang mengindikasik

Asisten suara waktu nyata bukan lagi sekadar pengenal ucapan sederhana atau antarmuka text-to-speech. Mereka harus menalar permintaan yang terus berkembang, menjalankan tindakan melalui alat, dan mematuhi aturan percakapan seperti kapan harus berbicara, kapan harus diam, dan kapan harus menyela. Penulis mengidentifikasi tiga kebutuhan yang saling terkait — **Think**, **Act**, dan **Speak and Coordinate** — dan berargumen bahwa sistem sebelumnya mengoptimalkannya secara terpisah, sehingga menghasilkan asisten yang menalar dengan buruk, gagal memakai alat secara andal, atau merespons pada momen yang tidak tepat.
Qwen-Audio-3.1-Realtime dipresentasikan sebagai jawaban terpadu atas kebutuhan tersebut. Makalah ini mengevaluasi model pada enam sumbu: penalaran audio, pemahaman multibahasa, penggunaan alat, perilaku percakapan, interaksi full-duplex, dan keamanan. Klaim empiris utamanya konkret: dibandingkan Qwen-Audio-3.0-Realtime, versi 3.1 menaikkan keberhasilan tugas secara keseluruhan dari **78,4% ke 82,0%** pada adaptasi speech-to-text half-duplex dari -Voice, dan pada speech-to-speech Full-Duplex-Bench v1.5 menurunkan tingkat respons terhadap suara latar dari **73,0% ke 13,0%**. Karya ini juga memperkenalkan prototipe Voice Harness terpisah yang memakai Qwen-Audio-3.0-Realtime sebagai foreground dan memperluas interaksi lisan ke tugas persisten melalui koordinasi foreground–background dan memori.

Mengapa penting

Hasil mendukung klaim utama makalah bahwa penalaran, tindakan, dan koordinasi percakapan harus dilatih bersama, bukan sebagai modul terpisah. Peningkatan pada -Voice tergolong moderat secara absolut, tetapi terjadi pada metrik keberhasilan tugas yang baseline-nya sudah tinggi, sehingga ruang tersisa terbatas. Hasil Full-Duplex-Bench v1.5 lebih mencolok: memangkas respons terhadap suara latar dari 73,0% ke 13,0% mengatasi mode kegagalan yang langsung disadari pengguna, karena asisten yang menjawab televisi dianggap rusak terlepas dari kualitas penalarannya.

Beberapa batasan mengikuti bukti yang dilaporkan. Evaluasi disebut mencakup enam sumbu, tetapi hanya dua perbandingan kuantitatif yang diberikan pada abstrak, dan keduanya terhadap versi sebelumnya, bukan terhadap sistem eksternal. Adaptasi -Voice half-duplex adalah pengaturan speech-to-text, sehingga tidak dengan sendirinya menunjukkan keberhasilan tugas full-duplex. Voice Harness adalah prototipe dan tidak dilaporkan dengan angka tolok ukur. Terakhir, sumbu keamanan tercantum di antara evaluasi, tetapi tidak ada metrik keamanan yang diungkapkan dalam teks yang tersedia.

Bagi praktisi, desain ini menyarankan resep praktis: gunakan supervised fine-tuning untuk menjangkarkan perilaku, gunakan distilasi on-policy multi-guru untuk mentransfer kemampuan bahasa ke model audio, gunakan GRPO dengan lingkungan eksekutabel yang berkembang sendiri untuk mengajarkan penggunaan alat, dan sisakan tahap penyelarasan khusus untuk giliran bicara. Kandidat taksonomi untuk karya ini — Architecture, Cybersecurity, Network, Cryptography — hanya sebagian tepat; makalah ini utamanya merupakan kontribusi arsitektur dan interaksi agentic, dengan evaluasi keamanan sebagai kaitan terdekat ke kategori berorientasi keamanan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…