FedMust introduces a semi-supervised federated multi-task student-teacher framework that leverages both labeled and unlabeled data across sites, achieving an average 13% performance gain over local and federated single-organ models.
Method
FedMust beroperasi dalam putaran komunikasi. Pada setiap putaran, pelatihan lokal dimulai dengan klien yang memiliki label untuk tugas yang sama membentuk federasi untuk menghasil…
Results
Eksperimen ekstensif menunjukkan efektivitas FedMust dibandingkan dengan model organ tunggal lokal dan terfederasi, menghasilkan peningkatan kinerja rata-rata 13 persen di seluruh klien. Eksperimen j…
Ziyad Benomar; Aymen Al Marjani; Paul Missault; Saab Mansour
Summary
This paper introduces a learning-augmented hypothesis testing framework that leverages predictions of unknown quality to reduce experimental costs. It presents an asymmetric test for population-level directional predictions and Generalized…
Method
Makalah ini memperkenalkan dua metode yang saling melengkapi untuk pengujian hipotesis yang diperkaya pembelajaran. Pertama, untuk prediksi arah pada tingkat populasi, para penuli…
Results
Para penulis mengevaluasi kerangka kerja mereka pada empat dataset dunia nyata, membandingkan metode yang diusulkan dengan pengujian hipotesis klasik dan baseline lainnya. Hasilnya menunjukkan bahwa …
SE-LLM-OCP integrates large language models for high-level maneuver decisions with optimal control for low-level feasibility, enabling safer autonomous parking in narrow, nonconvex environments. The framework self-evolves a decision-making…
Method
SE-LLM-OCP beroperasi dalam dua fase: daring dan luring. Secara daring, LLM bertindak sebagai perencana tingkat tinggi, mengusulkan rencana manuver renggang yang menguraikan tugas…
Results
Validasi eksperimental dilakukan dalam simulasi pada dua platform: model kendaraan mirip mobil dan robot penggerak diferensial. Hasilnya menunjukkan bahwa SE-LLM-OCP memungkinkan parkir otonom yang l…
A 2x2 experiment with 240 participants shows that only context-based personalization reliably changes stock rankings, moving them toward the AI's recommendation, while style-based personalization does not. Participants felt more influenced…
Method
Eksperimen ini menggunakan desain antara-subjek 2x2, memanipulasi personalisasi berbasis gaya (ada vs. tidak ada) dan personalisasi berbasis konteks (ada vs. tidak ada). Partisipa…
Results
Partisipan mempersepsikan kedua bentuk personalisasi, tetapi hanya personalisasi berbasis konteks yang secara andal mengubah perilaku peringkat. Secara spesifik, personalisasi berbasis konteks mening…
Qwen-Audio-3.1-Realtime unifies reasoning, tool use, and conversational turn-taking in a single real-time voice assistant. It raises overall task success on a half-duplex speech-to-text adaptation of τ-Voice from 78.4% to 82.0% while reduc…
Method
Pipeline pelatihan diorganisasi sekitar tiga kemampuan yang disebutkan. **Think.** Model menggabungkan supervised fine-tuning Core-Cocktail dengan Multimodality and Multi-Teacher …
Results
Makalah ini melaporkan evaluasi pada penalaran audio, pemahaman multibahasa, penggunaan alat, perilaku percakapan, interaksi full-duplex, dan keamanan. Dua perbandingan utama terhadap Qwen-Audio-3.0-…
Ahmed Khaled Khamis; Xiaotong Ji; Hassan Jaber; Rasul Tutunov; Matthieu Zimmer; Jun Wang; Haitham Bou-Ammar
Summary
iSDFT reframes on-policy self-distillation fine-tuning as a budgeted information-transfer problem, selecting the student-closest distribution that satisfies a teacher-information constraint. Across four LLM backbones and two specialisation…
Method
iSDFT beroperasi pada tingkat token. Pada setiap token, metode ini memilih distribusi yang paling dekat dengan siswa saat ini yang memenuhi kendala informasi guru yang ditetapkan.…
Results
Penulis mengevaluasi iSDFT pada empat tulang punggung LLM yang heterogen dan dua tugas spesialisasi. iSDFT meningkatkan SDFT vanilla pada 7 dari 8 pengaturan model-tugas dan menyamainya pada satu pen…
Corrective Forcing (CoF) is a unified post-training method for diffusion and flow models that forces them to learn from self-generated rollout states and correct their clean-speech predictions toward ground truth. It improves perceptual qu…
Method
Corrective Forcing beroperasi sebagai tahap pasca-pelatihan yang memaparkan model pada berbagai kondisi inferensi. Gagasan utamanya adalah mengoreksi prediksi suara bersih pada ke…
Results
Penulis melakukan eksperimen dengan dua instansiasi: **SB-VE** dan **OT-CFM**. Hasilnya menunjukkan peningkatan kualitas perseptual dan kesetiaan rekonstruksi. Secara spesifik, CoF menghasilkan kiner…
Touch2Robot enables humans to collect manipulation demonstrations while seeing predicted robot-hand contacts, improving real-robot replay completion from 37.9% to 72.1% and reducing collection time per successful demonstration from 58.6s t…
Method
Touch2Robot terdiri dari tiga komponen utama: (1) penangkapan demonstrasi manusia multimodal, (2) pembelajaran kebijakan RL spesifik objek dengan panduan taktil, dan (3) retargeti…
Results
Kerangka kerja ini dievaluasi pada empat tugas dunia nyata. Hasil kuantitatif utama dirangkum di bawah ini. **Penyelesaian Replay Robot Nyata.** Touch2Robot meningkatkan rata-rata penyelesaian replay…
Ivan Aleksandrov; German Kochnev; Sabrina Sadiekh; Yaroslav Rogoza
Summary
DUMA-Bench extends τ²-bench with adversarial environments covering eight vulnerability classes and evaluates 14 models from five families. Introducing dual-control interaction increases attack success rate from 26.9% to 41.1%.
Method
DUMA-Bench memperluas kerangka τ²-bench dengan memperkenalkan interaksi dual-kontrol, di mana agen dan pengguna sama-sama dapat memengaruhi keadaan lingkungan bersama. Tolok ukur …
Results
Di seluruh eksperimen, memperkenalkan interaksi dual-kontrol meningkatkan tingkat keberhasilan serangan dari **26,9%** menjadi **41,1%**. Kenaikan 14,2 poin persentase ini menunjukkan bahwa dinamika …
This paper improves both the lower and upper bounds on the competitive ratio of Longest Queue Drop (LQD), a buffer management policy for shared memory switches. The new bounds are 1.46929591 <= CR(LQD) <= 1.683652, tightening the previousl…
Method
Untuk batas bawah, penulis memperkenalkan keluarga instans baru yang disebut *front-loaded family*. Mereka memberikan sertifikat bilangan bulat eksak pada instans berhingga terten…
Results
Hasil utamanya adalah: - Batas bawah: $\mathrm{CR}(\mathrm{LQD}) \geq \frac{184815365566285}{125784985866185} = 1,46929591...$ - Batas atas: $\mathrm{CR}(\mathrm{LQD}) \leq 1,683652$ Hasil ini memper…