Sheng Pan; Yongli Gu; Yiqing Guo; Warren Jin; Bo Du; Shirui Pan; Ming Jin
Ringkasan
TimeInteract memperkenalkan Time-Series Interaction, sebuah rezim ketika model secara berkelanjutan mempersepsi observasi streaming dan maksud pengguna, secara otonom memutuskan kapan harus merespons, dan tetap memproses data baru selama g…
Metode
TimeInteract dibangun di atas tiga komponen yang terkoordinasi. **1. Encoder TS streaming dual-view.** Encoder menangkap variasi lokal dan dinamika historis. Variasi lokal diekstr…
Hasil
Di seluruh empat tingkat interaksi, TimeInteract secara konsisten mengungguli LLM, VLM, dan TSLM yang ada. Peningkatan yang dilaporkan mencapai hingga **23,92 poin** pada tugas-tugas menantang. Selis…
Georgios Triantafyllou; Panagiotis G. Kalozoumis; Dimitris K. Iakovidis
Ringkasan
DeepFEAv2 memperluas kerangka kerja DeepFEA untuk menangani mesh tak terstruktur dan berbagai jenis elemen, mencapai R² hingga 0,99 dan inferensi hingga tiga orde magnitudo lebih cepat daripada FEA tradisional. Kerangka ini memperkenalkan …
Metode
DeepFEAv2 terdiri atas tiga komponen utama. Pertama, **modul pengorganisasian input berbasis konektivitas** memanfaatkan matriks konektivitas FE untuk mengelompokkan fitur input b…
Hasil
DeepFEAv2 dievaluasi pada dataset elastis linear 3D terstruktur dan tak terstruktur, serta pada dataset katup aorta yang digerakkan tekanan. Kerangka kerja ini mencapai nilai R² hingga 0,99 dan error…
AIDE^2 menerapkan peningkatan diri secara rekursif untuk agen riset AI terdepan, menemukan tujuh peningkatan kode beruntun dalam 8 hari berjalan otonom. Agen terkuat yang ditemukan menyamai atau melampaui agen riset produksi yang direkayas…
Metode
AIDE^2 mengoperasionalkan peningkatan diri secara rekursif sebagai optimasi loop tertutup atas kode sumber agen itu sendiri. Sistem terdiri dari tiga komponen inti: 1. **Proposal*…
Hasil
Dalam 8 hari berjalan otonom, AIDE^2 menemukan **tujuh peningkatan beruntun**. Keuntungan ini menggeneralisasi ke empat benchmark held-out yang mencakup: - Rekayasa machine learning - Rekayasa algori…
Yongfei Guo; Tingjin Chu; Mengzhuo Liu; Hongwei Lou; Yuanhao Gong
Ringkasan
PP-Net adalah jaringan neural hybrid physical-prior yang menghapus cahaya tersebar dari citra biomedis dengan mengintegrasikan penekanan derau, estimasi peta hamburan, dan penyempurnaan terpandu. Metode ini mencapai peningkatan PSNR hingga…
Metode
PP-Net adalah pipeline tiga tahap yang mengintegrasikan prior fisika dengan deep learning. Arsitekturnya diilustrasikan di bawah ini: **DFN-Net** menekan derau yang ditimbulkan se…
Hasil
Evaluasi kuantitatif menunjukkan efektivitas PP-Net. Pada tolok ukur sintetis berpasangan, cabang physical-prior meningkatkan PSNR hingga 1,26 dB. Di bawah degradasi derau dan hamburan gabungan, PP-N…
Hare Krishna; Shubham Singh; Stephen Ebert; Hao-Yu Sun
Ringkasan
Memperluas rekurensi melampaui anggaran inferensi nominal mengungkap bahwa keluaran yang salah mungkin mencerminkan komputasi yang belum selesai, bukan kegagalan yang menetap. Gerak keadaan laten turun tajam setelah solusi eksak pertama, d…
Metode
Kami mempelajari dua arsitektur TRM: model berbasis attention dan model berbasis MLP. Keduanya dievaluasi pada 1.000 teka-teki Sudoku sulit. Anggaran inferensi nominal adalah 16 l…
Hasil
Memperluas rekurensi dari 16 langkah nominal menjadi 512 langkah meningkatkan akurasi penyelesaian eksak kumulatif dari 59,2% menjadi 87,5% untuk model attention dan dari 74,4% menjadi 91,9% untuk mo…
Kyaw Hpone Myint; Nan Jiang; Xiang Li; Zhe Wu; Alexandre G. R. Day; Pranab Mohanty; Giri Iyengar
Ringkasan
QUARTET mengatasi dua keterbatasan RelGT dengan menggantikan sampler lokalnya yang terhubung longgar dengan sampler Causal Random Walk berbasis Personalized PageRank yang dipotong berdasarkan kebaruan, dan dengan memperkaya konteks global …
Metode
QUARTET terdiri atas dua komponen utama: sampler Causal Random Walk (CRW) dan modul cross-attention empat cabang. Sampler CRW didasarkan pada Personalized PageRank (PPR) yang dipo…
Hasil
Pada tugas klasifikasi RelBench v1, QUARTET secara konsisten menyamai atau melampaui baseline graph transformer state-of-the-art saat ini (HGT dan RelGT). Penulis melaporkan bahwa QUARTET mencapai ki…
Carmine Delle Femine; Leire Garin Atxaga; Asier Diaz-Iglesias; Juan Pablo Maroto Herrera; Ane Miren Florez-Tapia; Marco…
Ringkasan
Modul komunikasi laten hierarkis meningkatkan generalisasi model aliran daya multi-grid terhadap skenario operasi baru, menurunkan galat tegangan macro family-balanced sebesar 85,0% relatif terhadap backbone flat pada topologi pelatihan. G…
Metode
Arsitekturnya adalah **jaringan korektif berbasis GENCO** yang diperkaya dengan modul komunikasi laten hierarkis. Modul ini beroperasi pada dua graf tereduksi, yang berfungsi seba…
Hasil
Pada topologi pelatihan, **model hierarkis turunan Kron** mencapai galat tegangan macro family-balanced sebesar **0,851 ± 0,110**, dibandingkan dengan **5,660 ± 0,899** untuk baseline GENCO flat. Ini…
Gaoyuan Du; Anam Nawaz Khan; Rex Zhou; Xiaoyang Liu; Deepayan Chakrabarti; Fnu Suya; Xueping Li
Ringkasan
Greedy decoding lazim dianggap deterministik, tetapi model, prompt, dan algoritma yang identik menghasilkan output berbeda pada BF16 versus FP16 di perangkat keras yang sama. Analisis propagasi galat baru mengidentifikasi margin logit dua …
Metode
Penulis melakukan studi empiris sistematis tentang divergensi lintas presisi pada greedy decoding. Mereka mengevaluasi enam model mulai dari 1,1B hingga 7B parameter pada empat ke…
Hasil
Eksperimen mengungkap bahwa divergensi lintas presisi bersifat merata: 49–100% prompt mengalami divergensi pada enam model dan tiga benchmark. Satu pembalikan token sering kali berjenjang menjadi div…
Varshini Elangovan; James Wedgwood; Chhavi Yadav; William Agnew; Sauvik Das; Virginia Smith
Ringkasan
Safety Nudges adalah alat berbasis browser yang memberikan tanda ringan secara in situ ketika perilaku yang mengkhawatirkan terdeteksi dalam percakapan chatbot. Studi lapangan dua minggu dengan 45 pengguna chatbot yang sering menemukan bah…
Metode
Para penulis melakukan studi lapangan dua minggu dengan 45 pengguna chatbot yang sering. Studi ini mengumpulkan log interaksi, survei, dan umpan balik atas setiap nudge. Safety Nu…
Hasil
Partisipan menilai alat ini berguna, jelas, dan minim gangguan. Hampir semua pengguna melaporkan peningkatan kesadaran akan potensi bahaya AI. Namun, studi ini menemukan bahwa kesadaran yang meningka…
Makalah ini memperkenalkan alur kerja pengukuran yang dapat dieksekusi untuk mengaudit apakah keberhasilan eksekusi agen mengidentifikasi peningkatan produk mana yang dihargai pengguna. Studi terkontrol menunjukkan bahwa seluruh 36 interva…
Metode
Metodologi berpusat pada audit spesifik keputusan yang memformalkan hubungan antara pilihan agen dan kontras nilai produk. Misalkan $\mathcal{A}$ adalah himpunan tindakan agen, $\…
Hasil
Hasil utamanya sangat jelas: seluruh 36 interval primer konservatif tetap belum terselesaikan meskipun akurasi eksekusi berbeda antar model. Ini berarti bahwa bahkan ketika agen mengeksekusi tugas de…