Fine-grained MoE LLMs select far more experts per token than necessary: keeping only two thirds of the chosen experts retains 98.8% of unpruned performance on average and yields 1.2-1.7x measured speedup. Dynamic expert pruning only earns …
Method
Studi ini disusun sekitar perbandingan terkendali antara pemotongan pakar seragam dan aturan alokasi pakar dinamis. **Model dan benchmark.** Dua belas checkpoint MoE berbutir halu…
Results
Hasil empiris disusun sekitar tiga pertanyaan penelitian. **Redundansi pemilihan pakar.** Pemilihan pakar jauh lebih redundan daripada yang diasumsikan oleh titik operasi bidang ini. Mempertahankan s…
MorphoSHAP introduces morphological shapes from the Tree of Shapes as the players in a Shapley attribution game, providing spatial, textual, and global class-level explanations. It outperforms competing attribution methods across five data…
Method
MorphoSHAP adalah metode post-hoc yang agnostik terhadap model yang merumuskan atribusi sebagai permainan Shapley di mana para pemainnya adalah bentuk morfologis yang diekstraksi …
Results
Para penulis mengevaluasi MorphoSHAP pada lima dataset yang beragam dan tiga arsitektur. Mereka melaporkan kinerja insertion/deletion yang kuat, metrik umum untuk kualitas atribusi di mana piksel ata…
Yuntian Xiao; Shoulong Zhang; Wenfeng Song; Yan Wang; Yi Chen; Shuai Li
Summary
CogenPVG decouples persuasive video generation into argument reasoning, storyboard planning, asset creation, and post-editing, each stage pairing a generator with a critic agent under the Elaboration Likelihood Model. Experiments report st…
Method
Metodologi disusun sebagai pipeline multi-agen bertahap dengan penyempurnaan reflektif. Masukannya adalah topik dan sikap dari pengguna. Keluarannya adalah video persuasif. Keempa…
Results
Abstrak melaporkan bahwa eksperimen ekstensif dan analisis komprehensif menunjukkan kerangka ini mencapai **kinerja persuasi terbaik**. Penulis menyatakan bahwa hal ini membuktikan efektivitas kerang…
ICG-MTO leverages a frozen numerical foundational model to infer auxiliary guidance for inter-task coupling estimation in few-shot multitask optimization, mitigating negative transfer. It is instantiated as ICG-MTBO for multitask Bayesian …
Method
ICG-MTO beroperasi melalui tiga tahap: 1. **Konstruksi kueri dalam konteks**: Dari himpunan solusi yang dievaluasi, dibangun kueri dalam konteks yang spesifik algoritma. Untuk ICG…
Results
Penulis mengevaluasi ICG-MTO pada tolok ukur sintetis dan masalah kendali lengan robot di dunia nyata. Eksperimen membandingkan ICG-MTBO dengan optimasi Bayesian multitugas standar dan ICG-MTO dengan…
A higher evaluation score does not always mean a better language model system. This digest examines how reward hacking arises across three optimization substrates — weights, selection, and prompts — and maps which defenses transfer between…
Method
Kerangka ini memformalkan dua konstruk utama: 1. **Batas atas ketidaksepakatan evaluator yang bergantung pada jarak.** Misalkan $\pi$ adalah suatu kebijakan dan $\pi'$ adalah kebi…
Results
Analisis formal, ilustrasi numerik, dan bukti yang dipublikasikan bersama-sama memberikan dasar untuk membandingkan metode optimasi. Hasil utama meliputi: - **Batas yang bergantung pada jarak:** Bata…
Jing Yang; Long R. Jiao; Xiujun Cai; Zongjiu Zhang
Summary
Event-based evaluations of longitudinal clinical AI can inflate apparent performance and lead time by treating recognition-mediated care-process signals as shortcuts and recognition-dependent endpoints as reference standards. The authors p…
Method
Para penulis mengusulkan kerangka evaluasi formal yang dibangun di atas tiga pilar. Pertama, mereka mendefinisikan transisi pra-rekognisi tersensor interval. Misalkan $T_{\text{re…
Results
Abstrak tidak melaporkan hasil empiris dari dataset tertentu; sebagai gantinya, abstrak menyajikan kontribusi konseptual dan metodologis. Para penulis berargumen bahwa evaluasi berbasis peristiwa dap…
AgenticSizing is a multi-agent LLM framework for analog circuit sizing that analyzes circuit topology, decomposes netlists into functional blocks, and coordinates role-specialized agents to optimize design variables. It achieves a 60% succ…
Method
Kerangka kerja AgenticSizing beroperasi dalam tiga tahap utama: analisis topologi, ekstraksi pengetahuan, dan sizing multi-agen. Pertama, netlist sirkuit diuraikan untuk mengident…
Results
Kerangka kerja ini divalidasi pada delapan sirkuit, dengan desain terbesar berisi hingga 55 transistor dan 60 variabel sizing. Untuk benchmark LDO, metode yang diusulkan mencapai tingkat keberhasilan…
SechKAN, a KAN variant using hyperbolic secant basis functions with 1D projection, achieves competitive performance against MLP, CNN1D, ResNet1D, and DSCNN1D on three 1D classification datasets, with particularly strong results on Crop. Ab…
Method
SechKAN dibangun di atas kerangka KAN, di mana setiap edge dalam jaringan menghitung fungsi univariat yang dapat dipelajari. Dalam SechKAN, fungsi-fungsi ini diparameterisasi seba…
Results
SechKAN mencapai kinerja kompetitif pada ketiga dataset. Pada UCI HAR, SechKAN berkinerja sebanding dengan MLP dan CNN1D, sedangkan pada ElectricDevices, ia menunjukkan akurasi serupa dengan ResNet1D…
OCSP is an online conformal policy that jointly decides actions and when to probe, provably controlling the missed query error (MQE) while minimizing probing rate. It applies to pre-trained value-based control policies without retraining.
Method
OCSP beroperasi dalam loop pengambilan keputusan sekuensial di mana pada setiap langkah waktu agen mengamati prediksi state (mungkin dari model yang telah dilatih sebelumnya), mem…
Results
Penulis memvalidasi OCSP melalui simulasi numerik. Mereka memverifikasi bahwa jaminan teoretis berlaku: MQE tetap di bawah tingkat risiko target $\alpha$ di berbagai pengaturan, dan laju probing jauh…
BAS-OPD is a budget-aware selective on-policy self-distillation framework that allocates teacher supervision to informative rollouts under limited query budgets while preserving full-batch student generation and single-pass full-image infe…
Method
BAS-OPD beroperasi dengan memisahkan generasi siswa dari supervisi guru. Model siswa menghasilkan rollout untuk seluruh batch, tetapi hanya subset rollout terpilih yang dikueri ke…
Results
Penulis mengevaluasi BAS-OPD pada tolok ukur persepsi multimodal berbutir halus. Meskipun abstrak tidak memberikan angka spesifik, abstrak menyatakan bahwa BAS-OPD mencapai kinerja kuat sekaligus men…