This study investigates how the design of privileged context in on-policy self-distillation (OPSD) affects student performance. Across competition mathematics tasks at 4B and 8B scales, intermediate abstractions such as named strategies an…
Method
Pengaturan eksperimen mempertahankan tampilan siswa dan prosedur pelatihan tetap sama dalam setiap skala model (4B dan 8B parameter). Untuk setiap skala, penulis mengevaluasi lima…
Results
Pada uji utama pada matematika kompetisi, konteks tingkat menengah terbaik meningkatkan rata-rata puncak dalam domain dibandingkan solusi lengkap sebesar 1,4 poin pada 4B dan 1,6 poin pada 8B. Keuntu…
A 64-network, four-configuration probe of pairwise weight overlaps across grokking returned UNDETERMINED because the registered alignment step does not preserve network function. Post-hoc, only the overlap standard-deviation ratio retains …
Method
Rancangannya adalah sapuan pelatihan empat konfigurasi dengan 64 seed. Setiap jaringan dilatih hingga konvergensi berkelanjutan atau batas 40.000 epoch. Untuk setiap pasangan solu…
Results
Hasil terdaftar adalah UNDETERMINED (kode alasan C0_INSTRUMENT_INVALID). Tidak ada putusan konfirmatori yang tersedia, dan makalah ini menyatakan secara gamblang bahwa data tidak memberikan null konf…
This thesis investigates two directions of quantum-AI intersection: quantum methods for machine learning and machine learning for quantum systems. It introduces Neural Quantum Embedding for improved classification on noisy quantum hardware…
Method
Tesis ini menggunakan kombinasi derivasi teoretis, perancangan algoritma, dan validasi empiris. Untuk QML, Neural Quantum Embedding (NQE) diusulkan untuk mempelajari representasi …
Results
Dalam QML, NQE meningkatkan akurasi klasifikasi pada perangkat keras kuantum yang bising dengan meningkatkan trace distance antara ansambel kelas. Ekstensi DQC1 berhasil didemonstrasikan pada proseso…
Minghui Liu; Thomas Magelinski; Dehao Yuan; Qi Yu; Furong Huang
Summary
Ladders-of-Thought (LoT) improves reasoning in 1–8B parameter LLMs by generating semantically faithful but easier problem variants and scheduling them with a self-evolving bandit. It outperforms knowledge distillation, with gains up to +32…
Method
LoT beroperasi dalam tiga tahap: (1) **Penulisan ulang pertanyaan secara progresif**: Untuk setiap masalah penalaran asli, kerangka kerja ini menghasilkan urutan varian yang setar…
Results
LoT secara konsisten meningkatkan KD pada model 1–8B dari berbagai keluarga. Pada tugas aritmetika, metode ini memberikan keuntungan besar: **+32 poin persentase pada AddSub** dan **+25pp pada SVAMP*…
This study audits the calibration transfer of a frozen dual-head early-outcome predictor across LLM agents on SWE-bench Verified, finding persistent target-specific errors for gpt-5-mini/SUCCESS and claude-opus-4.6/FAILURE, but no evidence…
Method
Audit ini memanfaatkan trajektori SWE-bench Verified publik dan pipeline prediksi hasil awal dual-head yang dibekukan, yang mengeluarkan prediksi terpisah untuk hasil SUCCESS dan …
Results
Heterogenitas berpasangan prediktor-sama yang luas tidak didukung. Median perbedaan corrected-gap berpasangan adalah 0.0180 untuk head SUCCESS (45 pasangan) dan 0.0385 untuk head FAILURE (35 pasangan…
Zhentao Tan; Chang Liu; Yao Liu; Yue Wu; Jieping Ye
Summary
NSFT introduces sub-expert-level parameter-efficient fine-tuning for Mixture-of-Experts LLMs, decomposing experts into channel groups and selecting task-relevant sub-experts. Experiments show consistent gains over LoRA and expert-level spa…
Method
NSFT beroperasi dengan menguraikan setiap pakar dalam lapisan MoE sepanjang dimensi perantara menjadi kelompok kanal terstruktur, yang disebut sub-pakar. Untuk input tertentu, rou…
Results
Penulis mengevaluasi NSFT pada dua LLM MoE: OLMoE dan Ling-mini-2.0. Eksperimen mencakup tugas spesifik domain yang menantang dan tolok ukur umum. Baseline mencakup metode PEFT representatif (misalny…
This paper presents an integrated robotics course framework that organizes a complete research workflow around a shared open-source humanoid robot, validated through formative review by five experts. It identifies three central design tens…
Method
Kerangka ini dikembangkan melalui proses desain iteratif yang mencakup tinjauan formatif oleh lima pakar dalam penelitian robotika, teknik, pendidikan STEM menengah, dan desain ku…
Results
Umpan balik pakar menyoroti tiga ketegangan desain utama yang membentuk kerangka akhir: 1. **Keaslian versus beban kognitif**: Pakar mencatat bahwa meskipun tugas penelitian autentik memotivasi, tuga…
Generative AI agents used as synthetic consumers fail to reproduce human visual marketing effects in most configurations, and even successful steering understates consumer heterogeneity. The authors propose a Calibrate, Intervene, Deploy g…
Method
Para penulis melakukan uji tekanan sistematis menggunakan enam eksperimen pemasaran visual kanonik. Untuk setiap eksperimen, mereka memanipulasi dua faktor: generasi model (GPT-4o…
Results
Tidak ada dari 24 konfigurasi yang mereproduksi lebih dari dua dari enam efek manusia; sisanya tidak signifikan. Satu pengecualian adalah pembalikan signifikan dari pola manusia. Memberikan bukti kon…
MTFGN-SRL reframes RUL prediction as a single complete graph processed by a Fourier Graph Neural Network, augmented with multi-term lookback windows and a heterogeneous GNN for sample relationship learning. It achieves state-of-the-art per…
Method
Kerangka MTFGN-SRL terdiri dari tiga komponen inti: Fourier Graph Neural Network (FGN), modul pembelajaran multi-term, dan modul pembelajaran relasi sampel. **Fourier Graph Neural…
Results
MTFGN-SRL yang diusulkan dievaluasi pada dataset CMAPSS, tolok ukur yang banyak digunakan untuk prediksi RUL. Dataset ini terdiri dari beberapa subset (FD001, FD002, FD003, FD004) dengan kondisi oper…
This article proposes survival epidemiology as a distinct branch of epidemiology focused on postdiagnosis populations, arguing that prevention-based estimates often fail to apply after diagnosis. It outlines methodological requirements, da…
Method
Artikel ini menyintesis bukti pada kondisi kardiovaskular, renal, onkologis, pulmoner, dan hepatik untuk menunjukkan bahwa asosiasi yang diukur untuk insidensi sering gagal terepr…
Results
Bukti di berbagai area penyakit menunjukkan bahwa asosiasi yang diukur untuk insidensi sering tidak berlaku pada populasi pascadiagnosis. Misalnya, faktor yang meningkatkan risiko penyakit dapat memi…