Interacting with ChatGPT, Claude, or Gemini as a thinking partner temporarily shifts human value priorities toward personal focus, primarily through increased Self-Enhancement, even when the LLM neither targets values nor seeks to persuade…
Method
Studi ini menggunakan desain antarsubjek terpreregistrasi dengan 200 orang dewasa di Amerika Serikat. Peserta secara acak ditugaskan ke salah satu dari empat kondisi: interaksi de…
Results
Setiap kondisi LLM sementara menggeser prioritas nilai ke arah fokus personal dibandingkan kondisi kontrol, dengan ukuran efek berkisar dari d = 0,37 hingga d = 0,51. Pergeseran ini terutama didorong…
Jasper van Doornmalen; Alexander Kozachinskiy; Corinna Mathwieser; Tomasz Steifer; Felipe Urrutia; José Verschae; Przem…
Summary
This note proves that checking whether a sequence of bits is ordered is impossible for 1-head 1-layer transformers but possible for 2-head 1-layer transformers, under a model that includes an output MLP.
Method
Penulis menganalisis masalah pengurutan di bawah model transformer dengan MLP keluaran. Secara formal, diberikan barisan masukan $x = (x_1, x_2, \ldots, x_n) \in \{0,1\}^n$, tugas…
Results
Hasil utamanya ada dua: 1. **Ketidakmungkinan untuk 1 kepala**: Tidak ada transformer 1 kepala 1 lapis dengan MLP keluaran yang dengan benar memeriksa apakah suatu barisan bit terurut untuk semua pan…
KEX-bench evaluates coding agents on generating exploit primitives against real Linux and Windows kernels, revealing a substantial gap between reaching kernel crashes and shaping kernel state into usable primitives. The strongest configura…
Method
Metodologi KEX-bench dibangun di sekitar tiga komponen inti: instance tugas, lingkungan eksekusi, dan verifikasi. **Instance Tugas.** Tolok ukur ini terdiri dari 45 tugas yang ber…
Results
Evaluasi mengungkap kesenjangan kinerja yang mencolok antara tugas Windows dan Linux, serta antara pengaturan dengan dan tanpa PoC referensi. **Tanpa PoC referensi:** - Konfigurasi terkuat menyelesai…
ArticleMiner extracts quantitative scientific facts from papers and supplementary files by reconciling evidence from multiple parsers and an LLM under the guidance of human-authored task modules. Evaluated on 163 papers across four domains…
Method
ArticleMiner mengikuti pipeline modular yang memisahkan pengumpulan bukti dari interpretasi spesifik domain. Arsitekturnya diilustrasikan di bawah ini: Ensemble parser mengekstrak…
Results
ArticleMiner dievaluasi pada 163 makalah di empat domain: kimia penemuan obat, ilmu material, machine learning, dan geokimia mineral. Evaluasi geokimia memperkenalkan tolok ukur baru dengan ground tr…
Wenzhi Fang; Nicholas Tzou; Lazar Valkov; Srinivas Chappidi
Summary
NB-LoRA reparameterizes low-rank updates through a fixed approximate null basis estimated from reasoning activations, enforcing a layer-wise hidden-state preservation constraint during supervised fine-tuning. It matches standard LoRA on do…
Method
NB-LoRA merumuskan retensi penalaran sebagai kendala pemeliharaan hidden-state per lapisan dan membangun basis nol aproksimatif tetap dari aktivasi penalaran. Pembaruan LoRA kemud…
Results
Eksperimen ekstensif pada berbagai LLM yang dilatih RL dan beragam tugas hilir menunjukkan bahwa NB-LoRA menyamai LoRA standar dalam kinerja adaptasi, mempertahankan akurasi penalaran mendekati tingk…
ChatT2 is a multiagent LLM-based agent tailored to bacterial type II polyketides, integrating retrieval-augmented generation with bioinformatics and cheminformatics tools. It addresses general LLM limitations on specialized corpora and com…
Method
ChatT2 memakai arsitektur multiagen dengan tiga komponen inti: mentor, eksekutor, dan evaluator. Mentor bertindak sebagai perantara antara ChatT2 dan pengguna, memanfaatkan chain-…
Results
Penulis melaporkan bahwa ChatT2, yang dirancang dengan kerangka multiagen ini, mengatasi tantangan yang dihadapi LLM umum dalam memahami korpus terspesialisasi yang terbatas dan informasi biologis ya…
C. Cazes; B. W. Goni; N. Muhammad; D. Gabillard; Pierrot Kalubi Balonda; Loic Feuzeu; Irine Atanga; Brice Yapi; G. Habi…
Summary
This protocol describes a two-arm cluster-randomized trial in Yobe State, Nigeria, evaluating whether integrating small-quantity lipid-based nutrient supplements (SQ-LNS) into routine immunization services increases measles vaccination cov…
Method
Studi ini dirancang sebagai uji acak terkendali klaster paralel pragmatis superioritas dua lengan dengan pengukuran dasar. Penelitian akan dilakukan di 20 ward di Wilayah Pemerint…
Results
Karena ini adalah protokol studi, hasil belum tersedia. Luaran primer adalah cakupan imunisasi campak tingkat populasi pada anak usia 12–23 bulan, diukur melalui survei cross-sectional akhir. Luaran …
Murzaeva Mariia; Imad Ghanem Qasim; S. H. Ismael; Zahaa Aldeen Jamal; Abdalfattah Sharad; H. Najmuldeen; Nurila Aryntay…
Summary
This review examines the epidemiology, molecular structure, and vaccine development efforts targeting glycoprotein G of Nipah virus, highlighting promising preclinical results and persistent challenges such as immune evasion and limited cl…
Method
Para penulis melakukan tinjauan komprehensif terhadap literatur tentang epidemiologi, biologi molekuler, dan pengembangan vaksin virus Nipah, dengan fokus pada kandidat vaksin ber…
Results
Vaksin berbasis glikoprotein G merupakan jalur yang menjanjikan untuk memerangi infeksi NiV. Kemajuan dalam biologi struktural, penargetan sistem imun, dan teknologi sistem penghantaran membuka jalan…
This study investigates how the design of privileged context in on-policy self-distillation (OPSD) affects student performance. Across competition mathematics tasks at 4B and 8B scales, intermediate abstractions such as named strategies an…
Method
Pengaturan eksperimen mempertahankan tampilan siswa dan prosedur pelatihan tetap sama dalam setiap skala model (4B dan 8B parameter). Untuk setiap skala, penulis mengevaluasi lima…
Results
Pada uji utama pada matematika kompetisi, konteks tingkat menengah terbaik meningkatkan rata-rata puncak dalam domain dibandingkan solusi lengkap sebesar 1,4 poin pada 4B dan 1,6 poin pada 8B. Keuntu…
A 64-network, four-configuration probe of pairwise weight overlaps across grokking returned UNDETERMINED because the registered alignment step does not preserve network function. Post-hoc, only the overlap standard-deviation ratio retains …
Method
Rancangannya adalah sapuan pelatihan empat konfigurasi dengan 64 seed. Setiap jaringan dilatih hingga konvergensi berkelanjutan atau batas 40.000 epoch. Untuk setiap pasangan solu…
Results
Hasil terdaftar adalah UNDETERMINED (kode alasan C0_INSTRUMENT_INVALID). Tidak ada putusan konfirmatori yang tersedia, dan makalah ini menyatakan secara gamblang bahwa data tidak memberikan null konf…