Aldrin Montana; Colin Marc; Luca Bigon; Jacopo Tagliabue
Summary
Drawing on over a year of operating millions of jobs in Bauplan, the authors present an SDK that treats data contracts as types, annotating input and output tables with schema objects that encode column types, constraints, documentation, a…
Method
Metodologi berakar pada studi operasional selama satu tahun atas jutaan job yang berjalan di Bauplan. Alih-alih mengusulkan sistem tipe yang murni teoretis, para penulis menyaring…
Results
Hasil utamanya adalah seperangkat prinsip desain dan SDK yang memperlakukan kontrak data sebagai tipe untuk lakehouse yang komposabel dan multi-bahasa. Para penulis melaporkan bahwa desain ini menjaw…
This vision paper proposes compilation-based execution of semantic operators, where an LLM is invoked once at compile time to translate a semantic operator specification into deterministic executable code. Preliminary results show substant…
Method
Metodologi yang diusulkan adalah **eksekusi berbasis kompilasi untuk operator semantik**. Ide utamanya adalah memisahkan fase pemahaman semantik dari fase pemrosesan data. Selama …
Results
Hasil awal menunjukkan bahwa eksekusi berbasis kompilasi secara substansial mengurangi waktu eksekusi dan panggilan LLM sambil mempertahankan sebagian besar kualitas keluaran. Penulis melaporkan bahw…
Nada Lahjouji; Shufan Zhang; Xi He; Sharad Mehrotra
Summary
ReBound introduces a reuse framework for differentially private interactive decision support, enabling analysts to refine thresholds and derive new functions from cached results while preserving formal utility guarantees. It combines a cac…
Method
ReBound terdiri atas tiga komponen utama: (1) kerangka guna-ulang yang mendukung berbagai jenis penyempurnaan, (2) struktur graf cache untuk pencarian efisien atas hasil yang dapa…
Results
Penulis mengevaluasi ReBound pada beban kerja dukungan keputusan interaktif, menunjukkan penghematan anggaran privasi yang signifikan dan utilitas yang meningkat. Dengan menggunakan ulang hasil yang …
Renaud, Aravindan, and Spadon propose a database-native workflow that aligns hydrophone recordings with AIS position reports through an indexed spatiotemporal join, producing a structured, distance-resolved dataset from roughly 950,000 rec…
Method
Alur kerja ini menyimpan jendela rekaman berdurasi tetap dan pesan AIS sebagai tabel geospasial persisten dan menghubungkannya melalui join spatiotemporal terindeks. Ini mengganti…
Results
Produk data yang dihasilkan mengungkapkan kondisi yang didominasi derau, dengan kontribusi kapal terutama muncul pada jarak yang lebih pendek. Ini menunjukkan bahwa tugasnya terletak pada mengekstrak…
Ku and Siddiqui develop three verification-time constructs from Execution Governance 3.0 and show that post-hoc reconstruction of model-mediated decisions can fail once the evaluator disappears. Independent reprocessing of released Study 2…
Method
Penelitian ini berjalan melalui tiga jalur empiris. Pertama, penulis secara independen memproses ulang artefak Study 2 yang dirilis untuk mereproduksi dua perbandingan perilaku da…
Results
Pemrosesan ulang independen atas artefak Study 2 yang dirilis mereproduksi dua perbandingan perilaku dalam keluarga yang asli: - **Pembalikan keputusan modal 52,0%** untuk Llama 3.1 8B versus Llama 3…
This paper proposes a real-vehicle experimental framework for an Apollo-on-Hongqi EV environment that unifies multi-vehicle experiments, repository-based code reuse, and software-hardware testing feedback into a single reviewable process. …
Method
Kerangka yang diusulkan disusun di sekitar tiga pilar yang saling terhubung: eksperimen multi-kendaraan, penggunaan ulang kode berbasis repositori, dan umpan balik pengujian peran…
Results
Makalah ini melaporkan bukti awal dari tiga area: eksperimen kolaboratif multi-kendaraan, berbagi kode dan keterampilan eksperimen, serta pengujian kolaboratif perangkat lunak-perangkat keras. **Eksp…
Hoejoon Kwon; Byeonggeuk Lim; Kahyeon Kim; YoungBin Kim
Summary
ALTSTEER is a training-free inference-time safety steering framework that decides when to intervene using an internal refusal-relevant signal and applies staged steering to shift generation from rigid refusals toward constructive safe alte…
Method
ALTSTEER beroperasi sepenuhnya pada waktu inferensi tanpa pelatihan tambahan. Kerangka ini terdiri dari dua komponen utama: 1. **Intervensi selektif**: Sinyal internal yang releva…
Results
Evaluasi pada Llama-3.1 dan Qwen2.5 menunjukkan bahwa ALTSTEER mempertahankan utilitas baik sekaligus meningkatkan perilaku penyelesaian aman yang konstruktif, terutama pada model yang cenderung meng…
Helwig reports months-scale operational experience running a single continuous Claude Code session line since January 2026 against a 633,000-line codebase, and presents SIx Harness, an MIT-licensed memory and continuity infrastructure. The…
Method
Studi ini adalah laporan kasus operasional, bukan eksperimen terkontrol. Unit analisisnya adalah satu lini sesi Claude Code yang berkelanjutan sejak Januari 2026 pada sebuah proye…
Results
Catatan operasional adalah hasil utama makalah ini. Sepanjang periode terinstrumentasi, subsistem mencatat **78.933 pemanggilan hook** dan **85 kegagalan tercatat, tidak ada yang senyap**. Distribusi…
Zhihao Gong; Junzhe Yu; Dong Huang; Zeyu Sun; Jie M. Zhang; Dan Hao
Summary
DSEffi-Bench introduces 1,000 instances across 10+ data science libraries to evaluate execution efficiency in LLM-generated code, finding that correctness and efficiency are largely decoupled. A five-category taxonomy shows most efficiency…
Method
DSEffi-Bench dibangun dengan tiga komponen inti: 1. **Koleksi Instans**: 1.000 tugas data science yang mencakup lebih dari 10 pustaka (misalnya pandas, NumPy, scikit-learn, PyTorc…
Results
Evaluasi 16 model di 3 tier menghasilkan beberapa temuan mencolok: - **Correctness tidak memprediksi efisiensi**: GPT-5.4 memimpin dalam correctness (Pass = 66,9%) tetapi skor efisiensinya (B$|$P = 7…
A new benchmark of 203 real-world dependency-upgrade tasks across five package ecosystems reveals that mainstream coding agents solve only 104 tasks (51.2%) at best, highlighting a critical gap between agent capabilities and software maint…
Method
Penulis membangun DEPBENCH, sebuah benchmark yang terdiri atas 203 tugas peningkatan dependensi dunia nyata. Tugas-tugas ini mencakup lima ekosistem paket, meliputi lima komunitas…
Results
Evaluasi coding agent arus utama pada DEPBENCH mengungkap kesenjangan kapabilitas yang tajam. Konfigurasi terbaik yang selesai hanya menyelesaikan 104 dari 203 tugas, setara dengan tingkat keberhasil…