Aldrin Montana; Colin Marc; Luca Bigon; Jacopo Tagliabue
Ringkasan
Berdasarkan pengalaman lebih dari satu tahun mengoperasikan jutaan job di Bauplan, penulis menyajikan SDK yang memperlakukan kontrak data sebagai tipe, dengan menganotasi tabel input dan output memakai objek skema yang mengodekan tipe kolo…
Metode
Metodologi berakar pada studi operasional selama satu tahun atas jutaan job yang berjalan di Bauplan. Alih-alih mengusulkan sistem tipe yang murni teoretis, para penulis menyaring…
Hasil
Hasil utamanya adalah seperangkat prinsip desain dan SDK yang memperlakukan kontrak data sebagai tipe untuk lakehouse yang komposabel dan multi-bahasa. Para penulis melaporkan bahwa desain ini menjaw…
Makalah visi ini mengusulkan eksekusi berbasis kompilasi untuk operator semantik, di mana LLM dipanggil sekali pada waktu kompilasi untuk menerjemahkan spesifikasi operator semantik menjadi kode yang dapat dieksekusi secara deterministik. …
Metode
Metodologi yang diusulkan adalah **eksekusi berbasis kompilasi untuk operator semantik**. Ide utamanya adalah memisahkan fase pemahaman semantik dari fase pemrosesan data. Selama …
Hasil
Hasil awal menunjukkan bahwa eksekusi berbasis kompilasi secara substansial mengurangi waktu eksekusi dan panggilan LLM sambil mempertahankan sebagian besar kualitas keluaran. Penulis melaporkan bahw…
Nada Lahjouji; Shufan Zhang; Xi He; Sharad Mehrotra
Ringkasan
ReBound memperkenalkan kerangka guna-ulang untuk dukungan keputusan interaktif diferensial-privat, memungkinkan analis menyempurnakan ambang dan menurunkan fungsi baru dari hasil yang di-cache sambil mempertahankan jaminan utilitas formal.…
Metode
ReBound terdiri atas tiga komponen utama: (1) kerangka guna-ulang yang mendukung berbagai jenis penyempurnaan, (2) struktur graf cache untuk pencarian efisien atas hasil yang dapa…
Hasil
Penulis mengevaluasi ReBound pada beban kerja dukungan keputusan interaktif, menunjukkan penghematan anggaran privasi yang signifikan dan utilitas yang meningkat. Dengan menggunakan ulang hasil yang …
Renaud, Aravindan, dan Spadon mengusulkan alur kerja berbasis basis data yang menyelaraskan rekaman hidrofon dengan laporan posisi AIS melalui join spatiotemporal terindeks, menghasilkan dataset terstruktur teresolusi jarak dari sekitar 95…
Metode
Alur kerja ini menyimpan jendela rekaman berdurasi tetap dan pesan AIS sebagai tabel geospasial persisten dan menghubungkannya melalui join spatiotemporal terindeks. Ini mengganti…
Hasil
Produk data yang dihasilkan mengungkapkan kondisi yang didominasi derau, dengan kontribusi kapal terutama muncul pada jarak yang lebih pendek. Ini menunjukkan bahwa tugasnya terletak pada mengekstrak…
Ku dan Siddiqui mengembangkan tiga konstruk waktu verifikasi dari Execution Governance 3.0 dan menunjukkan bahwa rekonstruksi pasca-hoc atas keputusan yang dimediasi model dapat gagal begitu evaluator menghilang. Pemrosesan ulang independe…
Metode
Penelitian ini berjalan melalui tiga jalur empiris. Pertama, penulis secara independen memproses ulang artefak Study 2 yang dirilis untuk mereproduksi dua perbandingan perilaku da…
Hasil
Pemrosesan ulang independen atas artefak Study 2 yang dirilis mereproduksi dua perbandingan perilaku dalam keluarga yang asli: - **Pembalikan keputusan modal 52,0%** untuk Llama 3.1 8B versus Llama 3…
Makalah ini mengusulkan kerangka eksperimen kendaraan nyata untuk lingkungan Apollo-on-Hongqi EV yang menyatukan eksperimen multi-kendaraan, penggunaan ulang kode berbasis repositori, dan umpan balik pengujian perangkat lunak-perangkat ker…
Metode
Kerangka yang diusulkan disusun di sekitar tiga pilar yang saling terhubung: eksperimen multi-kendaraan, penggunaan ulang kode berbasis repositori, dan umpan balik pengujian peran…
Hasil
Makalah ini melaporkan bukti awal dari tiga area: eksperimen kolaboratif multi-kendaraan, berbagi kode dan keterampilan eksperimen, serta pengujian kolaboratif perangkat lunak-perangkat keras. **Eksp…
Hoejoon Kwon; Byeonggeuk Lim; Kahyeon Kim; YoungBin Kim
Ringkasan
ALTSTEER adalah kerangka kerja pengarahan keamanan waktu inferensi tanpa pelatihan yang memutuskan kapan harus melakukan intervensi menggunakan sinyal internal yang relevan dengan penolakan dan menerapkan pengarahan bertahap untuk menggese…
Metode
ALTSTEER beroperasi sepenuhnya pada waktu inferensi tanpa pelatihan tambahan. Kerangka ini terdiri dari dua komponen utama: 1. **Intervensi selektif**: Sinyal internal yang releva…
Hasil
Evaluasi pada Llama-3.1 dan Qwen2.5 menunjukkan bahwa ALTSTEER mempertahankan utilitas baik sekaligus meningkatkan perilaku penyelesaian aman yang konstruktif, terutama pada model yang cenderung meng…
Helwig melaporkan pengalaman operasional berskala bulan menjalankan satu lini sesi Claude Code yang berkelanjutan sejak Januari 2026 terhadap basis kode 633.000 baris, dan menyajikan SIx Harness, infrastruktur memori dan kesinambungan berl…
Metode
Studi ini adalah laporan kasus operasional, bukan eksperimen terkontrol. Unit analisisnya adalah satu lini sesi Claude Code yang berkelanjutan sejak Januari 2026 pada sebuah proye…
Hasil
Catatan operasional adalah hasil utama makalah ini. Sepanjang periode terinstrumentasi, subsistem mencatat **78.933 pemanggilan hook** dan **85 kegagalan tercatat, tidak ada yang senyap**. Distribusi…
Zhihao Gong; Junzhe Yu; Dong Huang; Zeyu Sun; Jie M. Zhang; Dan Hao
Ringkasan
DSEffi-Bench memperkenalkan 1.000 instans di lebih dari 10 pustaka data science untuk mengevaluasi efisiensi eksekusi pada kode hasil LLM, dan menemukan bahwa correctness dan efisiensi sebagian besar terpisah. Taksonomi lima kategori menun…
Metode
DSEffi-Bench dibangun dengan tiga komponen inti: 1. **Koleksi Instans**: 1.000 tugas data science yang mencakup lebih dari 10 pustaka (misalnya pandas, NumPy, scikit-learn, PyTorc…
Hasil
Evaluasi 16 model di 3 tier menghasilkan beberapa temuan mencolok: - **Correctness tidak memprediksi efisiensi**: GPT-5.4 memimpin dalam correctness (Pass = 66,9%) tetapi skor efisiensinya (B$|$P = 7…
Benchmark baru atas 203 tugas peningkatan dependensi dunia nyata di lima ekosistem paket menunjukkan bahwa coding agent arus utama paling banyak hanya menyelesaikan 104 tugas (51,2%), menyoroti kesenjangan kritis antara kapabilitas agent d…
Metode
Penulis membangun DEPBENCH, sebuah benchmark yang terdiri atas 203 tugas peningkatan dependensi dunia nyata. Tugas-tugas ini mencakup lima ekosistem paket, meliputi lima komunitas…
Hasil
Evaluasi coding agent arus utama pada DEPBENCH mengungkap kesenjangan kapabilitas yang tajam. Konfigurasi terbaik yang selesai hanya menyelesaikan 104 dari 203 tugas, setara dengan tingkat keberhasil…