Venkata Krishna Prasanth Budigi; Siri Chandana Sirigiri
Ringkasan
BatchBench adalah kerangka kerja tolok ukur terbuka yang diusulkan untuk menempatkan kebijakan autoscaling berbasis aturan, learned, dan agentic pada pijakan eksperimental yang setara. Kerangka ini menyumbangkan taksonomi beban kerja, gene…
Metode
BatchBench dirancang sebagai kerangka kerja modular dengan empat komponen utama: 1. **Taksonomi beban kerja**: Enam kelas pemrosesan batch yang disintesis dari tolok ukur autoscal…
Hasil
Sebagai makalah posisi, BatchBench tidak menyajikan hasil empiris. Sebaliknya, makalah ini menjelaskan permukaan evaluasi yang diharapkan dan bagaimana kerangka kerja ini akan memungkinkan perbanding…
Makalah ini memperkenalkan metode seleksi kandidat sadar data untuk terjemahan NL2SQL yang menggunakan instansi pemisah kecil dan provenans untuk membedakan kueri SQL kandidat. Eksperimen pada BIRD-DEV menunjukkan bahwa metode ini secara s…
Metode
Metode yang diusulkan, bernama SISelection (Small Separating Instance Selection), beroperasi pada sekumpulan kueri SQL kandidat yang dihasilkan untuk pertanyaan bahasa alami. Untu…
Hasil
Penulis mengevaluasi metode mereka pada subset benchmark BIRD-DEV, yaitu dataset skala besar untuk tugas NL2SQL. Mereka membandingkan dengan tiga baseline alami: seleksi acak, seleksi berdasarkan pan…
Larroque dan Manière menunjukkan bahwa bahkan dalam kelas aturan eksistensial dengan entailment conjunctive query yang dapat diputuskan, pemeriksaan keanggotaan dalam kelas chase-termination standar dan kelas bounded treewidth set (BTS) te…
Metode
Penulis melakukan analisis keterputusan (decidability) terhadap masalah keanggotaan untuk kelas chase-termination dan kelas BTS, dengan asumsi bahwa kelas ambien sudah menikmati e…
Hasil
Hasil utamanya bersifat negatif: untuk kelas-kelas yang didasarkan pada terminasi semua varian chase klasik (oblivious, semi-oblivious, restricted, core) dan untuk kelas BTS, keanggotaan tidak dapat …
Karya ini menyajikan dataset dunia nyata yang dikumpulkan dari jaringan 5G yang telah di-deploy secara komersial di berbagai mode mobilitas dan kecepatan, dengan fokus pada pengukuran handover, manajemen beam, dan timing advance. Dataset i…
Metode
Dataset ini dikumpulkan dari jaringan yang telah di-deploy secara komersial untuk merekam mobilitas UE di dunia nyata. Akuisisi data melibatkan berbagai mode mobilitas: pejalan ka…
Hasil
Dataset ini mencakup berbagai skenario mobilitas, dari pejalan kaki hingga kereta, pada berbagai kecepatan, memberikan gambaran komprehensif tentang mobilitas UE di jaringan 5G komersial. Pengukuran …
Junze Liu; Kun Qian; Florian Dubost; Kai Zhong; Arvind Srinivasan; Nan Chen; Anping Wang; Sam Zhang; Alejandro Mottini;…
Ringkasan
Model vision-language dapat menghasilkan kode yang merekonstruksi adegan 3D dari primitif geometris, namun gagal menjawab pertanyaan spasial yang lebih sederhana pada gambar yang sama. Makalah ini memperkenalkan SpatialBabel, Code-CoT, dan…
Metode
Makalah ini memperkenalkan tiga komponen. **SpatialBabel** adalah benchmark yang mengevaluasi empat belas VLM pada rekonstruksi adegan 3D berbasis primitif di enam *scene-code lan…
Hasil
Dengan pelatihan hanya pada gambar primitif, S³-FT meningkatkan Qwen3-VL-8B sebesar $+4.6$ hingga $+8.6\%$ pada SpatialBabel-Primitive-QA, $+9.7\%$ pada CV-Bench-2D, dan $+17\%$ pada HallusionBench; …
Yong Liu; Ximan Liu; Guoqing Yang; Bing Bai; Xiaoqiang Xu; Zhen Chen; Ke Zhang; Yan Li
Ringkasan
OxyEcomBench memperkenalkan sekitar 6.300 instans bilingual terverifikasi ahli yang mencakup tiga peran pemangku kepentingan, enam aspek kapabilitas, dan 29 tugas untuk secara sistematis mengukur seberapa rendah kinerja model fondasi multi…
Metode
OxyEcomBench dibangun dari platform e-commerce autentik, dengan seluruh data diverifikasi oleh pakar domain. Tolok ukur ini mengadopsi desain yang sadar tingkat kesulitan mengguna…
Hasil
Evaluasi pada **20 LLM dan MLLM arus utama** menunjukkan bahwa bahkan model terdepan hanya mencapai kinerja yang moderat pada OxyEcomBench. Kesenjangan kinerja antarmodel menyempit pada tolok ukur in…
Abdul Rafay; Yuni Susanti; David Lamprecht; Michael Färber
Ringkasan
SemRepo adalah graf pengetahuan RDF yang terdiri atas lebih dari 81 juta tripel yang mendeskripsikan hampir 200.000 repositori GitHub yang terkait dengan penelitian ilmiah. Graf ini menghubungkan metadata repositori dengan graf pengetahuan…
Metode
SemRepo dibangun sebagai graf pengetahuan RDF yang mengikuti prinsip Linked Data. Graf ini mengintegrasikan data dari berbagai sumber melalui entity linking dan penyelarasan seman…
Hasil
SemRepo berhasil mengintegrasikan metadata tingkat repositori dengan graf pengetahuan keilmuan, menghasilkan sumber daya yang komprehensif untuk menganalisis perangkat lunak penelitian. Hasil kuantit…
Janos Arpasi; Bartosz Jan Bednarczyk; Magdalena Ortiz
Ringkasan
Makalah ini memperkenalkan ELbotpreceq, logika deskripsi Horn yang secara ketat memperluas DL-Lite sekaligus mendukung aksioma keterjangkauan dan konjungsi terbatas, mencapai kompleksitas data NL melalui penulisan ulang menjadi nested two-…
Metode
Para penulis mendefinisikan ELbotpreceq dengan memperluas ELI dengan mekanisme stratifikasi yang memisahkan konjungsi dari rekursi. Stratifikasi ini memastikan bahwa interaksi ant…
Hasil
Hasil utamanya adalah ELbotpreceq menikmati kompleksitas data NL untuk penjawaban kueri. Hal ini ditetapkan melalui penulisan ulang menjadi nested two-way regular path queries, yang dievaluasi dalam …
Makalah ini mengusulkan agen kunci dan agen transaksi berbasis FPGA khusus dengan tabel kunci terintegrasi untuk menghilangkan overhead akses DRAM pada sistem OLTP. Eksperimen menunjukkan throughput transaksi hingga 51× lebih tinggi diband…
Metode
Sistem yang diusulkan terdiri dari dua komponen perangkat keras utama: agen kunci dan agen transaksi, keduanya diimplementasikan pada FPGA. Agen kunci mengintegrasikan tabel kunci…
Hasil
Hasil eksperimen menunjukkan throughput transaksi hingga 51X lebih tinggi dibandingkan baseline CPU pada benchmark TPC-C. Peningkatan signifikan ini disebabkan oleh penghapusan overhead akses DRAM un…
Makalah ini mengusulkan kerangka optimisasi preferensi bertahap yang mengurangi halusinasi pada model vision-language dengan membangun pasangan preferensi sulit di dekat batas kegagalan yang diketahui. Eksperimen menunjukkan konsistensi gr…
Metode
Kerangka yang diusulkan terdiri dari tiga tahap utama: (1) identifikasi batas kegagalan, (2) generasi hard negative, dan (3) pelatihan DPO bertahap. Pertama, model dievaluasi pada…
Hasil
Eksperimen dilakukan pada benchmark open-source dan skenario evaluasi multimodal dunia nyata. Kerangka yang diusulkan menunjukkan konsistensi grounding yang lebih baik, halusinasi yang berkurang, dan…