Editorial ilmu komputer
Open AccessOA2026
Primitif 3D adalah Bahasa Spasial untuk VLM
Code-CoT dan S³-FT: Mengarahkan penalaran spasial melalui primitif geometris yang dapat dieksekusi
Junze Liu; Kun Qian; Florian Dubost; Kai Zhong; Arvind Srinivasan; Nan Chen; Anping Wang; Sam Zhang; Alejandro Mottini; Qingjun Cui; Tian Wang· 2026· DOI 10.48550/arXiv.2605.12586
Masalah inti
Model vision-language (VLM) menunjukkan paradoks yang mencolok: mereka dapat menghasilkan kode yang dapat dieksekusi untuk merekonstruksi adegan 3D dari primitif geometris dengan jumlah objek, kelas, dan posisi perkiraan yang benar, namun model yang sama gagal menjawab pertanyaan spasial yang lebih sederhana pada gambar yang sama. Penulis berargumen bahwa primitif geometris 3D (kubus, bola, silinder, yang dinyatakan dalam kode yang dapat dieksekusi) berfungsi sebagai representasi perantara yang kuat untuk pemahaman spasial. Mereka memanfaatkan wawasan ini melalui tiga kontribusi: sebuah benchmark (SpatialBabel), strategi inferensi tanpa pelatihan (Code-CoT), dan resep fine-tuning self-supervised (S³-FT). Karya ini memosisikan primitif geometris dalam kode sebagai alat diagnostik sekaligus kosakata spasial yang dapat ditransfer untuk VLM.
Inovasi
Dengan pelatihan hanya pada gambar primitif, S³-FT meningkatkan Qwen3-VL-8B sebesar hingga pada SpatialBabel-Primitive-QA, pada CV-Bench-2D, dan pada HallusionBench; resep ini dapat ditransfer antar keluarga model. Code-CoT menghasilkan hingga pada SpatialBabel-QA-Score dan pada CV-Bench-3D untuk model dengan kemampuan coding yang kuat. SpatialBabel menunjukkan bahwa deteksi objek dapat bervariasi hingga antar scene-code language untuk satu model.
Model vision-language (VLM) menunjukkan paradoks yang mencolok: mereka dapat menghasilkan kode yang dapat dieksekusi untuk merekonstruksi adegan 3D dari primitif geometris dengan jumlah objek, kelas, dan posisi perkiraan yang benar, namun model yang sama gagal menjawab pertanyaan spasial yang lebih sederhana pada gambar yang sama. Penulis berargumen bahwa primitif geometris 3D (kubus, bola, silinder, yang dinyatakan dalam kode yang dapat dieksekusi) berfungsi sebagai representasi perantara yang kuat untuk pemahaman spasial. Mereka memanfaatkan wawasan ini melalui tiga kontribusi: sebuah benchmark (SpatialBabel), strategi inferensi tanpa pelatihan (Code-CoT), dan resep fine-tuning self-supervised (S³-FT). Karya ini memosisikan primitif geometris dalam kode sebagai alat diagnostik sekaligus kosakata spasial yang dapat ditransfer untuk VLM.
Makalah ini memperkenalkan tiga komponen.
Mengapa penting
Hasil ini menetapkan primitif geometris dalam kode sebagai alat diagnostik sekaligus kosakata spasial yang dapat ditransfer untuk VLM. Paradoks—rekonstruksi berbasis kode yang kuat namun menjawab pertanyaan spasial langsung yang lemah—menunjukkan bahwa VLM memiliki pengetahuan spasial laten yang tidak dapat diakses secara andal hanya melalui kueri bahasa alami. Dengan memaksa penalaran melalui kode primitif yang dapat dieksekusi, Code-CoT dan S³-FT membuka pengetahuan ini tanpa label manusia atau model guru. Transfer lintas keluarga dari S³-FT menunjukkan bahwa kosakata spasial berbasis primitif tidak spesifik pada model tertentu. Penulis berencana merilis semua artefak saat publikasi. Pekerjaan selanjutnya dapat memperluas pendekatan ini ke adegan dinamis dan hubungan spasial yang lebih kompleks.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…