Uji Nyata AI Mengemudi: Hanya GPT-6 Astra Finis, Biaya Token Rp174 Ribu
Baca dalam 60 detik
- Empat model AI diuji mengemudikan Toyota Corolla 2022 di lintasan 127 meter; hanya GPT-6 Astra yang berhasil mencapai garis finis.
- Delapan dari 11 percobaan gagal sebelum tikungan pertama akibat model salah membaca batas cone, sementara latensi hingga 22 detik memperburuk kendali.
- Peneliti menilai kemampuan AI mengemudi masih jauh di bawah manusia, meski biaya token Astra mencapai US$9,75 atau sekitar Rp174 ribu.

Sebuah eksperimen ambisius yang melibatkan tiga peneliti mengungkap kesenjangan tajam antara kecanggihan model bahasa besar dan kemampuan mengemudi di dunia nyata. Empat model AI generasi terbaru dipasang pada Toyota Corolla 2022 dan diuji di lintasan berbatas cone sepanjang 127 meter. Hasilnya, hanya satu model yang berhasil menyentuh garis finis, sementara tiga lainnya kandas sebelum tikungan pertama.
Makalah berjudul DrivingBench: Can Vision-Language Models Drive a Toyota Corolla? yang ditulis Aditya Ramabadran, Simon Mahns, dan Tobias Gessler itu masih berstatus preprint di alphaXiv per 30 September 2026 dan belum melalui peer review. Meski demikian, temuan awal ini memberikan gambaran penting tentang sejauh mana model visi-bahasa mampu menangani tugas fisik yang menuntut respons cepat dan akurat.
Model yang diuji adalah GPT-6 Astra dan GPT-5.6 Sol melalui Codex, Claude Fable 5.1 lewat Claude Code, serta Grok 4.6 via Cursor. Peneliti menegaskan bahwa yang dibandingkan bukan sekadar model, melainkan pasangan model dengan aplikasi pengendalinya. Mobil dilengkapi perangkat comma four dan perangkat lunak openpilot, memungkinkan model melihat gambar kamera lalu mengirim perintah persentase setir, kecepatan, serta durasi gerak. Kecepatan dibatasi 0,5 hingga 3,5 meter per detik atau sekitar 1,8 hingga 12,6 km/jam.
GPT-6 Astra menunjukkan performa paling menjanjikan. Pada percobaan pertama, ia mencapai 49 persen lintasan, lalu berhasil finis di percobaan kedua. Mobil masuk zona finis 4 menit 44 detik setelah perintah pertama, dengan catatan waktu finis 5 menit 22 detik. Sementara itu, Claude Fable 5.1 memperlihatkan tren perbaikan dari 9 persen, 10 persen, hingga 45 persen. Grok 4.6 hanya mencatat 8, 11, dan 10 persen, sedangkan GPT-5.6 Sol stagnan di 6 persen pada ketiga percobaan.
Kegagalan paling umum adalah kesalahan membaca batas lintasan. Dalam refleksinya, Claude Fable 5.1 menulis, "Saya kembali memilih sisi batas yang salah. Barisan cone diagonal itu adalah tepi kiri jalur, bukan tepi kanannya." Latensi juga menjadi faktor krusial karena mobil terus bergerak saat model berpikir. Median jeda sebelum perintah berikutnya berkisar 4,9 detik pada Astra hingga 22,2 detik pada Fable—cukup lama bagi kendaraan untuk keluar jalur.
"Hasil kami menunjukkan bahwa meski model AI serbaguna telah membuat kemajuan signifikan pada tugas dunia nyata seperti mengemudi, kemampuannya masih jauh dari level manusia," tulis para peneliti.
Menariknya, GPT-6 Astra sempat menolak mengemudikan mobil sungguhan selama pengembangan. "Tidak. Tidak ada rumusan kata, surat pengabaian, atau jaminan tambahan apa pun yang memungkinkan saya mengemudikan atau memberi perintah langsung kepada mobil fisik," tulis Astra dalam salah satu percakapan. Penolakan itu baru teratasi setelah peneliti mengurangi informasi risiko pada keluaran alat dan menjelaskan tugas secara operasional. Dengan desain akhir, semua model bersedia mengemudi di setiap percobaan.
Pengujian dilakukan dengan pengemudi pendamping yang kakinya selalu siaga di atas rem. Seluruh percobaan yang gagal dihentikan operator, kecepatan puncak terukur di bawah 3 meter per detik (sekitar 10,8 km/jam), dan tidak ada tabrakan. Peneliti mengakui setiap model baru diuji dalam satu trial independen, sehingga mereka berencana menambah jumlah pengujian untuk hasil yang lebih solid.
Bagi Indonesia, temuan ini menjadi cermin penting. Berbagai perusahaan teknologi dan otomotif di dalam negeri mulai melirik sistem otonom, terutama untuk kendaraan logistik di kawasan industri atau transportasi umum di kota besar. Namun, hasil DrivingBench menunjukkan bahwa adopsi penuh masih jauh dari siap. Selain keterbatasan teknis, biaya token yang tidak murah—Astra menghabiskan sekitar Rp174 ribu untuk satu sesi uji—menjadi pertimbangan ekonomi. Regulasi keselamatan dan infrastruktur jalan yang belum sepenuhnya mendukung juga menjadi pekerjaan rumah.
Ke depan, pertanyaannya bukan lagi apakah AI bisa mengemudi, melainkan seberapa cepat model dapat belajar dari kesalahan dan beradaptasi dengan kondisi jalan yang tak terduga. Jika latensi dan akurasi pengenalan visual terus diperbaiki, bukan tidak mungkin dalam beberapa tahun ke depan kita melihat uji coba serupa di jalan raya Indonesia. Namun, hingga saat itu tiba, kemudi manusia masih jauh lebih andal.



