Jev, Model AI yang Tak Bisa Ngobrol Tapi Jauh Lebih Cepat dan Murah dari GPT
Baca dalam 60 detik
- TypeSafe AI merilis Jev, model AI yang hanya menghasilkan keputusan terstruktur tanpa teks naratif, dengan harga $0,042 per juta token input.
- Model ini menawarkan kecepatan 5–18 kali lipat dan biaya hingga 445 kali lebih murah dibanding model bahasa besar, tetapi akurasinya masih di bawah pesaing.
- Tantangan utama Jev adalah keamanan dan keandalan keputusan otomatis, terutama untuk aplikasi kritis seperti transaksi keuangan dan perintah sistem.

Startup TypeSafe AI, yang didirikan oleh mantan peneliti OpenAI Diogo Almeida, resmi meluncurkan Jev—sebuah model kecerdasan buatan yang tidak dirancang untuk mengobrol, menulis email, atau menghasilkan kode. Sebaliknya, Jev hanya mengeluarkan keputusan terstruktur yang bisa langsung dieksekusi oleh perangkat lunak atau agen otomatis. Harga yang ditawarkan sangat agresif: $0,042 per juta token input, tanpa biaya tambahan untuk output. Bagi pengembang yang selama ini membayar mahal model bahasa besar hanya untuk mendapatkan beberapa kata klasifikasi, Jev menawarkan proposisi yang menggoda.
Model ini mengklasifikasikan informasi, memberikan skor, dan mengembalikan probabilitas tanpa perlu menghasilkan paragraf penjelasan seperti yang biasa dilakukan GPT atau Claude. Pendekatan ini langsung menarik perhatian komunitas pengembang. Pranit Sharma, engineer di Vercel, melaporkan bahwa mengganti model bahasa konvensional dengan Jev untuk klasifikasi keamanan perintah menghasilkan respons 5 hingga 18 kali lebih cepat, dengan akurasi yang justru meningkat. Pengembang lain menemukan bahwa Jev mengklasifikasikan email bisnis dengan biaya jauh lebih murah dibanding Gemini milik Google, meski Gemini sedikit lebih akurat.
Antusiasme awal sempat membuat API TypeSafe kewalahan melayani permintaan, menurut laporan TechCrunch. Bagi perusahaan yang menjalankan sistem otomatis dengan ribuan keputusan per jam, eksperimen ini menunjukkan cara memangkas biaya tugas AI rutin tanpa harus membangun ulang perangkat lunak. Namun, ketergantungan pada model pihak ketiga untuk pengambilan keputusan tetap menyimpan risiko operasional.
Pertanyaan besarnya bukan sekadar soal harga. Industri teknologi telah menghabiskan bertahun-tahun menyempurnakan model bahasa yang bisa bernalar, menulis, dan berbicara dengan manusia. TypeSafe justru menempuh jalur sempit: membangun model yang hanya fokus pada penilaian cepat dan terstruktur di dalam perangkat lunak yang sudah ada. Jev mendukung tiga tipe pertanyaan—Choice (memilih dari opsi yang ditentukan), Score (mengevaluasi berdasarkan skala numerik), dan Noul (memperkirakan probabilitas kebenaran suatu pernyataan).
TypeSafe menyebut Jev sebagai "System One Model," meminjam terminologi psikolog Daniel Kahneman tentang berpikir cepat dan intuitif versus penalaran lambat dan deliberatif. Perusahaan mengklaim Jev menggunakan arsitektur baru dan metode pelatihan bernama Reinforcement Learning for Calibrated Decisions (RLCD) yang dirancang agar estimasi probabilitasnya lebih mencerminkan ketidakpastian. "Anggap Jev sebagai panggilan fungsi kecerdasan frontier: masukan keadaan tak terstruktur, keluaran keputusan probabilistik bertipe," ujar Almeida dalam pengumuman peluncuran.
Meski cepat dan murah, akurasi Jev menuai sorotan. Hasil yang dipublikasikan TypeSafe sendiri menunjukkan trade-off: pengujian independen Explainx.ai mencatat skor agregat 67,8% untuk Jev, sementara pembanding terkuat dalam evaluasi perusahaan mencapai 74,1%. Perbedaan akurasi ini patut diperhatikan. Aplikasi yang menyortir pesan pelanggan prioritas rendah mungkin bisa mentoleransi kesalahan klasifikasi sesekali. Namun sistem yang mengotorisasi transaksi keuangan atau perintah perangkat lunak yang berpotensi merusak memiliki ruang kesalahan yang sangat kecil.
"Kami memiliki petir dalam botol, tetapi tidak berguna," kata Almeida kepada TechCrunch, menggambarkan frustrasinya terhadap keterbatasan AI percakapan untuk otomatisasi perangkat lunak.
Kekhawatiran lain muncul dari klaim TypeSafe bahwa Jev tidak bisa berhalusinasi. Klaim ini merujuk pada ketidakmampuan Jev menghasilkan respons di luar struktur yang telah ditentukan—jika aplikasi meminta model memilih dari lima kategori, Jev tidak bisa mengarang kategori keenam. Namun, Jev tetap bisa memilih kategori yang salah atau memberikan probabilitas tinggi pada jawaban yang keliru. Jaminan TypeSafe menyangkut struktur respons, bukan akurasi faktual keputusan.
Yang lebih kritis, investigasi VentureBeat pada 21 September mengungkap eksperimen dengan perintah komputer yang berpotensi merusak. Jev awalnya memberikan probabilitas 0,76 untuk memblokir perintah tersebut. Setelah seorang engineer menambahkan pesan otorisasi palsu ke dalam informasi yang disajikan ke model, probabilitas pemblokirannya turun menjadi 0,48. Eksperimen ini memang hanya melibatkan satu perintah dan tidak bisa menentukan seberapa sering serangan semacam itu berhasil. Namun, ini menunjukkan bahwa informasi berbahaya yang dimasukkan ke dalam input aplikasi dapat memengaruhi penilaian Jev. Sistem keamanan yang menyetujui perintah tidak sah tidak menjadi lebih andal hanya karena keputusannya diambil dalam 70 milidetik.
Bagi Indonesia, fenomena Jev mencerminkan pergeseran penting dalam ekonomi AI global yang cepat atau lambat akan merembet ke pasar domestik. Selama ini perusahaan teknologi Tanah Air—dari startup fintech hingga e-commerce—mengandalkan model bahasa besar untuk berbagai tugas, mulai dari layanan pelanggan otomatis hingga analisis sentimen. Biaya inferensi yang tinggi sering menjadi penghalang adopsi AI di skala besar. Jika model spesialis seperti Jev benar-benar mampu memangkas biaya hingga ratusan kali lipat, gelombang otomatisasi berbasis keputusan bisa menjangkau usaha kecil dan menengah yang sebelumnya tak terjangkau. Namun, ketergantungan pada API pihak ketiga untuk keputusan kritis—seperti verifikasi transaksi atau klasifikasi risiko—menuntut kehati-hatian ekstra, terutama terkait kedaulatan data dan regulasi perlindungan konsumen.
TypeSafe menamai Jev setelah ekonom abad ke-19 William Stanley Jevons, yang karyanya meneliti bagaimana peningkatan efisiensi sumber daya justru dapat mendorong konsumsi lebih besar. Perusahaan berharap efek serupa terjadi di AI: biaya inferensi yang lebih rendah akan membuat keputusan cerdas layak diterapkan di proses perangkat lunak yang selama ini mengandalkan aturan kaku atau intervensi manusia. LangChain, misalnya, telah menguji Jev untuk mengevaluasi perilaku agen AI lain. Dalam eksperimen 20 September dengan lima respons agen cuaca, Jev mencocokkan penilaian biner manusia pada 500 keputusan berulang, dengan rata-rata 0,44 detik dan biaya $0,00035 per evaluasi. Meski demikian, uji ini hanya mencakup satu agen dan kumpulan tugas terbatas—konsistensi tidak selalu berarti kebenaran.
Ke depan, metrik paling menentukan bagi perusahaan yang mempertimbangkan Jev mungkin bukan kecepatan atau harga, melainkan biaya dari keputusan yang salah. Kesalahan routing bisa mengirim pelanggan ke departemen yang keliru. Klasifikasi keamanan yang salah bisa mengotorisasi perintah destruktif. Keduanya adalah risiko yang sangat berbeda, dan model yang sama belum tentu cocok untuk keduanya. TypeSafe memang telah membuat eksperimen ini luar biasa murah. Apakah Jev akan menjadi perangkat tetap dalam perangkat lunak enterprise akan bergantung pada apa yang ditemukan pengembang setelah harga promosi dan tolok ukur awal berganti dengan beban produksi yang berkelanjutan. Mampukah model spesialis seperti Jev menggantikan ketergantungan pada model bahasa serbaguna, atau justru menjadi pelengkap dalam ekosistem AI yang semakin berlapis?



