Voice AI Belum Capai Titik Ledak, Eksekutif Industri: Bukan Sekadar Bisa Bicara
Baca dalam 60 detik
- Investor telah menanamkan miliaran dolar ke startup voice AI, tetapi para eksekutif menilai teknologi ini masih jauh dari momen transformatif seperti ChatGPT.
- Tantangan utama bukan lagi kemampuan bicara dua arah, melainkan kecepatan penalaran, akurasi transkripsi, dan kemampuan membangun kepercayaan pengguna.
- Transparansi dan identifikasi pembicara menjadi prasyarat adopsi luas, terutama di sektor layanan pelanggan dan rapat perusahaan.

Industri voice AI sedang mengalami euforia investasi yang luar biasa. Miliaran dolar mengalir ke startup yang mengembangkan model suara, layanan pelanggan berbasis AI, hingga alat notulen rapat dan dikte otomatis. Setiap pekan muncul model atau alat baru yang diklaim mampu berbicara dan merespons seperti manusia. Namun, di balik gemerlap itu, para pelaku industri justru menilai teknologi ini belum mencapai titik ledaknya.
Shawn Wen, Chief Technology Officer platform voice AI perusahaan PolyAI, mengungkapkan bahwa meskipun model full-duplex—yang dapat berbicara sambil mendengarkan—sudah tersedia, voice AI belum memiliki "momen ChatGPT" yang mengubah lanskap secara fundamental. Ia menekankan bahwa tantangan berikutnya adalah membuat penalaran menjadi sangat cepat agar model dapat mengambil jawaban dengan sigap dan percakapan terasa alami. Pernyataan itu disampaikannya dalam sebuah sesi di konferensi HumanX bulan lalu.
Menurut Wen, agen AI di layanan pelanggan tidak boleh terdengar seperti robot dan harus mampu memberikan keyakinan kepada penelepon bahwa masalah mereka dapat diselesaikan. Ia memprediksi bahwa tahap selanjutnya akan berbeda: begitu kualitas suara cukup baik dan pelanggan mau berinteraksi untuk dua atau tiga putaran awal, kepercayaan akan tumbuh. Seiring waktu, pelanggan akan merasa tidak perlu berbicara dengan manusia jika agen AI mampu menyelesaikan masalah mereka.
Alex Gay, Chief Marketing Officer Otter, sebuah alat notulen rapat berbasis AI, menambahkan bahwa identifikasi pembicara, penangkapan maksud, dan konversi ke pengetahuan organisasi adalah langkah kunci untuk mengaktifkan otomatisasi. Perusahaan itu juga tengah mengembangkan digital twin yang dapat mewakili seseorang dalam rapat. Gay menekankan bahwa suara yang dihasilkan harus mampu mengekspresikan emosi seperti halnya percakapan manusia.
"Jika Anda tidak dapat merasakan hubungan yang mendasari percakapan dengan avatar, maka itu hanya chatbot tanya-jawab biasa," ujar Gay, menggambarkan pentingnya kedalaman interaksi.
Meskipun model voice AI telah meningkat, asisten AI sering kali tidak memahami pengguna, atau alat notulen menampilkan transkrip dan ringkasan yang salah. Wen menyoroti bahwa model Automatic Speech Recognition (ASR) kerap melewatkan kata kunci penting, sehingga konteks keseluruhan tidak tertangkap dengan baik. Gay sepakat dan menambahkan bahwa perusahaan terus berupaya memperbaiki transkripsi. Ia menegaskan bahwa transkripsi bukanlah tujuan akhir, melainkan lapisan awal untuk mendorong produktivitas. Namun, jika akurasi transkripsi awal tidak memadai, semua tindakan lanjutan menjadi cacat dan kepercayaan pada platform akan hilang.
Isu transparansi juga menjadi perhatian. Alat voice AI harus mendeklarasikan kepada pelanggan bahwa mereka sedang direkam atau berbicara dengan AI. Otter, misalnya, ingin menanamkan kepercayaan pada peserta rapat, bahkan ketika bot tidak hadir, dengan memberi tahu semua orang di obrolan bahwa rapat sedang direkam. Wen dari PolyAI juga menekankan pentingnya menegaskan bahwa lawan bicara adalah AI dalam panggilan perusahaan.
Bagi Indonesia, gelombang voice AI ini membuka peluang sekaligus tantangan. Sektor layanan pelanggan dan BPO di dalam negeri dapat memanfaatkan teknologi ini untuk meningkatkan efisiensi, tetapi adopsi masif bergantung pada kemampuan model memahami bahasa Indonesia dengan baik, termasuk logat daerah. Regulasi perlindungan data pribadi juga menuntut kejelasan soal perekaman dan persetujuan pengguna. Tanpa itu, kepercayaan pasar akan sulit terbangun.
Ke depan, pertanyaannya bukan lagi apakah voice AI akan menjadi antarmuka utama, melainkan seberapa cepat industri dapat mengatasi hambatan penalaran, akurasi, dan transparansi. Jika para eksekutif ini benar, momen ledak voice AI mungkin masih menunggu di tikungan—dan persaingan akan dimenangkan oleh mereka yang mampu membuat percakapan terasa benar-benar manusiawi.



