Fisikawan Temukan Rumus Prediksi Kapan Chatbot AI 'Membelot'
Baca dalam 60 detik
- Dua fisikawan mengembangkan formula matematis sederhana untuk memprediksi titik kritis ketika model AI beralih dari jawaban aman ke berpotensi berbahaya.
- Rumus ini diuji pada tujuh model AI terbuka dan akurat dalam 18 dari 19 kasus, serta mengungkap bahwa urutan percakapan sama pentingnya dengan isi pertanyaan.
- Temuan ini memicu urgensi pengawasan AI offline, terutama di sektor sensitif seperti medis, hukum, dan militer, serta mendorong pengembangan sistem peringatan dini di perangkat.

Dua fisikawan dari George Washington University mengklaim telah menemukan formula matematis sederhana yang mampu memprediksi kapan sebuah model kecerdasan buatan (AI) akan beralih dari respons yang diharapkan ke keluaran yang berpotensi merugikan. Riset yang dipublikasikan di jurnal Patterns ini menyoroti celah keamanan pada chatbot AI, terutama yang beroperasi secara offline tanpa pengawasan ketat.
Penelitian ini berangkat dari kenyataan bahwa semakin banyak perangkat genggam kini menjalankan model AI kecil yang tidak selalu terhubung ke cloud. Menurut tim peneliti, perangkat semacam itu minim pengawasan keselamatan, sehingga berisiko memberikan saran yang secara faktual benar namun berbahaya—misalnya dorongan untuk menyakiti diri sendiri, nasihat finansial yang menyesatkan, atau instruksi ekstremis.
Neil Johnson, salah satu penulis studi, menyatakan bahwa pihaknya menemukan "celah" yang membuat keluaran AI berbalik dari yang diinginkan menjadi tidak diinginkan. "Sampai sekarang, tidak ada yang bisa mengatakan kapan pembalikan itu akan terjadi," ujarnya. Johnson menambahkan bahwa jawaban yang berbahaya tidak selalu berarti salah; bisa jadi akurat tetapi tidak diinginkan atau berisiko.
Frank Yingjie Huo, rekan penulis dan mahasiswa PhD di universitas yang sama, menjelaskan bahwa timnya melacak fenomena ini hingga ke unit terkecil dari mekanisme "attention" dalam model. "Kami menurunkan rumus titik kritis untuk kapan celah itu terbuka dan keluaran AI berbalik menjadi tidak diinginkan," kata Huo. "Rumus ini memberi tahu Anda apakah AI akan segera berbalik atau terlebih dahulu memberikan serangkaian jawaban yang dapat diterima lalu berubah."
Yang mengejutkan, penelitian ini menemukan bahwa urutan percakapan sama pentingnya dengan konten. Ketika tim mengajukan pertanyaan yang sama tentang vaksin, menyakiti orang lain, dan menyakiti diri sendiri dalam dua urutan berbeda kepada AI yang sama, hasilnya kontras: dalam satu urutan, AI memberikan jawaban tidak diinginkan untuk setiap pertanyaan; dalam urutan lain, jawabannya dapat diterima. "Bagian yang mengerikan adalah ini bisa terjadi setelah AI memberikan beberapa jawaban yang sempurna, sehingga Anda terlena dan mempercayainya," ujar Huo. "Dan setelah berbalik, setiap jawaban tidak diinginkan menyeret jawaban berikutnya semakin jauh ke bawah."
"Kami menemukan celah yang membuat keluaran AI berbalik dari yang Anda inginkan ke yang tidak Anda inginkan—keluaran yang bisa benar secara faktual namun berbahaya, entah itu dorongan untuk menyakiti diri sendiri atau nasihat menyesatkan kepada dokter, tentara, atau pengacara." — Neil Johnson, penulis studi.
Johnson menganalogikan perilaku AI seperti lanskap dengan lembah-lembah yang mewakili jawaban berbeda. Beberapa lembah berisi jawaban yang diinginkan, sementara yang lain berisi jawaban berbahaya. Pertanyaannya adalah kapan AI akan tergelincir dari lembah aman ke lembah berisiko. "Bidang saya, fisika, telah menghabiskan puluhan tahun menjelaskan perilaku material rumit dengan memahami satu atom perwakilan. Kami melakukan hal yang sama di sini: pahami satu kepala atensi efektif, dan pembalikan seluruh mesin akan mengikuti," jelasnya.
Tim peneliti berharap temuan ini meningkatkan kesadaran bahwa percakapan dengan AI dapat bergeser ke wilayah berbahaya seiring waktu. Mereka juga membayangkan bahwa beberapa perhitungan sederhana dapat memungkinkan ponsel masa depan dilengkapi "lampu peringatan" bawaan untuk mendeteksi potensi pembalikan. Namun, mereka mengakui bahwa penerapan praktis masih memerlukan pengembangan lebih lanjut, terutama karena formula ini bersifat umum dan tidak bergantung pada definisi spesifik tentang "tidak diinginkan."
Bagi Indonesia, temuan ini relevan mengingat adopsi AI yang cepat di berbagai sektor, termasuk layanan kesehatan dan keuangan. Banyak aplikasi AI lokal mungkin beroperasi dengan sumber daya terbatas dan pengawasan keamanan yang belum mumpuni. Regulator perlu mempertimbangkan kerangka pengujian ketahanan model AI terhadap skenario percakapan yang dapat memicu keluaran berbahaya, terutama untuk penggunaan offline di daerah dengan konektivitas terbatas. Tanpa langkah antisipatif, risiko penyalahgunaan atau kerugian akibat saran AI yang menyesatkan bisa meningkat.
Ke depan, pertanyaannya bukan hanya apakah formula ini dapat diintegrasikan ke dalam sistem AI komersial, tetapi juga seberapa cepat pembuat kebijakan dan pengembang dapat bekerja sama untuk menutup celah keamanan yang telah lama terabaikan. Jika prediksi sederhana ini terbukti andal dalam skala luas, ia bisa menjadi alat penting dalam memastikan AI tetap bermanfaat tanpa mengorbankan keselamatan pengguna.



