Editorial Ilmu Komputer & AI
Open AccessOA2026
Titik Buta Delegasi: Mengaudit Keputusan Produk dari Pilihan Agen
Alur kerja audit spesifik keputusan yang memetakan kanal observasi dan kontras nilai produk ke interval yang kompatibel serta populasi saksi, mengungkap keputusan yang belum terselesaikan meskipun akurasi eksekusi tinggi.
Shivam Guptaยท 2026ยท DOI 10.48550/arXiv.2609.26642
Masalah inti
Makalah ini membahas titik buta kritis dalam mengevaluasi agen AI: eksekusi yang berhasil tidak menjamin bahwa pilihan agen mengungkap peningkatan produk mana yang akan dihargai pengguna. Penulis membingkainya sebagai masalah audit spesifik keputusan, di mana tujuannya adalah memetakan kanal observasi yang dideklarasikan dan kontras nilai produk ke interval yang kompatibel serta populasi saksi. Karya ini dibangun di atas teori identifikasi dan keputusan yang mapan, tetapi kontribusi utamanya adalah alur kerja pengukuran yang dapat dieksekusi dan studi terkontrol tentang batasannya. Pertanyaan utamanya adalah apakah perilaku agen dapat digunakan untuk menyimpulkan preferensi pengguna terhadap keputusan produk, dan dalam kondisi apa inferensi tersebut valid. Penulis memotivasi perlunya audit karena evaluasi saat ini berfokus pada akurasi eksekusi, yang mungkin ortogonal terhadap identifikasi yang relevan dengan keputusan. Mereka mengusulkan tanda terima keputusan berlabel sumber dan penampil offline untuk memeriksa audit, menekankan pentingnya mendiagnosis mengapa suatu keputusan belum terselesaikan sebelum mengumpulkan lebih banyak telemetri. Studi ini sepenuhnya sintetis, tanpa par
Inovasi
Hasil utamanya sangat jelas: seluruh 36 interval primer konservatif tetap belum terselesaikan meskipun akurasi eksekusi berbeda antar model. Ini berarti bahwa bahkan ketika agen mengeksekusi tugas dengan akurasi tinggi, pilihan mereka tidak mengidentifikasi peningkatan produk mana yang dihargai pengguna. Tindak lanjut eksploratif dengan preferensi yang diberikan hanya menyelesaikan tiga dari sembilan perbandingan per model, menunjukkan bahwa data preferensi tambahan membantu tetapi tidak cukup. Sebaliknya, ekstraktor deterministik menyelesaikan tujuh dari sembilan perbandingan tanpa pemanggilan model atau observasi kalibrasi, mengungkap ketidakpastian yang tidak perlu yang diperkenalkan oleh laporan yang dihasilkan model. Simulasi multinomial lebih lanjut mengungkapkan bahwa ambiguitas struktural, identifikasi lemah, dan presisi kalibrasi terbatas masing-masing berkontribusi terhadap keputusan yang belum terselesaikan. Penulis menyediakan tanda terima keputusan berlabel sumber yang mencatat asal setiap masukan yang relevan dengan keputusan, dan penampil offline untuk memeriksa audit. Hasil ini memotivasi pelestarian masukan terstruktur yang relevan dengan keputusan dan mendiagnosis
Makalah ini membahas titik buta kritis dalam mengevaluasi agen AI: eksekusi yang berhasil tidak menjamin bahwa pilihan agen mengungkap peningkatan produk mana yang akan dihargai pengguna. Penulis membingkainya sebagai masalah audit spesifik keputusan, di mana tujuannya adalah memetakan kanal observasi yang dideklarasikan dan kontras nilai produk ke interval yang kompatibel serta populasi saksi. Karya ini dibangun di atas teori identifikasi dan keputusan yang mapan, tetapi kontribusi utamanya adalah alur kerja pengukuran yang dapat dieksekusi dan studi terkontrol tentang batasannya. Pertanyaan utamanya adalah apakah perilaku agen dapat digunakan untuk menyimpulkan preferensi pengguna terhadap keputusan produk, dan dalam kondisi apa inferensi tersebut valid. Penulis memotivasi perlunya audit karena evaluasi saat ini berfokus pada akurasi eksekusi, yang mungkin ortogonal terhadap identifikasi yang relevan dengan keputusan. Mereka mengusulkan tanda terima keputusan berlabel sumber dan penampil offline untuk memeriksa audit, menekankan pentingnya mendiagnosis mengapa suatu keputusan belum terselesaikan sebelum mengumpulkan lebih banyak telemetri. Studi ini sepenuhnya sintetis, tanpa partisipan manusia atau hasil pelanggan nyata, sehingga menjamin eksperimen yang etis dan dapat direproduksi.
Metodologi berpusat pada audit spesifik keputusan yang memformalkan hubungan antara pilihan agen dan kontras nilai produk. Misalkan
adalah himpunan tindakan agen,
himpunan peningkatan produk, dan
fungsi nilai pengguna. Kanal observasi
memetakan tindakan ke hasil yang dapat diamati. Audit berupaya mengidentifikasi tanda
untuk dua varian produk , hanya menggunakan observasi dari . Penulis mendefinisikan interval yang kompatibel untuk berdasarkan data yang diamati dan populasi saksiโhimpunan tipe pengguna yang konsisten dengan observasi. Alur kerja meliputi: (1) mendeklarasikan kanal observasi dan kontras nilai produk, (2) mengumpulkan pilihan agen dalam kondisi terkontrol, (3) menghitung interval yang kompatibel dan populasi saksi, dan (4) mendiagnosis keputusan yang belum terselesaikan. Studi terkontrol menggunakan eksperimen beku dengan 4.800 permintaan ke dua snapshot model yang dipin pada tugas sintetis bersama. Tindak lanjut eksploratif dengan 2.400 panggilan mencatat preferensi yang diberikan dan menyelesaikan tiga dari sembilan perbandingan per model. Ekstraktor deterministik menyelesaikan tujuh dari sembilan tanpa pemanggilan model atau observasi kalibrasi. Selain itu, 14.400 simulasi multinomial terkontrol membedakan ambiguitas struktural dari identifikasi lemah dan presisi kalibrasi terbatas. Audit diimplementasikan sebagai alur kerja yang dapat dieksekusi dengan penampil offline untuk pemeriksaan.
Mengapa penting
Analisis menyoroti titik buta fundamental dalam evaluasi agen: akurasi eksekusi bukan proksi untuk identifikasi yang relevan dengan keputusan. Penulis berargumen bahwa bidang ini harus beralih dari mengukur keberhasilan tugas ke mengaudit apakah pilihan agen dapat menyelesaikan keputusan produk. Keberhasilan ekstraktor deterministik menunjukkan bahwa sebagian besar ketidakpastian bersifat artifisial, diperkenalkan oleh laporan yang dihasilkan model daripada melekat pada data. Ini menyiratkan bahwa melestarikan masukan terstruktur dan menggunakan ekstraksi deterministik dapat secara dramatis meningkatkan penyelesaian keputusan. Simulasi multinomial menyediakan kerangka kerja untuk mendiagnosis sumber keputusan yang belum terselesaikan: ambiguitas struktural (kanal observasi tidak dapat membedakan antara varian produk), identifikasi lemah (data tidak cukup untuk mempersempit interval), dan presisi kalibrasi terbatas (kebisingan dalam proses kalibrasi). Penulis mengusulkan tanda terima keputusan berlabel sumber sebagai alat praktis untuk audit, yang mencatat asal setiap masukan yang relevan dengan keputusan dan memungkinkan reproduktibilitas. Penampil offline memungkinkan pemangku kepentingan memeriksa audit dan memahami mengapa suatu keputusan belum terselesaikan. Makalah ini menyimpulkan bahwa sebelum mengumpulkan lebih banyak telemetri, praktisi harus mendiagnosis alasan keputusan yang belum terselesaikan dan mempertimbangkan apakah kanal observasi memadai. Karya ini memiliki implikasi untuk pengembangan produk AI, di mana perilaku agen sering digunakan untuk menyimpulkan preferensi pengguna, dan untuk desain protokol evaluasi yang memprioritaskan identifikasi yang relevan dengan keputusan di atas akurasi eksekusi.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ