Editorial Ilmu Komputer & AI
Open AccessOA2026
Probing State Conformal Daring yang Sadar Risiko
Sertifikasi keandalan kasus terburuk untuk pengambilan keputusan sekuensial dengan model prediksi state
Pietro Talli; Petar Popovski; Osvaldo Simeoneยท 2026ยท DOI 10.48550/arXiv.2609.25889
Masalah inti
Agen otonom berbasis AI, yang sering dihosting di pusat data, harus memperoleh informasi state dari robot atau perangkat edge untuk mengeluarkan keputusan kontrol yang terinformasi. Mengelola ketidakpastian tentang state sangat konsekuensial dalam lingkungan yang kritis terhadap keselamatan, di mana jaminan kasus rata-rata tidak memadai. Makalah ini mempelajari proses pengambil keputusan sekuensial yang secara bersama memutuskan tindakan mana yang harus diambil dan kapan harus melakukan probing, dengan akses ke model prediksi state arbitrer. Penulis mengusulkan online conformal state probing (OCSP), sebuah kebijakan tindakan dan probing yang mensertifikasi tingkat keandalan kasus terburuk tanpa bergantung pada asumsi distribusi. OCSP dirancang untuk secara terbukti mengontrol missed query error (MQE), yang didefinisikan sebagai fraksi instans di mana probing akan bermanfaat, sekaligus meminimalkan laju probing. Keunggulan utamanya adalah OCSP dapat diterapkan pada kebijakan kontrol berbasis nilai yang telah dilatih sebelumnya tanpa memerlukan pelatihan ulang atau fine-tuning. Karya ini divalidasi melalui simulasi numerik untuk memverifikasi jaminan teoretis dan menilai trade-off ki
Inovasi
Penulis memvalidasi OCSP melalui simulasi numerik. Mereka memverifikasi bahwa jaminan teoretis berlaku: MQE tetap di bawah tingkat risiko target di berbagai pengaturan, dan laju probing jauh lebih rendah daripada strategi probing naif. Trade-off kinerja dinilai sebagai fungsi dari kalibrasi prediktor state. Ketika prediktor state terkalibrasi dengan baik, OCSP mencapai laju probing yang lebih rendah untuk jaminan MQE yang sama. Sebaliknya, dengan prediktor yang terkalibrasi buruk, OCSP secara otomatis meningkatkan probing untuk mempertahankan keandalan. Simulasi juga menunjukkan bahwa OCSP dapat diterapkan pada kebijakan kontrol berbasis nilai yang telah dilatih sebelumnya tanpa pelatihan ulang atau fine-tuning, mempertahankan kinerjanya sekaligus menambahkan jaminan keselamatan. Hasilnya mengonfirmasi bahwa OCSP memberikan solusi praktis dan terbukti andal untuk probing state yang sadar risiko dalam pengambilan keputusan sekuensial yang kritis terhadap keselamatan.
Agen otonom berbasis AI, yang sering dihosting di pusat data, harus memperoleh informasi state dari robot atau perangkat edge untuk mengeluarkan keputusan kontrol yang terinformasi. Mengelola ketidakpastian tentang state sangat konsekuensial dalam lingkungan yang kritis terhadap keselamatan, di mana jaminan kasus rata-rata tidak memadai. Makalah ini mempelajari proses pengambil keputusan sekuensial yang secara bersama memutuskan tindakan mana yang harus diambil dan kapan harus melakukan probing, dengan akses ke model prediksi state arbitrer. Penulis mengusulkan online conformal state probing (OCSP), sebuah kebijakan tindakan dan probing yang mensertifikasi tingkat keandalan kasus terburuk tanpa bergantung pada asumsi distribusi. OCSP dirancang untuk secara terbukti mengontrol missed query error (MQE), yang didefinisikan sebagai fraksi instans di mana probing akan bermanfaat, sekaligus meminimalkan laju probing. Keunggulan utamanya adalah OCSP dapat diterapkan pada kebijakan kontrol berbasis nilai yang telah dilatih sebelumnya tanpa memerlukan pelatihan ulang atau fine-tuning. Karya ini divalidasi melalui simulasi numerik untuk memverifikasi jaminan teoretis dan menilai trade-off kinerja sebagai fungsi dari kalibrasi prediktor state.
OCSP beroperasi dalam loop pengambilan keputusan sekuensial di mana pada setiap langkah waktu agen mengamati prediksi state (mungkin dari model yang telah dilatih sebelumnya), memutuskan apakah akan melakukan probing terhadap state sebenarnya, lalu memilih tindakan. Kebijakan ini dibangun di atas prinsip conformal prediction untuk memberikan jaminan bebas distribusi dan sampel terbatas pada MQE. Secara formal, misalkan
adalah state yang diprediksi pada waktu , dan adalah state sebenarnya. Keputusan probing menunjukkan apakah agen menanyakan state sebenarnya. MQE didefinisikan sebagai fraksi jangka panjang dari langkah waktu di mana probing akan bermanfaat (yaitu, di mana tindakan berdasarkan
berbeda dari tindakan optimal berdasarkan ). OCSP memelihara kalibrasi conformal daring yang beradaptasi dengan urutan yang diamati, memastikan bahwa MQE dibatasi oleh tingkat risiko yang ditentukan pengguna dengan probabilitas tinggi. Laju probing diminimalkan dengan batasan ini. Metode ini tidak memerlukan asumsi distribusi dan dapat membungkus kebijakan kontrol berbasis nilai yang telah dilatih sebelumnya. Arsitektur keseluruhannya diilustrasikan di bawah ini:
Mengapa penting
Makalah ini menjawab kesenjangan kritis dalam sistem otonom yang kritis terhadap keselamatan: kebutuhan akan jaminan keandalan kasus terburuk pada akuisisi informasi state. Dengan memanfaatkan conformal prediction daring, OCSP memberikan kontrol bebas distribusi atas missed query error, sebuah metrik yang secara langsung mengukur risiko bertindak berdasarkan informasi state yang salah. Kemampuan untuk membungkus kebijakan yang telah dilatih sebelumnya membuat OCSP dapat segera diterapkan pada sistem yang ada, mengurangi hambatan penerapan. Trade-off antara laju probing dan keandalan dikelola secara eksplisit, memungkinkan perancang sistem menetapkan tingkat risiko yang sesuai untuk aplikasi. Simulasi numerik mengonfirmasi klaim teoretis dan menyoroti pentingnya kalibrasi prediktor state. Pekerjaan selanjutnya dapat memperluas OCSP ke pengaturan multi-agen atau ke kasus di mana probing menimbulkan biaya yang heterogen. Secara keseluruhan, OCSP merupakan langkah signifikan menuju keandalan yang dapat disertifikasi pada agen otonom berbasis AI.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ