Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Ketika Panggilan Alat Berhasil tetapi Alur Kerja Gagal: Anomali di Batas Agen-Alat

Model riwayat efek dan katalog delapan anomali efek eksternal mengungkap mengapa pemanggilan alat kotak hitam tidak dapat menjamin kebenaran alur kerja, dan mengapa kontrak transaksional yang dapat digunakan ulang diperlukan di batas alat.
Artem Trofimov; Boris Novikovยท 2026ยท DOI 10.48550/arXiv.2609.15397

Masalah inti

Agen AI semakin banyak menjalankan alur kerja berdurasi panjang yang mengeksternalisasi efek melalui alat yang disediakan secara independen. Di bawah percobaan ulang, eksekusi spekulatif, konkurensi, dan kegagalan parsial, keadaan eksternal yang dihasilkan mungkin tidak konsisten dengan resolusi yang dimaksudkan oleh alur kerja: efek yang diperlukan mungkin hilang atau terduplikasi, efek yang dibatalkan mungkin bertahan, dan efek yang telah dikomit mungkin bergantung pada keadaan sementara yang kemudian ditarik kembali.

Model transaksi lanjutan menangani kegagalan terkait, tetapi mereka mengasumsikan bahwa operasi tingkat bawah mengekspos semantik yang mereka andalkan: apakah suatu efek terjadi, apakah efek itu dapat dikompensasi, distage, atau diurutkan ulang dengan aman. Antarmuka agen-alat bersama biasanya tidak demikian. Makalah ini menanyakan jaminan apa yang mungkin ketika alat dipanggil sebagai kotak hitam, dan seberapa banyak semantik yang diperlukan dapat dinyatakan dalam antarmuka alat bersama yang banyak digunakan.

Para penulis menyumbangkan model riwayat efek yang memisahkan peristiwa di dunia eksternal dari pengamatan runtime terhadapnya, serta katalog delapan anomal

Inovasi

Analisis empiris terhadap 98.291 alat MCP menunjukkan bahwa kosakata anotasi standar banyak dihasilkan. Namun, bidang-bidang tersebut hanya memberikan petunjuk tingkat panggilan yang kasar. Tidak ada kemampuan batas yang diperlukan yang sepenuhnya dapat dinyatakan dalam antarmuka bersama.

Secara spesifik, anotasi dapat menunjukkan bahwa suatu panggilan bersifat hanya-baca atau destruktif, atau bahwa panggilan itu mungkin berinteraksi dengan dunia eksternal, tetapi anotasi tersebut tidak dapat menyatakan apakah efek tertentu terjadi, apakah efek itu dapat dikompensasi, distage, atau diurutkan ulang dengan aman. Akibatnya, runtime secara umum tidak dapat mengecualikan delapan anomali tersebut hanya dengan pemanggilan alat kotak hitam.

Para penulis mengidentifikasi empat titik di mana pemanggilan kotak hitam tidak dapat memberikan jaminan umum. Titik-titik ini berkaitan dengan kemampuan yang memerlukan informasi di luar petunjuk tingkat panggilan: terjadinya efek, kemampuan kompensasi, kemampuan stage, dan kemampuan pengurutan ulang. Pengukuran menegaskan bahwa antarmuka bersama tidak memiliki ekspresivitas untuk menyampaikan sifat-sifat ini.

Hasil ini memotivasi kontrak transaksio

Agen AI semakin banyak menjalankan alur kerja berdurasi panjang yang mengeksternalisasi efek melalui alat yang disediakan secara independen. Di bawah percobaan ulang, eksekusi spekulatif, konkurensi, dan kegagalan parsial, keadaan eksternal yang dihasilkan mungkin tidak konsisten dengan resolusi yang dimaksudkan oleh alur kerja: efek yang diperlukan mungkin hilang atau terduplikasi, efek yang dibatalkan mungkin bertahan, dan efek yang telah dikomit mungkin bergantung pada keadaan sementara yang kemudian ditarik kembali.
Model transaksi lanjutan menangani kegagalan terkait, tetapi mereka mengasumsikan bahwa operasi tingkat bawah mengekspos semantik yang mereka andalkan: apakah suatu efek terjadi, apakah efek itu dapat dikompensasi, distage, atau diurutkan ulang dengan aman. Antarmuka agen-alat bersama biasanya tidak demikian. Makalah ini menanyakan jaminan apa yang mungkin ketika alat dipanggil sebagai kotak hitam, dan seberapa banyak semantik yang diperlukan dapat dinyatakan dalam antarmuka alat bersama yang banyak digunakan.

Mengapa penting

Wawasan utama makalah ini adalah bahwa panggilan alat yang berhasil tidak menyiratkan alur kerja yang berhasil. Kesenjangan antara pengamatan runtime dan dunia eksternal adalah tempat anomali muncul. Model riwayat efek membuat kesenjangan ini eksplisit dengan memisahkan peristiwa dari pengamatan.

Katalog delapan anomali menyediakan cara sistematis untuk bernalar tentang kegagalan efek eksternal. Dengan menurunkan kemampuan batas yang diperlukan untuk mengecualikan setiap anomali, para penulis menunjukkan bahwa masalahnya bukan sekadar logika percobaan ulang yang lebih baik atau model transaksi yang lebih kuat. Ini adalah masalah semantik yang hilang di antarmuka.

Studi empiris terhadap alat MCP menunjukkan bahwa praktik saat ini tidak menyediakan semantik ini. Kosakata anotasi banyak digunakan tetapi kasar. Ini bukan kritik terhadap penulis alat individual; ini mencerminkan tidak adanya standar untuk menyatakan sifat transaksional.

Arah yang diusulkan adalah kontrak transaksional yang dapat digunakan ulang di batas alat. Kontrak semacam itu akan memungkinkan alat mendeklarasikan apakah suatu efek terjadi, apakah efek itu dapat dikompensasi, distage, atau diurutkan ulang dengan aman. Dengan deklarasi ini, runtime dapat menerapkan model transaksi lanjutan dan mengecualikan anomali secara umum.

Makalah ini meninggalkan pertanyaan terbuka tentang bagaimana merancang dan menstandarkan kontrak semacam itu, bagaimana memverifikasi kepatuhan, dan bagaimana menangani alat yang tidak dapat memberikan jaminan yang diperlukan. Meskipun demikian, makalah ini memberikan diagnosis yang jelas dan jalur yang berprinsip ke depan untuk membangun alur kerja agen yang andal.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ