Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Ketergantungan Waktu Verifikasi pada Evaluator yang Menghilang

Protokol operasional untuk mempertahankan bukti keadaan keputusan ketika model yang menghasilkan keputusan berkonsekuensi tidak lagi dapat diakses dalam versi dan konteks eksekusi yang sama
Ho Wa Ku; Jameel Ahmed Siddiquiยท 2026ยท DOI 10.48550/arXiv.2608.29912

Masalah inti

Kerangka tata kelola dan assurance AI sering kali bertumpu pada asumsi yang tenang: bahwa keputusan berkonsekuensi yang dimediasi model dapat direkonstruksi atau diuji setelah fakta. Ku dan Siddiqui berargumen bahwa asumsi ini dapat gagal justru ketika paling penting โ€” ketika evaluator yang menghasilkan keputusan tersebut tidak lagi dapat diakses dalam versi dan konteks eksekusi yang sama. Makalah ini menempatkan masalah ini dalam Execution Governance (EG) 3.0 dan memperkenalkan tiga konstruk waktu verifikasi: **Decision-State Commitment**, **Independent Verifiability**, dan **Counterfactual Auditability**. Pertanyaan utamanya bukan apakah suatu keputusan telah diotorisasi, melainkan apakah verifier yang dipercaya secara terpisah dapat kemudian membuktikan apa yang terikat pada waktu otorisasi. Penulis membingkai kontribusi mereka sebagai protokol waktu verifikasi operasional plus **Verification-Time Preservation Package (VTPP)** opsional, yang menetapkan bukti apa yang harus diikat, apa yang dapat dibuktikan oleh verifier, bagaimana uji stabilitas dan uji kontrafaktual berpasangan harus dikalibrasi, dan pemeriksaan semantik mana yang tetap berada di luar validitas JSON Schema. Sec

Inovasi

Pemrosesan ulang independen atas artefak Study 2 yang dirilis mereproduksi dua perbandingan perilaku dalam keluarga yang asli:

- **Pembalikan keputusan modal 52,0%** untuk Llama 3.1 8B versus Llama 3.3 70B (26/50).
- **Pembalikan keputusan modal 30,0%** untuk GPT-OSS 20B versus GPT-OSS 120B (15/50).

Baseline yang dikoreksi menetapkan bahwa ini adalah **perbandingan dalam keluarga**, bukan suksesi yang ditetapkan penyedia. Pemasangan ulang pasca-hoc terhadap jalur migrasi yang ditetapkan Groq menghasilkan pembalikan **64,0%** dan **38,0%**, tetapi angka-angka ini tetap deskriptif karena parameter pemanggilan lintas keluarga bersifat asimetris.

Sensus pensiun 22 peristiwa secara independen dihitung ulang menjadi:

- Median: **16,45 bulan**
- Rata-rata: **18,72 bulan**
- Rentang: **3,9โ€“40,3 bulan**
- **17/22** interval di bawah 24 bulan

Sensus tersebut juga menunjukkan bahwa ketersediaan evaluator dapat berbeda menurut permukaan layanan, yang berarti model nominal yang sama dapat tetap terjangkau melalui satu antarmuka sementara menghilang dari antarmuka lain. Ketergantungan pada permukaan ini menyulitkan asumsi masa hidup tunggal dalam perencanaan verifikasi.

Kerangka tata kelola dan assurance AI sering kali bertumpu pada asumsi yang tenang: bahwa keputusan berkonsekuensi yang dimediasi model dapat direkonstruksi atau diuji setelah fakta. Ku dan Siddiqui berargumen bahwa asumsi ini dapat gagal justru ketika paling penting โ€” ketika evaluator yang menghasilkan keputusan tersebut tidak lagi dapat diakses dalam versi dan konteks eksekusi yang sama. Makalah ini menempatkan masalah ini dalam Execution Governance (EG) 3.0 dan memperkenalkan tiga konstruk waktu verifikasi: **Decision-State Commitment**, **Independent Verifiability**, dan **Counterfactual Auditability**. Pertanyaan utamanya bukan apakah suatu keputusan telah diotorisasi, melainkan apakah verifier yang dipercaya secara terpisah dapat kemudian membuktikan apa yang terikat pada waktu otorisasi. Penulis membingkai kontribusi mereka sebagai protokol waktu verifikasi operasional plus **Verification-Time Preservation Package (VTPP)** opsional, yang menetapkan bukti apa yang harus diikat, apa yang dapat dibuktikan oleh verifier, bagaimana uji stabilitas dan uji kontrafaktual berpasangan harus dikalibrasi, dan pemeriksaan semantik mana yang tetap berada di luar validitas JSON Schema. Secara kritis, protokol ini bersifat hilir dan non-otorisasi: protokol ini tidak mengubah EG Core Formula, tidak menambah kondisi hidup ketujuh, dan tidak menyatakan kelayakan hukum spesifik yurisdiksi.
Penelitian ini berjalan melalui tiga jalur empiris. Pertama, penulis secara independen memproses ulang artefak Study 2 yang dirilis untuk mereproduksi dua perbandingan perilaku dalam keluarga yang asli. Kedua, mereka melakukan pemasangan ulang pasca-hoc terhadap jalur migrasi yang ditetapkan Groq untuk menguji apakah jalur suksesi yang diumumkan penyedia menghasilkan tingkat pembalikan yang sebanding. Ketiga, mereka melakukan sensus pensiun 22 peristiwa untuk mengukur berapa lama evaluator tetap tersedia.

Mengapa penting

Kontribusi bersama ini adalah protokol waktu verifikasi operasional dan Verification-Time Preservation Package (VTPP) opsional. Protokol ini menetapkan bukti apa yang harus diikat pada waktu otorisasi, apa yang dapat dibuktikan kemudian oleh verifier yang dipercaya secara terpisah, bagaimana uji stabilitas dan uji kontrafaktual berpasangan harus dikalibrasi, dan pemeriksaan semantik mana yang tetap berada di luar validitas JSON Schema.

Hasil ini membawa tiga implikasi. Pertama, tingkat pembalikan dalam keluarga sebesar 52,0% dan 30,0% menunjukkan bahwa bahkan versi model yang berkerabat dekat dapat menghasilkan keputusan modal yang berbeda secara material, sehingga identitas versi saja tidak cukup untuk rekonstruksi. Kedua, tingkat lintas keluarga deskriptif sebesar 64,0% dan 38,0% memperingatkan agar tidak memperlakukan jalur migrasi penyedia sebagai suksesi yang tervalidasi; parameter pemanggilan yang asimetris merusak komparabilitas. Ketiga, median sensus pensiun 16,45 bulan dan fakta bahwa 17/22 interval berada di bawah 24 bulan menunjukkan bahwa banyak evaluator menghilang dalam horizon audit yang tipikal.

Penulis menekankan bahwa protokol ini bersifat hilir dan non-otorisasi: protokol ini tidak mengubah EG Core Formula, tidak menambah kondisi hidup ketujuh, dan tidak menyatakan kelayakan hukum spesifik yurisdiksi. Pemeriksaan semantik di luar validitas JSON Schema tetap diperlukan karena validitas struktural tidak menjamin kesetiaan keadaan keputusan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ