Editorial ilmu komputer
Open AccessOA2026
Ujian Tanpa Akhir: Konstruksi Matematis dari Model Masa Kini menuju Superinteligensi
Tolok ukur berparameter untuk mengukur kemajuan matematis melampaui batas manusia
Muhan Zhangยท 2026ยท DOI 10.48550/arXiv.2609.24555
Masalah inti
Upaya menuju artificial superintelligence (ASI) memerlukan tolok ukur yang dapat mengukur kemajuan melampaui kemampuan manusia saat ini. Ujian konvensional membatasi performa pada skor maksimum, sehingga tidak memberi sinyal begitu model melampaui garis dasar manusia. The Endless Exam mengatasi hal ini dengan memperkenalkan tolok ukur yang mengevaluasi konstruksi matematis melalui empat belas keluarga berparameter. Setiap objek yang diajukan diperiksa validitasnya secara otomatis dan diberi skor kualitas relatif terhadap batas terbit atau garis dasar konstruksi, tanpa membatasi peningkatan pada . Hal ini memungkinkan pengukuran kemajuan secara berkelanjutan, bahkan ketika model melampaui performa tingkat manusia. Tolok ukur ini memanfaatkan masalah matematika terbuka sebagai target jangka panjang dan menghasilkan instans baru pada parameter yang lebih besar, di mana sertifikat ringkas menjaga konstruksi besar tetap dapat diverifikasi. Pada delapan model yang dievaluasi pada 69 instans berbeda, skor kualitas berkelanjutan membedakan performa meskipun tidak ada sistem yang dievaluasi melampaui batas terbit. Kurva ukuran-kualitas menunjukkan bagaimana kualitas konstruksi berubah se
Inovasi
Delapan model dievaluasi pada 69 instans berbeda di seluruh empat belas keluarga konstruksi. Meskipun tidak ada yang melampaui batas terbit, skor kualitas berkelanjutan secara efektif membedakan performa antar model. Skor berkisar dari hingga , dengan variasi antar keluarga dan parameter instans. Kurva ukuran-kualitas dihasilkan, menunjukkan bagaimana kualitas konstruksi berubah seiring bertambahnya ukuran masalah. Untuk sebagian besar model, kualitas menurun pada parameter yang lebih besar, menunjukkan kesulitan dalam menskalakan konstruksi. Namun, beberapa model menunjukkan kualitas yang stabil atau sedikit meningkat, mengindikasikan potensi untuk penskalaan. Hasil ini menyoroti kemampuan tolok ukur dalam memberikan metrik performa yang bernuansa bahkan ketika batas absolut tidak terlampaui. Data juga mengungkapkan bahwa keluarga tertentu lebih diskriminatif daripada yang lain, dengan beberapa keluarga menghasilkan skor yang mengelompok di dekat batas terbit, sementara yang lain menunjukkan dispersi yang lebar. Variasi ini menegaskan pentingnya keragaman keluarga konstruksi dalam mengukur kemajuan.
Upaya menuju artificial superintelligence (ASI) memerlukan tolok ukur yang dapat mengukur kemajuan melampaui kemampuan manusia saat ini. Ujian konvensional membatasi performa pada skor maksimum, sehingga tidak memberi sinyal begitu model melampaui garis dasar manusia. The Endless Exam mengatasi hal ini dengan memperkenalkan tolok ukur yang mengevaluasi konstruksi matematis melalui empat belas keluarga berparameter. Setiap objek yang diajukan diperiksa validitasnya secara otomatis dan diberi skor kualitas relatif terhadap batas terbit atau garis dasar konstruksi, tanpa membatasi peningkatan pada . Hal ini memungkinkan pengukuran kemajuan secara berkelanjutan, bahkan ketika model melampaui performa tingkat manusia. Tolok ukur ini memanfaatkan masalah matematika terbuka sebagai target jangka panjang dan menghasilkan instans baru pada parameter yang lebih besar, di mana sertifikat ringkas menjaga konstruksi besar tetap dapat diverifikasi. Pada delapan model yang dievaluasi pada 69 instans berbeda, skor kualitas berkelanjutan membedakan performa meskipun tidak ada sistem yang dievaluasi melampaui batas terbit. Kurva ukuran-kualitas menunjukkan bagaimana kualitas konstruksi berubah seiring bertambahnya ukuran masalah. Generator, verifikator, referensi, respons model, dan analisis dirilis untuk mendukung pengukuran berkelanjutan sebelum dan melampaui batas manusia.
The Endless Exam dibangun di atas empat belas keluarga konstruksi berparameter, masing-masing diturunkan dari masalah matematika terbuka. Keluarga ini menghasilkan instans pada parameter yang bervariasi, memungkinkan tingkat kesulitan yang dapat diskalakan. Untuk setiap instans, model mengajukan objek konstruksi, yang diverifikasi validitasnya secara otomatis. Kualitas konstruksi kemudian dinilai relatif terhadap batas terbit atau garis dasar, dengan skor didefinisikan sebagai:
Mengapa penting
The Endless Exam merupakan langkah signifikan menuju tolok ukur yang dapat mengukur kemajuan melampaui kemampuan manusia. Dengan membiarkan skor melebihi , tolok ukur ini memberikan sinyal perbaikan yang berkelanjutan, yang esensial untuk melacak kemajuan menuju superinteligensi. Penggunaan keluarga berparameter memastikan tolok ukur dapat menghasilkan instans baru yang lebih sulit seiring model meningkat, mencegah saturasi. Sertifikat ringkas memungkinkan verifikasi konstruksi besar, mengatasi tantangan utama dalam menskalakan tolok ukur. Namun, evaluasi saat ini menunjukkan bahwa tidak ada model yang melampaui batas terbit, menandakan bahwa konstruksi matematis tingkat manusia masih menjadi tantangan. Kurva ukuran-kualitas menawarkan wawasan tentang bagaimana model menangani kompleksitas yang meningkat, yang dapat memandu pengembangan model di masa depan. Perilisan semua komponen mendukung reproduktibilitas dan perluasan yang digerakkan komunitas. Pekerjaan selanjutnya dapat memperluas jumlah keluarga dan memasukkan masalah matematika yang lebih kompleks. Desain tolok ukur ini sejalan dengan tujuan menciptakan ujian "tanpa akhir" yang berkembang seiring kemampuan model, memberikan ukuran kemajuan yang bertahan lama menuju ASI.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ