Editorial ilmu komputer
Open AccessOA2026
CogScale: Tolok Ukur Skalabel untuk Pemrosesan Sekuens
Rangkaian ringan dan dapat diparametrisasi berisi 14 tugas sintetis untuk validasi arsitektur secara cepat
Yannis Bendi-Ouis; Romain de Coudenhove; Xavier Hinautยท 2026ยท DOI 10.48550/arXiv.2605.19758
Masalah inti
Kemampuan untuk mempertahankan dan memanipulasi informasi sepanjang waktu merupakan hal mendasar bagi kecerdasan biologis maupun artifisial. Meskipun model modern unggul di domain seperti pemrosesan bahasa alami, mengevaluasi arsitektur baru untuk pemrosesan informasi sekuensial tetap mahal secara komputasi dan lambat. Menguji desain baru sering kali menuntut penskalaan ke dataset dan model yang masif, sehingga menimbulkan biaya komputasi besar dan menghambat kecepatan iterasi. Untuk mengatasi hal ini, Bendi-Ouis, de Coudenhove, dan Hinaut mengusulkan CogScale, sebuah tolok ukur berisi 14 tugas sintetis skalabel yang dirancang untuk mengisolasi dan mengevaluasi kemampuan kognitif dan memori tertentu pada skala yang dapat diparametrisasi. CogScale menawarkan kerangka kerja terstandardisasi dan ringan yang memungkinkan peneliti memvalidasi inovasi arsitektur secara cepat sebelum melakukan pelatihan skala besar. Tolok ukur ini bertujuan menjembatani kesenjangan antara tugas diagnostik skala kecil dan evaluasi dunia nyata skala penuh, dengan menyediakan lingkungan terkendali untuk menyelidiki retensi memori, kompleksitas penalaran, dan skalabilitas.
Inovasi
Evaluasi baseline mengungkap profil kinerja yang berbeda di antara arsitektur. Di bawah batasan parameter yang ketat (1k, 10k, 100k), jaringan saraf rekuren klasik (GRU, LSTM) dan Echo State Network unggul pada tugas retensi dasar, menunjukkan kemampuan memori jangka pendek yang kuat. Namun, seiring kompleksitas penalaran dan tingkat kesulitan meningkat, hanya mekanisme attention (Transformer Decoder, Transformer Encoder-Decoder) dan model state-space modern (Mamba) yang secara konsisten mempertahankan kinerja tinggi. xLSTM menunjukkan perilaku intermediat, mengungguli RNN klasik pada beberapa tugas tetapi tidak mencapai konsistensi model berbasis attention dan state-space. Hasil ini menyoroti trade-off antara efisiensi parameter dan skalabilitas: meskipun model yang lebih kecil dapat menangani retensi sederhana, mereka kesulitan pada tugas yang memerlukan penalaran kompleks atas sekuens yang lebih panjang. Tolok ukur ini secara efektif membedakan antararsitektur, memberikan sinyal yang jelas bagi peneliti untuk memilih model yang sesuai berdasarkan tuntutan tugas.
Kemampuan untuk mempertahankan dan memanipulasi informasi sepanjang waktu merupakan hal mendasar bagi kecerdasan biologis maupun artifisial. Meskipun model modern unggul di domain seperti pemrosesan bahasa alami, mengevaluasi arsitektur baru untuk pemrosesan informasi sekuensial tetap mahal secara komputasi dan lambat. Menguji desain baru sering kali menuntut penskalaan ke dataset dan model yang masif, sehingga menimbulkan biaya komputasi besar dan menghambat kecepatan iterasi. Untuk mengatasi hal ini, Bendi-Ouis, de Coudenhove, dan Hinaut mengusulkan CogScale, sebuah tolok ukur berisi 14 tugas sintetis skalabel yang dirancang untuk mengisolasi dan mengevaluasi kemampuan kognitif dan memori tertentu pada skala yang dapat diparametrisasi. CogScale menawarkan kerangka kerja terstandardisasi dan ringan yang memungkinkan peneliti memvalidasi inovasi arsitektur secara cepat sebelum melakukan pelatihan skala besar. Tolok ukur ini bertujuan menjembatani kesenjangan antara tugas diagnostik skala kecil dan evaluasi dunia nyata skala penuh, dengan menyediakan lingkungan terkendali untuk menyelidiki retensi memori, kompleksitas penalaran, dan skalabilitas.
CogScale terdiri atas 14 tugas sintetis, masing-masing menyasar fakultas kognitif dan memori yang berbeda. Tugas-tugas ini dapat diparametrisasi dalam hal skala dan tingkat kesulitan, sehingga memungkinkan evaluasi sistematis di seluruh spektrum tantangan. Untuk menetapkan baseline, penulis mengevaluasi tujuh arsitektur: Gated Recurrent Unit (GRU), Long Short-Term Memory (LSTM), xLSTM, Echo State Network (ESN), Mamba, Transformer Decoder, dan Transformer Encoder-Decoder. Semua model dilatih di bawah batasan parameter yang ketat sebesar 1k, 10k, dan 100k parameter, sehingga menjamin perbandingan yang adil dan menyoroti efisiensi. Tugas-tugas tersebut dirancang agar ringan, sehingga memungkinkan eksperimen cepat. Protokol evaluasi mengukur kinerja di berbagai tingkat kesulitan dan skala, memberikan wawasan tentang kemampuan setiap arsitektur dalam menangani kompleksitas yang meningkat. Desain modular tolok ukur ini memudahkan isolasi kemampuan tertentu, seperti memori jangka pendek, retensi jangka panjang, dan penalaran komposisional.
Mengapa penting
Temuan ini menegaskan pentingnya tolok ukur skalabel seperti CogScale dalam memandu inovasi arsitektur. Dengan mengisolasi kemampuan kognitif dan memori, CogScale memungkinkan iterasi cepat dan pengambilan keputusan yang terinformasi sebelum berinvestasi dalam pelatihan skala besar. Kinerja unggul model attention dan state-space pada tugas kompleks menunjukkan bahwa mekanisme untuk perutean informasi dinamis dan pemodelan dependensi jarak jauh yang efisien sangat penting untuk pemrosesan sekuens tingkat lanjut. Sebaliknya, keberhasilan RNN klasik dan ESN pada tugas retensi dasar menunjukkan relevansinya yang berkelanjutan dalam skenario dengan sumber daya terbatas. Sifat CogScale yang dapat diparametrisasi memungkinkan peneliti menyesuaikan evaluasi dengan hipotesis tertentu, sehingga mendorong pemahaman yang lebih mendalam tentang kekuatan dan kelemahan model. Pekerjaan mendatang dapat memperluas tolok ukur ini untuk mencakup tugas dan arsitektur yang lebih beragam, sehingga semakin memperkaya lanskap penelitian pemrosesan sekuens. Pada akhirnya, CogScale menyediakan alat terstandardisasi dan ringan yang mempercepat pengembangan model sekuensial yang lebih mampu dan efisien.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ