Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Mengevaluasi Akurasi dan Keandalan Probabilistik Model Fondasi Deret Waktu Zero-Shot

Studi benchmark enam TSFM mengungkap trade-off fundamental antara akurasi titik dan kalibrasi probabilistik pada dataset energi, lalu lintas, dan keuangan.
Panagiotis Michael; Moysis Symeonides; Demetris Trihinas· 2026· DOI 10.48550/arXiv.2609.25788

Masalah inti

Time Series Foundation Models (TSFM) telah muncul sebagai paradigma yang menjanjikan untuk peramalan zero-shot, menghilangkan kebutuhan akan pelatihan khusus tugas. Namun, evaluasi yang ada sering kali hanya berfokus pada akurasi prediktif, mengabaikan aspek kritis kalibrasi probabilistik. Studi ini mengatasi kesenjangan tersebut dengan melakukan benchmark enam TSFM pada dataset energi, lalu lintas, dan keuangan. Penulis membandingkan kinerja TSFM terhadap baseline statistik tradisional dan model deep learning terawasi. Pertanyaan penelitian utama mengeksplorasi apakah TSFM dapat secara simultan mencapai akurasi titik yang tinggi dan kuantifikasi ketidakpastian yang andal. Temuan mengungkap trade-off fundamental: meskipun TSFM umumnya mengungguli model statistik dan terawasi dalam hal akurasi, keandalan probabilistiknya sangat bervariasi antar arsitektur dan horizon peramalan.

Inovasi

Di semua dataset, TSFM mengungguli baseline statistik dan model DL terawasi dalam hal akurasi titik. Namun, keandalan probabilistik berbeda menurut arsitektur. Model xLSTM menunjukkan kalibrasi yang robust di semua horizon, mempertahankan probabilitas cakupan nominal. Sebaliknya, transformer berbasis patch mencapai akurasi yang kompetitif tetapi mengalami miskalibrasi pada horizon panjang, sering menghasilkan interval prediksi yang terlalu percaya diri atau kurang percaya diri. Model berbasis transformer menunjukkan saturasi konteks: di luar panjang konteks tertentu, kinerja zero-shot mendatar atau menurun. Secara kuantitatif, xLSTM mengurangi kesalahan kalibrasi hingga 30% dibandingkan transformer berbasis patch pada horizon 96. Trade-off tersebut ditangkap oleh hubungan berikut:

Hasil ini menyoroti bahwa pilihan arsitektur secara kritis memengaruhi keseimbangan antara generalisasi dan kuantifikasi ketidakpastian.

Time Series Foundation Models (TSFM) telah muncul sebagai paradigma yang menjanjikan untuk peramalan zero-shot, menghilangkan kebutuhan akan pelatihan khusus tugas. Namun, evaluasi yang ada sering kali hanya berfokus pada akurasi prediktif, mengabaikan aspek kritis kalibrasi probabilistik. Studi ini mengatasi kesenjangan tersebut dengan melakukan benchmark enam TSFM pada dataset energi, lalu lintas, dan keuangan. Penulis membandingkan kinerja TSFM terhadap baseline statistik tradisional dan model deep learning terawasi. Pertanyaan penelitian utama mengeksplorasi apakah TSFM dapat secara simultan mencapai akurasi titik yang tinggi dan kuantifikasi ketidakpastian yang andal. Temuan mengungkap trade-off fundamental: meskipun TSFM umumnya mengungguli model statistik dan terawasi dalam hal akurasi, keandalan probabilistiknya sangat bervariasi antar arsitektur dan horizon peramalan.
Studi ini mengevaluasi enam TSFM yang mewakili beragam keluarga arsitektur, termasuk xLSTM dan transformer berbasis patch. Dataset mencakup tiga domain: konsumsi energi, aliran lalu lintas, dan deret waktu keuangan. Untuk setiap dataset, penulis menghasilkan peramalan zero-shot pada berbagai horizon. Kinerja diukur menggunakan metrik akurasi titik standar (misalnya, MAE, RMSE) dan metrik kalibrasi probabilistik (misalnya, probabilitas cakupan, ketajaman). Baseline statistik (misalnya, ARIMA, exponential smoothing) dan model deep learning terawasi (misalnya, LSTM) berfungsi sebagai pembanding. Protokol evaluasi memastikan perbandingan yang adil dengan menggunakan pembagian data latih-uji dan pengaturan horizon yang identik. Studi ini juga menyelidiki efek panjang konteks, mengidentifikasi titik saturasi di mana konteks tambahan tidak meningkatkan penalaran zero-shot. Alur kerja keseluruhan digambarkan di bawah ini:

Mengapa penting

Trade-off yang diamati antara akurasi titik dan keandalan probabilistik berasal dari bias induktif arsitektur. Struktur rekuren xLSTM secara alami memodelkan dependensi temporal dan ketidakpastian, sementara transformer berbasis patch mungkin terlalu menyesuaikan diri pada pola lokal, yang menyebabkan kalibrasi horizon panjang yang buruk. Saturasi konteks pada transformer menunjukkan bahwa penalaran zero-shot memiliki batas; di luar ambang tertentu, konteks tambahan memasukkan noise daripada sinyal. Untuk penerapan di dunia nyata, praktisi harus memprioritaskan akurasi atau keandalan berdasarkan kebutuhan aplikasi. Misalnya, domain yang sensitif terhadap risiko seperti keuangan mungkin lebih memilih xLSTM untuk interval yang terkalibrasi, sementara prediksi lalu lintas horizon pendek mungkin diuntungkan oleh transformer berbasis patch. Studi ini merekomendasikan pendekatan hibrida dan penelitian lebih lanjut tentang tujuan pelatihan yang sadar kalibrasi. Temuan ini memberikan panduan berbasis bukti untuk memilih TSFM dalam praktik.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…