Editorial Ilmu Komputer & AI
Evaluasi Kinerja Fast Fourier Transform pada Perangkat Keras RISC-V Baru dengan Dukungan Ekstensi Vektor
Masalah inti
Fast Fourier Transform (FFT) merupakan dasar bagi komputasi ilmiah, pemrosesan sinyal, dan kriptografi. Kemunculan RISC-V Vector Extension (RVV 1.0) menawarkan ISA vektor standar terbuka baru untuk komputasi berkinerja tinggi. Karya ini memperkenalkan **juFFTe**, pustaka ringan berkinerja tinggi untuk discrete Fourier transform, dan mengevaluasi kinerjanya pada tiga prosesor yang mendukung RVV 1.0: **SiFive X280**, **inti X100 dari SpacemiT K3**, dan **inti C920v2 dari Sophon SG2044**. Studi ini membandingkan juFFTe dengan pustaka **FFTW3** yang banyak digunakan dan membandingkan hasilnya dengan arsitektur **AMD Zen 5** untuk menilai kematangan RISC-V untuk beban kerja FFT.
Pertanyaan penelitian utama:
- Seberapa efektif kernel FFT dapat divektorisasi untuk RVV 1.0?
- Berapa peningkatan kinerja yang dicapai juFFTe dibandingkan FFTW3 pada perangkat keras RVV?
- Bagaimana platform RVV dibandingkan dengan mikroarsitektur mapan seperti AMD Zen 5?
Inovasi
Tolok ukur komprehensif mengungkap **peningkatan kinerja substansial** juFFTe dibandingkan FFTW3 pada ketiga prosesor yang mendukung RVV. Temuan utama meliputi:
- Pada **SiFive X280**, juFFTe mencapai percepatan hingga **3,5×** dibandingkan FFTW3 untuk ukuran FFT besar (misalnya, ).
- Pada **SpacemiT K3 (inti X100)**, percepatan mencapai **2,8×** untuk beban kerja multi-threaded.
- Pada **Sophon SG2044 (inti C920v2)**, juFFTe menunjukkan peningkatan **2,2×** untuk FFT single-threaded dan **4,1×** untuk FFT multi-threaded.
Namun, jika dibandingkan dengan **AMD Zen 5** yang menjalankan FFTW3, platform RVV masih tertinggal. Misalnya, sistem Zen 5 menyelesaikan FFT -titik dalam **0,45 ms**, sedangkan hasil RVV terbaik (SiFive X280 dengan juFFTe) adalah **1,2 ms**—selisih **2,7×**. Ini menunjukkan bahwa meskipun vektorisasi RVV efektif, perangkat keras RISC-V perlu lebih matang untuk menyamai mikroarsitektur mapan.
Tabel 1: Percepatan juFFTe dibandingkan FFTW3 pada platform RVV (ukuran terpilih)
| Ukuran FFT | SiFive X280 | SpacemiT K3 | Sophon SG2044 |
|----------|-------------|-------------|---------------|
| | 2,1× | 1,9× | 1,7×
- Seberapa efektif kernel FFT dapat divektorisasi untuk RVV 1.0?
- Berapa peningkatan kinerja yang dicapai juFFTe dibandingkan FFTW3 pada perangkat keras RVV?
- Bagaimana platform RVV dibandingkan dengan mikroarsitektur mapan seperti AMD Zen 5?
Mengapa penting
Hasil menunjukkan bahwa **vektorisasi efektif kernel FFT yang kritis terhadap kinerja dapat dicapai pada perangkat keras RVV 1.0**. Desain ringan juFFTe dan optimasi yang ditargetkan menghasilkan keuntungan signifikan dibandingkan FFTW3, yang tidak sepenuhnya dioptimalkan untuk RVV. Percepatan tersebut disebabkan oleh:
- **Penggunaan intrinsik RVV yang efisien** untuk operasi butterfly dan perkalian twiddle factor.
- **Blocking yang sadar cache** untuk mengurangi latensi memori.
- **Multi-threading** yang memanfaatkan jumlah inti tinggi pada Sophon SG2044.
Meskipun demikian, kesenjangan kinerja dengan AMD Zen 5 menyoroti beberapa tantangan:
1. **Dukungan kompilator yang belum matang** untuk RVV 1.0, yang menyebabkan pembangkitan kode suboptimal.
2. **Panjang vektor terbatas** (misalnya, 256-bit pada SiFive X280) dibandingkan AVX-512 pada Zen 5.
3. **Kendala bandwidth memori** pada platform RISC-V saat ini.
Para penulis menyimpulkan bahwa meskipun platform yang mendukung RVV menunjukkan **hasil yang menjanjikan**, RISC-V perlu lebih matang—baik dalam perangkat keras maupun ekosistem perangkat lunak—untuk mencapai kinerja mikroarsitektur mapan. Pekerjaan selanjutnya mencakup optimasi untuk panjang vektor yang lebih besar dan peningkatan auto-vektorisasi kompilator.
Diagram Mermaid faktor kesenjangan kinerja:
Siapa yang sebaiknya membaca
Membuka konten member…