Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Petunjuk Frekuensi Wilayah Bibir dan Turunan rPPG yang Saling Melengkapi untuk Deteksi Deepfake Wajah Berbicara

Studi bebas subjek pada Celeb-DF++ menunjukkan bahwa DCT wilayah bibir dan gelombang turunan rPPG menawarkan kekuatan yang saling melengkapi di tujuh generator wajah berbicara, dengan fusi statis hanya sebagian memanfaatkan sinerginya.
Othmane Harraq; Tamer Aldwairi· 2026· DOI 10.48550/arXiv.2609.22284

Masalah inti

Deepfake wajah berbicara (TF) menimbulkan ancaman yang semakin besar terhadap integritas media digital, dan metode deteksi berbasis remote photoplethysmography (rPPG) telah menunjukkan harapan tetapi performanya tidak merata di berbagai generator. Studi ini menyelidiki dua petunjuk visual ringan untuk deteksi deepfake TF: gelombang turunan rPPG yang diekstraksi oleh RhythmFormer dan koefisien discrete cosine transform (DCT) wilayah bibir. Penulis mengevaluasi petunjuk ini pada tujuh metode TF dari dataset Celeb-DF++ di bawah protokol bebas subjek, memastikan bahwa artefak spesifik identitas tidak menggelembungkan performa. Hipotesis utamanya adalah bahwa petunjuk ini menangkap informasi yang saling melengkapi—sinyal rPPG mencerminkan variasi warna temporal yang halus dan DCT wilayah bibir menangkap artefak domain frekuensi di area mulut—dan fusi keduanya dapat meningkatkan ketahanan deteksi. Makalah ini secara eksplisit memperlakukan sinyal turunan rPPG sebagai petunjuk empiris dan tidak mengklaim bahwa sinyal itu berasal dari jantung, menghindari interpretasi berlebihan atas dasar fisiologisnya. Studi ini bertujuan mengukur performa individual dan gabungan dari petunjuk ini, menil

Inovasi

Evaluasi in-domain menunjukkan bahwa DCT wilayah bibir menyamai atau melampaui 1D ResNet turunan rPPG pada setiap metode TF kecuali SadTalker. Fusi Concat mencapai AUC 0,891, dibandingkan 0,824 untuk baseline rPPG saja dan 0,827 untuk baseline DCT wilayah bibir saja. Ini menunjukkan bahwa kedua petunjuk saling melengkapi in-domain. Di bawah evaluasi leave-one-generator-out (LOGO), petunjuk ini menunjukkan perpecahan dalam transferabilitas: setiap petunjuk bertransfer jelas lebih baik ke tiga metode held-out, sementara IP-LAP mendekati kebetulan untuk keduanya. Fusi Concat rata-rata AUC 0,798 di seluruh skenario LOGO tetapi turun di bawah rPPG saja ketika DCT bertransfer dengan buruk. Ini menunjukkan bahwa fusi statis hanya sebagian memanfaatkan komplementaritas. Selain itu, DCT wilayah bibir mengungguli DCT seluruh wajah pada enam dari tujuh metode, menyoroti pentingnya fokus pada wilayah mulut untuk deteksi deepfake berbasis frekuensi. Hasilnya diringkas dalam tabel berikut (nilai diperkirakan dari abstrak):

| Method | rPPG AUC | Lip-DCT AUC | Concat AUC |
|-----------------|----------|-------------|------------|
| In-domain (avg) | 0.824 | 0.827 | 0.891 |

Deepfake wajah berbicara (TF) menimbulkan ancaman yang semakin besar terhadap integritas media digital, dan metode deteksi berbasis remote photoplethysmography (rPPG) telah menunjukkan harapan tetapi performanya tidak merata di berbagai generator. Studi ini menyelidiki dua petunjuk visual ringan untuk deteksi deepfake TF: gelombang turunan rPPG yang diekstraksi oleh RhythmFormer dan koefisien discrete cosine transform (DCT) wilayah bibir. Penulis mengevaluasi petunjuk ini pada tujuh metode TF dari dataset Celeb-DF++ di bawah protokol bebas subjek, memastikan bahwa artefak spesifik identitas tidak menggelembungkan performa. Hipotesis utamanya adalah bahwa petunjuk ini menangkap informasi yang saling melengkapi—sinyal rPPG mencerminkan variasi warna temporal yang halus dan DCT wilayah bibir menangkap artefak domain frekuensi di area mulut—dan fusi keduanya dapat meningkatkan ketahanan deteksi. Makalah ini secara eksplisit memperlakukan sinyal turunan rPPG sebagai petunjuk empiris dan tidak mengklaim bahwa sinyal itu berasal dari jantung, menghindari interpretasi berlebihan atas dasar fisiologisnya. Studi ini bertujuan mengukur performa individual dan gabungan dari petunjuk ini, menilai generalisasinya di berbagai generator, dan menganalisis batasan strategi fusi statis.
Penulis menggunakan protokol evaluasi bebas subjek pada Celeb-DF++, yang berisi tujuh metode generasi wajah berbicara. Dua pipeline ekstraksi fitur digunakan: (1) gelombang turunan rPPG yang diekstraksi menggunakan RhythmFormer, estimator rPPG mutakhir, menghasilkan sinyal 1D yang diproses oleh pengklasifikasi 1D ResNet; dan (2) koefisien DCT wilayah bibir yang dihitung dari area mulut, menangkap statistik domain frekuensi. Untuk fusi, fitur digabungkan (Concat) sebelum klasifikasi. Studi ini membandingkan petunjuk ini dengan baseline unimodal dan juga mengevaluasi DCT seluruh wajah sebagai alternatif. Evaluasi mencakup pengujian in-domain (pelatihan dan pengujian pada generator yang sama) dan pengujian lintas generator leave-one-generator-out (LOGO) untuk menilai generalisasi. Performa diukur menggunakan area under the ROC curve (AUC). Arsitekturnya dapat diringkas sebagai berikut:

Mengapa penting

Studi ini menunjukkan bahwa gelombang turunan rPPG dan koefisien DCT wilayah bibir memberikan informasi yang saling melengkapi untuk deteksi deepfake wajah berbicara. Hasil in-domain menunjukkan bahwa fusi meningkatkan performa, tetapi evaluasi LOGO mengungkapkan bahwa petunjuk ini digeneralisasi secara berbeda di berbagai generator. Ini menunjukkan bahwa fusi konkatenasi statis tidak optimal; mekanisme fusi adaptif atau berbasis atensi dapat lebih baik memanfaatkan kekuatan setiap petunjuk tergantung karakteristik generator. Performa mendekati kebetulan pada IP-LAP untuk kedua petunjuk menunjukkan bahwa generator ini mungkin menghasilkan artefak yang tidak ditangkap oleh kedua modalitas, atau bahwa protokol bebas subjek sangat menantang untuk IP-LAP. Temuan bahwa DCT wilayah bibir mengungguli DCT seluruh wajah pada sebagian besar metode menegaskan pentingnya analisis terlokalisasi, karena artefak deepfake sering terkonsentrasi di area mulut selama berbicara. Penulis memperingatkan bahwa sinyal turunan rPPG diperlakukan sebagai petunjuk empiris dan tidak harus berasal dari jantung, yang merupakan catatan penting untuk interpretabilitas. Pekerjaan selanjutnya dapat mengeksplorasi strategi fusi dinamis, memasukkan petunjuk tambahan, dan memperluas evaluasi ke dataset yang lebih beragam. Studi ini berkontribusi pada pemahaman tentang bagaimana berbagai petunjuk visual saling melengkapi dan menyoroti kebutuhan akan fusi yang sadar generator dalam deteksi deepfake.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…