5,6 Miliar Video TikTok Dibocorkan ke Hugging Face, Siapa di Baliknya?
Baca dalam 60 detik
- Metadata 5,6 miliar video TikTok dipublikasikan gratis di Hugging Face, mencakup periode 2014–2026.
- Data berisi caption, hashtag, ID suara, hingga metrik interaksi—bahan mentah untuk model AI prediktif.
- Praktik scraping ini melanggar ketentuan layanan TikTok dan memicu perdebatan hukum di AS.

Seorang pengembang dengan nama samaran hashfunction mengunggah metadata sekitar 5,6 miliar video TikTok publik ke repositori AI open-source Hugging Face. Dataset yang dipublikasikan melalui akun datasocial itu dapat diunduh secara bebas dan mencakup unggahan dari Juli 2014 hingga Oktober 2026.
Yang dibocorkan bukanlah berkas video, melainkan baris-baris data terstruktur. Setiap entri memuat keterangan video, tagar, ID suara, teks di layar, ID produk dan penjual TikTok Shop, serta hitungan tayangan, suka, komentar, bagikan, simpan, dan unduhan. Keseluruhan data tersimpan dalam 460 GB file Parquet yang dipecah per bulan.
Beberapa kolom merupakan label internal TikTok, seperti penanda video yang dihasilkan AI dan status apakah video disembunyikan dari For You Page. Untuk video lama yang berasal dari arsip, penanda AI sering kali kosong. Dataset ini tidak dibatasi aksesnya; penghitung Hugging Face menunjukkan 1.181 unduhan sejauh ini, dan salinannya juga tersedia di datasocial.ai.
Mengapa ini penting? Karena pengembang AI sangat membutuhkan data semacam ini, sementara TikTok mempersempit akses resminya. Keterangan video, tagar, ID suara, dan metrik interaksi dari miliaran unggahan adalah bahan mentah untuk model yang memprediksi konten viral atau produk yang laku di TikTok Shop, memahami kata dan frasa yang efektif, serta melatih model bahasa agar menangkap gaya penulisan video pendek.
Jalur resmi TikTok jauh lebih terbatas. Research Tools mereka hanya terbuka bagi peneliti dari institusi akademik di wilayah tertentu—seperti Amerika Serikat, EEA, Inggris, Kanada, dan Swiss—serta beberapa badan nirlaba di Uni Eropa, dan itupun melalui aplikasi serta persetujuan. Ketentuan layanan AS Pasal 3.4 melarang ekstraksi data dengan perangkat lunak otomatis tanpa izin tertulis dari TikTok.
Dalam dokumentasinya, DataSocial mengklaim telah menembus API mobile privat TikTok menggunakan identitas perangkat Android palsu, tanda tangan permintaan yang direkayasa balik, dan jabat tangan TLS yang dipalsukan. Sistem itu disebut mengumpulkan 3,23 miliar profil kreator, 5,94 miliar video, dan 2,8 miliar komentar hanya dalam tiga pekan—tanpa melibatkan login atau akun. Model bisnisnya pun jelas: lapisan gratis berfungsi sebagai etalase. Lisensi CC BY-NC 4.0 membatasi penggunaan untuk riset dan keperluan pribadi, sementara akses komersial, profil kreator, dan pembaruan harian diarahkan ke datasocial.ai. Kode scraper dijual terpisah dengan harga US$1.699.
Praktik scraping besar-besaran sudah berujung ke meja hijau. Oktober 2025, Reddit menggugat Perplexity dan tiga perusahaan pemanen data karena diduga menjalankan skema "skala industri" untuk mengeruk kontennya bagi pelatihan AI. Juli lalu, hakim federal menolak sebagian besar upaya pembatalan gugatan, menurut Law360. Klaim yang bertahan mencakup tuduhan DMCA bahwa SerpApi menghindari perlindungan anti-bot Google. TikTok bukan pihak dalam perkara itu, dan kasus tersebut menyangkut scraping melalui hasil pencarian Google, bukan API mobile privat.
Soal isi data, baris-barisnya memuat keterangan video, musik yang dipakai, dan berbagai kotak centang. Tidak ada kolom nama pengguna kreator, tetapi ID pengguna sebenarnya tersedia di Datasocial. Dataset ini juga tidak sendirian: salinan berisi 4,5 miliar video, yang juga diklaim diambil dari API mobile TikTok, sudah lebih dulu ada di Hugging Face.
Bagi Indonesia, fenomena ini menyoroti celah perlindungan data di platform global. Dengan ratusan juta pengguna TikTok, Indonesia merupakan salah satu pasar terbesar—artinya metadata kreator lokal berpotensi ikut tersedot dalam operasi semacam ini. Regulator dan pelaku industri dalam negeri perlu mencermati apakah kerangka hukum yang ada cukup untuk menuntut pertanggungjawaban ketika data warga dieksploitasi tanpa izin.
Ke depan, pertanyaannya bukan lagi apakah data media sosial akan terus dibocorkan, melainkan seberapa cepat platform dan regulator menutup celah yang ada. Jika praktik ini dibiarkan, batas antara riset, inovasi AI, dan pelanggaran privasi akan semakin kabur—dan pengguna, termasuk di Indonesia, menjadi pihak yang paling dirugikan.



