Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Satu dari Delapan Abstrak OpenAlex Bermasalah Integritas

Penilaian sistematis terhadap kualitas abstrak di basis data bibliografis utama mengungkap mode kegagalan yang lazim dan menyerukan anotasi komunitas.
Seorin Kim; Vincent Holst; Vincent Ginis· 2026· DOI 10.48550/arXiv.2605.20168

Masalah inti

Abstrak ilmiah semakin banyak digunakan sebagai data utama dalam penelitian metasains komputasional, namun kualitas abstrak ini di basis data bibliografis yang banyak digunakan belum diperiksa secara sistematis. OpenAlex, basis data bibliografis terbuka yang terkemuka, menyediakan abstrak untuk jutaan karya ilmiah, tetapi integritas abstrak ini—apakah abstrak tersebut secara akurat merepresentasikan publikasi yang mendasarinya—masih belum diverifikasi. Penelitian ini mengatasi kesenjangan tersebut dengan menilai integritas 10.000 abstrak jurnal berbahasa Inggris yang diambil secara acak dari OpenAlex. Para penulis bertujuan mengidentifikasi mode kegagalan yang umum dan mengukur prevalensi masalah integritas, sehingga dapat menginformasikan praktik penelitian hilir dan mendorong kontrol kualitas yang digerakkan komunitas.

Inovasi

Analisis mengungkapkan bahwa 12% dari abstrak sampel bermasalah integritas. Mode kegagalan yang paling lazim adalah konten yang tidak memadai dan metadata yang salah tempat. Konten yang tidak memadai merujuk pada abstrak yang terpotong, tidak lengkap, atau kekurangan informasi penting, sedangkan metadata yang salah tempat terjadi ketika teks abstrak secara keliru dikaitkan dengan publikasi yang salah atau memuat informasi yang tidak relevan. Tujuh mode kegagalan yang diidentifikasi para penulis menyediakan taksonomi untuk mengategorikan masalah kualitas abstrak. Tingkat prevalensi 12% menyiratkan bahwa sekitar satu dari delapan abstrak di OpenAlex mungkin tidak dapat diandalkan untuk tujuan penelitian. Temuan ini sangat mengkhawatirkan mengingat semakin besarnya ketergantungan pada data semacam itu dalam metasains. Distribusi mode kegagalan menunjukkan bahwa kesalahan ekstraksi otomatis dan kesalahan manusia saat entri metadata sama-sama berkontribusi terhadap masalah ini.
Abstrak ilmiah semakin banyak digunakan sebagai data utama dalam penelitian metasains komputasional, namun kualitas abstrak ini di basis data bibliografis yang banyak digunakan belum diperiksa secara sistematis. OpenAlex, basis data bibliografis terbuka yang terkemuka, menyediakan abstrak untuk jutaan karya ilmiah, tetapi integritas abstrak ini—apakah abstrak tersebut secara akurat merepresentasikan publikasi yang mendasarinya—masih belum diverifikasi. Penelitian ini mengatasi kesenjangan tersebut dengan menilai integritas 10.000 abstrak jurnal berbahasa Inggris yang diambil secara acak dari OpenAlex. Para penulis bertujuan mengidentifikasi mode kegagalan yang umum dan mengukur prevalensi masalah integritas, sehingga dapat menginformasikan praktik penelitian hilir dan mendorong kontrol kualitas yang digerakkan komunitas.
Para penulis menerapkan protokol anotasi dua tahap yang menggabungkan tinjauan pakar manusia dan klasifikasi large language model (LLM). Pertama, sampel acak 10.000 abstrak jurnal berbahasa Inggris diambil dari OpenAlex. Pakar manusia menganotasi sebagian sampel untuk mengidentifikasi dan mengategorikan masalah integritas, yang mengarah pada definisi tujuh mode kegagalan yang berbeda. Anotasi ini kemudian digunakan untuk melatih dan memvalidasi pengklasifikasi LLM, yang diterapkan pada seluruh sampel. Pendekatan dua tahap ini memastikan kedalaman (melalui tinjauan pakar) dan skala (melalui LLM). Protokol ini kemungkinan melibatkan penyempurnaan iteratif untuk memastikan reliabilitas. Proses klasifikasi dapat direpresentasikan sebagai diagram alur:

Mengapa penting

Para penulis membahas implikasi temuan ini bagi penelitian hilir. Masalah integritas pada abstrak dapat menyebabkan hasil yang bias atau tidak valid dalam studi metasains komputasional yang menggunakan abstrak sebagai data utama. Misalnya, analisis tren penelitian, pemodelan topik, atau jaringan kutipan dapat terdistorsi oleh abstrak yang tidak lengkap atau salah atribusi. Para penulis menyerukan peningkatan kesadaran dan langkah-langkah kontrol kualitas. Mereka menjelaskan portal komunitas yang akan datang yang dirancang untuk mendukung upaya anotasi kolektif, memungkinkan peneliti menandai dan memperbaiki masalah integritas secara kolaboratif. Inisiatif ini bertujuan meningkatkan reliabilitas OpenAlex dan basis data serupa. Penelitian ini menegaskan perlunya pemantauan berkelanjutan dan pengembangan alat otomatis untuk mendeteksi dan memitigasi masalah integritas. Pekerjaan selanjutnya harus memperluas analisis ke basis data lain dan abstrak non-Inggris, serta mengeksplorasi akar penyebab mode kegagalan yang teridentifikasi.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…