Editorial ilmu komputer
Open AccessOA2026
Pengujian Hipotesis yang Diperkaya dengan Simulasi LLM Berbasis Persona
Kerangka kerja berprinsip untuk A/B testing yang diperkaya pembelajaran yang mengurangi ukuran sampel sekaligus mempertahankan validitas statistik
Ziyad Benomar; Aymen Al Marjani; Paul Missault; Saab Mansourยท 2026ยท DOI 10.48550/arXiv.2609.24629
Masalah inti
A/B testing adalah standar emas untuk inferensi kausal di banyak domain, tetapi memerlukan ukuran sampel yang besar, garis waktu yang panjang, dan biaya yang signifikan. Ketika prediksi tambahan atas hasil eksperimen tersedia dari model machine learning, kualitas prediksi yang tidak pasti menghalangi penggantian eksperimen manusia sepenuhnya, namun prediksi tersebut mungkin masih mengandung sinyal yang berguna. Para penulis mengusulkan kerangka kerja berprinsip untuk pengujian hipotesis yang diperkaya pembelajaran yang memanfaatkan prediksi dengan kualitas tidak diketahui untuk mengurangi ukuran sampel sekaligus mempertahankan validitas statistik. Prediksi secara alami bervariasi dalam granularitas, dari sinyal agregat yang kasar hingga estimasi halus pada tingkat individu. Kerangka kerja ini menangani kedua ujung spektrum tersebut: (1) untuk prediksi arah pada tingkat populasi, di mana hanya sinyal biner tentang tanda efek perlakuan yang tersedia, digunakan uji asimetris dengan konsistensi dan batas ketahanan yang terbukti dalam paradigma algoritma yang diperkaya pembelajaran; (2) untuk prediksi pada tingkat individu, Generalized PPI++ (GPPI) memperluas Prediction-Powered Inferenc
Inovasi
Para penulis mengevaluasi kerangka kerja mereka pada empat dataset dunia nyata, membandingkan metode yang diusulkan dengan pengujian hipotesis klasik dan baseline lainnya. Hasilnya menunjukkan bahwa baik uji asimetris maupun GPPI secara substansial mengurangi ukuran sampel yang diperlukan sekaligus mempertahankan validitas statistik. Secara spesifik, ketika prediksi akurat, metode ini mencapai power yang sama dengan uji klasik dengan sampel yang jauh lebih sedikit. Misalnya, pada satu dataset, GPPI mengurangi ukuran sampel hingga 50% sekaligus mempertahankan tingkat galat Tipe I. Uji asimetris juga menunjukkan ketangguhan: bahkan ketika prediksi bersifat adversarial, uji tersebut mempertahankan kontrol galat yang valid, meskipun dengan power yang berkurang. Simulasi LLM berbasis persona memberikan prediksi yang cukup akurat untuk menghasilkan pengurangan biaya, dan metode ini secara otomatis beradaptasi terhadap kualitas prediksi yang bervariasi. Eksperimen tersebut mengonfirmasi bahwa kerangka kerja ini dapat memanfaatkan prediksi dengan kualitas tidak diketahui untuk meningkatkan efisiensi tanpa mengorbankan ketelitian statistik.
A/B testing adalah standar emas untuk inferensi kausal di banyak domain, tetapi memerlukan ukuran sampel yang besar, garis waktu yang panjang, dan biaya yang signifikan. Ketika prediksi tambahan atas hasil eksperimen tersedia dari model machine learning, kualitas prediksi yang tidak pasti menghalangi penggantian eksperimen manusia sepenuhnya, namun prediksi tersebut mungkin masih mengandung sinyal yang berguna. Para penulis mengusulkan kerangka kerja berprinsip untuk pengujian hipotesis yang diperkaya pembelajaran yang memanfaatkan prediksi dengan kualitas tidak diketahui untuk mengurangi ukuran sampel sekaligus mempertahankan validitas statistik. Prediksi secara alami bervariasi dalam granularitas, dari sinyal agregat yang kasar hingga estimasi halus pada tingkat individu. Kerangka kerja ini menangani kedua ujung spektrum tersebut: (1) untuk prediksi arah pada tingkat populasi, di mana hanya sinyal biner tentang tanda efek perlakuan yang tersedia, digunakan uji asimetris dengan konsistensi dan batas ketahanan yang terbukti dalam paradigma algoritma yang diperkaya pembelajaran; (2) untuk prediksi pada tingkat individu, Generalized PPI++ (GPPI) memperluas Prediction-Powered Inference untuk menangani galat prediksi nonlinier melalui transformasi berdimensi lebih tinggi. Kedua metode memperoleh manfaat dari prediksi yang akurat sekaligus tetap tangguh terhadap prediksi yang tidak akurat atau bersifat adversarial. Kerangka kerja ini divalidasi menggunakan simulasi LLM berbasis persona, di mana agen AI yang dilengkapi persona pengguna memprediksi perilaku individu, sebagai sumber prediksi alami yang mencakup kedua tingkat granularitas. Eksperimen pada empat dataset dunia nyata menunjukkan bahwa metode ini, dikombinasikan dengan prediksi berbasis persona, secara substansial mengurangi biaya eksperimen sekaligus mempertahankan validitas statistik yang ketat.
Makalah ini memperkenalkan dua metode yang saling melengkapi untuk pengujian hipotesis yang diperkaya pembelajaran. Pertama, untuk prediksi arah pada tingkat populasi, para penulis mengusulkan uji asimetris yang menggunakan sinyal biner tentang tanda efek perlakuan. Uji ini terbukti konsisten dan tangguh, dengan batas yang diturunkan dalam paradigma algoritma yang diperkaya pembelajaran. Uji asimetris menyesuaikan tingkat signifikansi berdasarkan arah prediksi, memberikan jaminan bahkan ketika prediksi tidak akurat atau bersifat adversarial.
Mengapa penting
Kerangka kerja makalah ini menangani tantangan kritis dalam A/B testing: bagaimana menggunakan prediksi yang berpotensi tidak dapat diandalkan untuk mengurangi biaya tanpa membatalkan hasil. Uji asimetris dan GPPI menawarkan solusi berprinsip dengan memberikan jaminan ketangguhan. Penggunaan simulasi LLM berbasis persona sebagai sumber prediksi bersifat inovatif, karena memungkinkan prediksi yang kasar maupun halus. Namun, kualitas prediksi LLM bergantung pada kesetiaan persona dan dapat bervariasi antar domain. Para penulis mengakui bahwa prediksi dapat tidak akurat atau bersifat adversarial, dan metode mereka dirancang untuk menurun secara bertahap. Batas teoretis memastikan bahwa bahkan dalam kasus terburuk, uji tersebut tetap valid. Kerangka kerja ini bersifat umum dan dapat diterapkan pada sumber prediksi apa pun. Pekerjaan selanjutnya dapat mengeksplorasi pemilihan granularitas prediksi secara adaptif dan integrasi dengan algoritma lain yang diperkaya pembelajaran. Secara keseluruhan, karya ini berkontribusi pada bidang prediction-powered inference yang berkembang dan menunjukkan potensi simulasi LLM dalam memperkaya desain eksperimen.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ