AI Berkeley Kumpulkan 2,2 Juta Peraturan Lokal AS dalam Satu Basis Data, tapi Ketepatannya Diragukan
Baca dalam 60 detik
- Riset UC Berkeley meluncurkan LOCUS, kumpulan 2,2 juta ketentuan hukum kota dan kabupaten di AS yang dapat diakses publik.
- Model AI murah digunakan untuk mengekstraksi dan melabeli jutaan halaman dokumen, mengungkap disparitas keterbacaan dan dampak denda.
- Uji coba awal menunjukkan model bahasa besar masih belum dapat diandalkan untuk menjawab pertanyaan hukum secara akurat.

Tim peneliti dari University of California, Berkeley, berhasil mengubah tumpukan dokumen hasil pemindaian peraturan kota dan kabupaten di Amerika Serikat menjadi sebuah basis data publik yang memuat sekitar 2,2 juta ketentuan hukum lokal. Proyek bernama LOCUS (Local Ordinance Corpus for the United States) ini resmi mengudara pada Juni lalu dan mendapat perhatian baru setelah makalahnya diterima di konferensi riset AI terkemuka, NeurIPS.
Selama ini, hukum federal dan negara bagian relatif mudah diakses melalui portal resmi. Namun, aturan yang paling dekat dengan kehidupan sehari-hari—seperti batas kebisingan, regulasi hewan peliharaan, hingga izin mendirikan bangunan—tersebar di ribuan kode kota dan kabupaten yang sering kali masih berbentuk PDF hasil pemindaian di berbagai situs web yang berbeda. Membandingkan aturan antara dua kota pun menjadi pekerjaan yang melelahkan. LOCUS berupaya menyajikan aturan-aturan tersebut dalam format yang dapat ditelusuri dan dibandingkan oleh manusia maupun perangkat lunak.
Untuk membangun basis data ini, tim mengumpulkan 9.239 kode kota dan kabupaten yang totalnya mencapai sekitar 7 juta halaman. Tantangan muncul karena banyak dokumen tersimpan di platform komersial yang dirancang untuk dibaca langsung di peramban, bukan untuk diunduh secara massal. Municode, misalnya, menjadi rumah bagi kode dari hampir 4.000 pemerintah daerah, sehingga tim harus bekerja lintas sistem. Halaman hasil pemindaian kemudian diproses menggunakan model AI sumber terbuka bernama LightOnOCR-2-1B untuk mengekstraksi teks dari gambar. Menurut makalah tersebut, biaya operasi ini hanya sekitar 0,30 sen per 1.000 halaman.
Setelah teks berhasil diekstraksi, proses pelabelan dilakukan. Model GPT-5.4 nano dari OpenAI—varian termurah—digunakan untuk memberi label pada 100.000 contoh ketentuan berdasarkan topik dan tujuannya. Label ini kemudian melatih model yang lebih kecil untuk menandai seluruh data yang tersisa. Pendekatan berjenjang ini memungkinkan model murah menangani volume yang sangat besar. Hasilnya, rilis publik memuat 2.211.516 ketentuan, masing-masing ditandai berdasarkan subjek seperti zonasi atau aturan gangguan, serta diberi skor tingkat kesulitan pemahaman bagi orang awam. Skor ini dihasilkan dari model AI yang dilatih dengan penilaian AI lain, bukan dari ahli hukum, dan tim mengakui bahwa tinjauan pakar dapat meningkatkan akurasinya.
Dari data tersebut, beberapa pola menarik muncul. Makalah melaporkan bahwa kode lokal di Florida lebih dari dua kali lebih sulit dipahami dibandingkan negara bagian lain, dan kode kabupaten cenderung lebih rumit dibaca daripada kode kota. Sebuah makalah workshop di konferensi ICML menggunakan data ini untuk meneliti denda di 853 yurisdiksi di 11 negara bagian. Denda tipikal untuk pelanggaran pertama adalah $100, baik di kota kaya maupun miskin. Namun, jika dihitung sebagai proporsi pendapatan bulanan, denda tersebut sekitar 2,2 kali lebih memberatkan di daerah berpenghasilan rendah.
Rilis gratis LOCUS menyertakan satu kode perwakilan untuk setiap kabupaten, sehingga sebuah kota mungkin tidak muncul. Lapisan tingkat kabupaten ini menjangkau 2.309 dari 3.144 kabupaten di AS, yang menurut peneliti dihuni sekitar 94 persen populasi Amerika. Koleksi lengkapnya tersedia untuk peneliti, sementara lisensi dataset publik melarang penggunaan komersial. Data ini juga tidak mencantumkan tanggal efektif, sehingga ada kemungkinan aturan yang tercatat sudah usang.
"Kami melihat potensi besar untuk membangun chatbot yang dapat membandingkan peraturan antar kota tetangga," ujar salah satu peneliti, seraya menambahkan bahwa dataset ini masih dalam tahap penyempurnaan.
Meski menawarkan kemudahan, tim yang sama juga merilis benchmark draft bernama LEXCHEX yang justru mengingatkan akan keterbatasan AI. Benchmark ini menguji GPT-5.4, Gemini 3.1 Pro, dan Claude Opus 4.6 dengan 15.600 pertanyaan tentang ordinansi kabupaten di California dan Florida. Draft yang belum melalui peer-review tersebut menemukan bahwa model-model tersebut terlalu tidak dapat diandalkan untuk digunakan secara percaya diri, bahkan dengan bantuan pencarian web atau retrieval. Dalam satu contoh pertanyaan tentang Sierra County, California, dua dari tiga model menjawab salah. Tim menyatakan sedang memperbarui dataset dan akan mempresentasikan makalahnya pada Desember mendatang. Untuk saat ini, kode resmi kota tetap menjadi rujukan utama.
Bagi Indonesia, pengembangan serupa dapat menjadi pelajaran berharga. Ribuan peraturan daerah (perda) di Tanah Air juga tersebar di berbagai portal pemerintah dengan format yang tidak seragam. Jika AI mampu mengorganisasi dan menganalisis perda secara sistematis, transparansi regulasi dan kemudahan berusaha bisa meningkat signifikan. Namun, seperti ditunjukkan LEXCHEX, akurasi tetap menjadi tantangan utama. Diperlukan validasi oleh ahli hukum dan pembaruan data secara berkala agar teknologi ini tidak menyesatkan.
Ke depan, pertanyaan besarnya bukan lagi apakah AI dapat mengumpulkan peraturan, melainkan seberapa cepat ia dapat dipercaya untuk menafsirkannya. Selama model masih rentan keliru, masyarakat dan pelaku usaha sebaiknya tetap merujuk pada dokumen resmi, sambil menantikan generasi berikutnya yang lebih matang.



