Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2025

Model Bahasa Besar Hibrida untuk Pemeringkatan Dokumen Sadar Konteks dalam Data Telekomunikasi

Menggabungkan Pengambilan Leksikal, Probabilistik, dan Neural dengan Pembobotan Adaptif Kueri untuk Pencarian dan QA Telekomunikasi Spesifik Domain
Abhay Bindle; P. Singla; Sachin Sharma; A. Khakimov; R. Alkanhel; A. Muthanna· IEEE Access· 2025· DOI 10.1109/ACCESS.2025.3585637

Masalah inti

Model bahasa besar (LLM) telah menarik banyak perhatian karena kemampuan pemahaman dan penalaran mereka yang luar biasa, dan pengembangan berkelanjutan mereka membuka prospek tak terbatas untuk mengotomatiskan tugas-tugas di seluruh industri telekomunikasi. Setelah pra-pelatihan dan penyetelan halus, LLM dapat menjalankan berbagai aktivitas hilir sebagai respons terhadap instruksi manusia. Namun, *pipeline* pengambilan generik kurang cocok untuk korpus telekomunikasi, di mana dokumen-dokumen padat dengan bahasa standar, nama protokol, akronim, rentang parameter numerik, dan terminologi spesifik vendor. Makalah ini mengidentifikasi ketegangan yang terus-menerus dalam pencarian spesifik domain: model leksikal jarang cocok dengan token teknis yang tepat secara andal tetapi melewatkan parafrase, sementara *encoder* neural padat menangkap semantik tetapi dapat menyimpang dari istilah-istilah yang tepat dan bersinyal tinggi seperti pengidentifikasi dan label versi.

Para penulis membingkai masalah penelitian sebagai salah satu *pemeringkatan dokumen sadar konteks* untuk tanya jawab telekomunikasi, di mana sistem harus menyelaraskan maksud kueri dengan dokumen yang diambil daripada hanya

Inovasi

Evaluasi kinerja dilakukan menggunakan empat ukuran pelengkap: Skor BLEU, metrik ROUGE, Kesamaan Kosinus, dan Kesamaan Word2Vec. Ini mencakup tumpang tindih bentuk permukaan dengan teks referensi (BLEU, ROUGE) dan kesepakatan tingkat representasi antara kueri dan konten yang diambil (Kesamaan Kosinus, Kesamaan Word2Vec), yang sesuai untuk kerangka kerja yang harus melayani pemeringkatan ekstraktif dan generasi hilir.

Hasil yang dilaporkan konsisten di seluruh keluarga metrik ini: model hibrida mengungguli *baseline* pengambilan konvensional dalam tugas-tugas berorientasi presisi dan *recall*. Makalah ini lebih lanjut melaporkan bahwa model yang diusulkan secara efektif menyelaraskan maksud kueri dengan dokumen yang diambil dan menghasilkan peningkatan efisiensi pencarian spesifik domain. Karena evaluasi mencakup metrik tumpang tindih leksikal dan kesamaan ruang *embedding*, peningkatan ini tidak dapat diatribusikan pada satu paradigma pengambilan tunggal — *baseline* jarang kuat pada tumpang tindih token yang tepat, *baseline* padat pada kedekatan semantik, dan sistem yang digabungkan, dibobot secara dinamis dilaporkan unggul pada kombinasi tersebut.

Desain pemeringkatan multi-ta

Model bahasa besar (LLM) telah menarik banyak perhatian karena kemampuan pemahaman dan penalaran mereka yang luar biasa, dan pengembangan berkelanjutan mereka membuka prospek tak terbatas untuk mengotomatiskan tugas-tugas di seluruh industri telekomunikasi. Setelah pra-pelatihan dan penyetelan halus, LLM dapat menjalankan berbagai aktivitas hilir sebagai respons terhadap instruksi manusia. Namun, *pipeline* pengambilan generik kurang cocok untuk korpus telekomunikasi, di mana dokumen-dokumen padat dengan bahasa standar, nama protokol, akronim, rentang parameter numerik, dan terminologi spesifik vendor. Makalah ini mengidentifikasi ketegangan yang terus-menerus dalam pencarian spesifik domain: model leksikal jarang cocok dengan token teknis yang tepat secara andal tetapi melewatkan parafrase, sementara *encoder* neural padat menangkap semantik tetapi dapat menyimpang dari istilah-istilah yang tepat dan bersinyal tinggi seperti pengidentifikasi dan label versi.
Para penulis membingkai masalah penelitian sebagai salah satu *pemeringkatan dokumen sadar konteks* untuk tanya jawab telekomunikasi, di mana sistem harus menyelaraskan maksud kueri dengan dokumen yang diambil daripada hanya mengembalikan teks yang terkait secara topikal. Tujuan yang dinyatakan adalah merancang pendekatan pengambilan dan pemeringkatan hibrida yang mengintegrasikan model pengambilan berbasis statistik, probabilistik, dan jaringan neural untuk meningkatkan kinerja pengambilan informasi dalam domain telekomunikasi. Daripada memilih satu paradigma pengambilan tunggal, penelitian ini menempatkan sinyal leksikal dan semantik sebagai komponen pelengkap yang akan digabungkan di bawah kebijakan yang dapat dikontrol dan sensitif kueri — sebuah keberangkatan eksplisit dari skema pembobotan *ensemble* statis. Kontribusinya oleh karena itu ada dua: arsitektur pemeringkatan multi-tahap, dan mekanisme pembobotan dinamis yang memungkinkan adaptasi waktu nyata untuk tugas-tugas QA spesifik telekomunikasi.

Mengapa penting

Klaim analitis utama penelitian ini adalah bahwa pengambilan spesifik domain dalam telekomunikasi kurang diuntungkan dari penggantian pemeringkatan tradisional daripada dari *penggabungannya* dengan semantik neural di bawah kontrol adaptif. TF-IDF dan BM25 mengkodekan statistik frekuensi yang membuat token teknis yang tepat bersifat diskriminatif; SBERT dan Word2Vec menyediakan generalisasi kontekstual yang memungkinkan kueri tentang suatu prosedur cocok dengan dokumen yang diungkapkan dengan kosakata yang berbeda. Karena koefisien fusi dikondisikan pada fitur kueri daripada ditetapkan secara *offline*, arsitektur ini mempertahankan interpretasi bagian-bagiannya sambil berperilaku berbeda di seluruh rezim kueri.

Beberapa implikasi mengikuti untuk praktik. Pertama, penemuan pengetahuan dan pengambilan keputusan dalam telekomunikasi dan pemrosesan dokumen teknis akan diuntungkan dari lapisan pemeringkatan yang dapat diaudit: seorang operator dapat memeriksa apakah suatu hasil didorong oleh bukti leksikal atau semantik. Kedua, desain hibrida ini ortogonal terhadap LLM yang mendasarinya, karena ia mengatur *apa* yang diambil daripada *bagaimana* teks dihasilkan — menjadikannya lapisan dasar yang dapat digunakan kembali untuk asisten telekomunikasi yang mengikuti instruksi.

Keterbatasan diakui melalui ruang lingkup masa depan yang dinyatakan dalam makalah. Para penulis mengidentifikasi teknik *embedding* dinamis untuk menangani adaptasi domain, dan optimasi pemeringkatan berbasis perhatian untuk pengambilan informasi bentuk panjang, sebagai langkah selanjutnya. Ini menunjukkan dua masalah terbuka: *embedding* yang dapat diperbarui seiring berkembangnya standar telekomunikasi tanpa pengindeksan ulang yang mahal, dan sinyal pemeringkatan yang memperhatikan dokumen panjang di mana bukti yang relevan jarang dan tersebar. Evaluasi juga bergantung pada metrik tumpang tindih dan kesamaan, yang sensitivitasnya terhadap parafrase dan konsistensi faktual berbeda dari penilaian manusia — sebuah area di mana peningkatan presisi dan *recall* yang dilaporkan akan mendapat manfaat dari validasi tingkat tugas dalam pengaturan QA telekomunikasi yang diterapkan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…