Editorial ilmu komputer
Open AccessOA2026
NetCause: Pembelajaran Kontrafaktual untuk Analisis Akar Masalah di Jaringan Skala Besar
Kerangka graph-temporal swasupervisi yang memeringkat akar masalah melalui simulasi kontrafaktual, dilatih pada 1.500+ insiden produksi dan dievaluasi pada 31 kasus berlabel ahli.
Fabien Chraim; Jian Zhang; Dominik Janzing; Xiang Song; Christos Faloutsos; John Evansยท 2026ยท DOI 10.48550/arXiv.2606.13543
Masalah inti
Analisis akar masalah (RCA) di jaringan skala besar tetap menjadi tantangan kritis karena sifat dinamis dan kompleks dari propagasi gangguan di seluruh dependensi fisik dan logis. Teknik yang ada sering mengandalkan aturan statis, heuristik korelasi, atau penalaran lokal topologi, yang sulit digeneralisasi di lingkungan tempat gangguan menjalar melalui sistem yang saling bergantung. Makalah ini memperkenalkan NetCause, kerangka berbasis pembelajaran swasupervisi yang mengatasi keterbatasan tersebut dengan memodelkan insiden jaringan sebagai proses graph-temporal dan menggunakan simulasi kontrafaktual untuk memeringkat kandidat akar masalah. Tujuannya adalah menghasilkan peringkat hipotesis akar masalah yang dapat diinterpretasi dan terintegrasi secara alami dengan tindakan mitigasi dan remediasi yang ditetapkan operator. Penulis melatih NetCause pada lebih dari 1.500 insiden yang dikumpulkan selama enam bulan dari jaringan produksi penyedia cloud terkemuka dan mengevaluasinya pada 31 insiden berlabel ahli. Pertanyaan penelitian utamanya adalah apakah model yang dipelajari dapat menangkap pola propagasi gangguan dan secara kausal mengaitkan dampak pelanggan dengan akar masalah yang
Inovasi
Penulis mengevaluasi NetCause pada 31 insiden berlabel ahli dari jaringan produksi penyedia cloud terkemuka. Metrik utamanya adalah kualitas peringkat akar masalah, diukur dengan akurasi dalam mengidentifikasi akar masalah yang benar di antara kandidat teratas. NetCause mencapai peningkatan akurasi 16,1% dibandingkan baseline heuristik berbasis aturan. Peningkatan ini sangat signifikan pada rezim yang paling relevan untuk pengambilan keputusan operasional, di mana identifikasi akar masalah yang cepat dan akurat sangat kritis. Makalah ini melaporkan bahwa pelatihan intensif secara komputasi, tetapi inferensi efisien, hanya memerlukan beberapa detik runtime GPU per insiden. Efisiensi ini memastikan NetCause dapat diterapkan dalam pengaturan operasional waktu nyata tanpa menimbulkan penundaan di luar latensi pengumpulan telemetri yang umum. Hasilnya menunjukkan bahwa pendekatan simulasi kontrafaktual secara efektif menangkap propagasi gangguan dan atribusi kausal, mengungguli metode statis dan berbasis korelasi.
Analisis akar masalah (RCA) di jaringan skala besar tetap menjadi tantangan kritis karena sifat dinamis dan kompleks dari propagasi gangguan di seluruh dependensi fisik dan logis. Teknik yang ada sering mengandalkan aturan statis, heuristik korelasi, atau penalaran lokal topologi, yang sulit digeneralisasi di lingkungan tempat gangguan menjalar melalui sistem yang saling bergantung. Makalah ini memperkenalkan NetCause, kerangka berbasis pembelajaran swasupervisi yang mengatasi keterbatasan tersebut dengan memodelkan insiden jaringan sebagai proses graph-temporal dan menggunakan simulasi kontrafaktual untuk memeringkat kandidat akar masalah. Tujuannya adalah menghasilkan peringkat hipotesis akar masalah yang dapat diinterpretasi dan terintegrasi secara alami dengan tindakan mitigasi dan remediasi yang ditetapkan operator. Penulis melatih NetCause pada lebih dari 1.500 insiden yang dikumpulkan selama enam bulan dari jaringan produksi penyedia cloud terkemuka dan mengevaluasinya pada 31 insiden berlabel ahli. Pertanyaan penelitian utamanya adalah apakah model yang dipelajari dapat menangkap pola propagasi gangguan dan secara kausal mengaitkan dampak pelanggan dengan akar masalah yang mendasarinya, sehingga meningkatkan pengambilan keputusan operasional.
NetCause beroperasi dalam dua fase: pelatihan dan inferensi. Selama pelatihan, model belajar dari data insiden historis yang direpresentasikan sebagai proses graph-temporal. Setiap insiden dimodelkan sebagai urutan snapshot graf, di mana node merepresentasikan entitas jaringan (misalnya router, tautan, layanan) dan edge merepresentasikan dependensi. Model ini memakai objektif pembelajaran swasupervisi untuk menangkap dinamika propagasi gangguan tanpa memerlukan label eksplisit untuk setiap insiden. Simulasi kontrafaktual kemudian digunakan untuk menghasilkan skenario alternatif dengan mengganggu graf dan mengamati dampak yang dihasilkan, sehingga model dapat memeringkat kandidat akar masalah berdasarkan kontribusi kausalnya terhadap insiden yang diamati.
Mengapa penting
Temuan ini menunjukkan bahwa memodelkan insiden jaringan sebagai proses graph-temporal dan memanfaatkan simulasi kontrafaktual dapat secara signifikan meningkatkan analisis akar masalah di jaringan skala besar. Peningkatan akurasi 16,1% dibandingkan baseline heuristik berbasis aturan menunjukkan bahwa representasi kausal yang dipelajari lebih efektif daripada aturan statis atau heuristik korelasi, terutama di lingkungan dinamis tempat gangguan menjalar melalui dependensi yang kompleks. Peringkat hipotesis akar masalah yang dapat diinterpretasi memungkinkan operator memahami dan memercayai rekomendasi model, sehingga memudahkan integrasi dengan tindakan mitigasi dan remediasi. Namun, pendekatan ini memiliki batasan: pelatihan memerlukan sumber daya komputasi yang besar, dan kinerja model bergantung pada kualitas dan kuantitas data insiden historis. Evaluasi pada 31 insiden berlabel ahli, meskipun menjanjikan, relatif kecil, dan validasi lebih lanjut pada dataset yang lebih besar dan beragam diperlukan. Selain itu, objektif pembelajaran swasupervisi mungkin tidak menangkap semua nuansa propagasi gangguan, terutama untuk mode kegagalan yang langka atau baru. Pekerjaan selanjutnya dapat mengeksplorasi transfer learning untuk mengurangi biaya pelatihan dan memasukkan umpan balik operator untuk menyempurnakan peringkat. Secara keseluruhan, NetCause merupakan langkah menjanjikan menuju RCA yang berbasis kausal dan dapat diinterpretasi di jaringan produksi.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ