← नवीनतम पेपर
💻 computer science

FAME: Failure-Aware Mixture-of-Experts for Message-Level Log Anomaly Detection

FAME एक लेबल-कुशल, मिश्रण-ऑफ़-एक्सपर्ट्स (mixture-of-experts) फ्रेमवर्क है जो विषम प्रणालियों (heterogeneous systems) में विफलताओं की प्रभावी ढंग से पहचान करते हुए, उच्च-सटीक, संदेश-स्तर के लॉग विसंगति का पता लगाने के लिए हल्के ऑन-प्रिमाइज़ मॉडलों को प्रशिक्षित करने हेतु एकल ऑफलाइन LLM एनोटेशन पास का लाभ उठाता है, जिससे एनोटेशन लागत में काफी कमी आती है।

मूल लेखक: Huanchi Wang, Zihang Huang, Yifang Tian, Kristina Dzeparoska, Hans-Arno Jacobsen, Alberto Leon-Garcia

प्रकाशित 2026-05-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huanchi Wang, Zihang Huang, Yifang Tian, Kristina Dzeparoska, Hans-Arno Jacobsen, Alberto Leon-Garcia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, 24/7 चलने वाली फैक्ट्री के मैनेजर हैं। हर सेकंड, हजारों मशीनें कागज की छोटी पर्चियां (लॉग मैसेज) बना रही हैं जो यह बताती हैं कि वे क्या कर रही हैं। इनमें से ज्यादातर पर्चियां कहेंगी, "मैं ठीक हूँ," या "मैं अपना काम कर रहा हूँ।" लेकिन कभी-कभी, एक पर्ची कहती है, "मैं टूट गया हूँ!" या "कुछ गलत है!"

समस्या यह है कि आपको दिन में लाखों ऐसी पर्चियां मिलती हैं। यदि आप हर एक को पढ़ने की कोशिश करेंगे, तो आप पागल हो जाएंगे। यदि आप उन्हें बड़े समूहों में (जैसे, "पिछले 100 पर्चियां") पढ़ने की कोशिश करते हैं, तो आप शायद किसी समस्या को पकड़ लें, लेकिन आपको यह नहीं पता चलेगा कि किस विशिष्ट पर्ची ने अलार्म बजाया। आपको एक "मैं ठीक हूँ" वाली पर्ची खोजने के लिए सैकड़ों पर्चियों को मैन्युअल रूप से छानना पड़ेगा। यह धीमा, महंगा और निराशाजनक है।

यह पेपर FAME पेश करता है, जो एक नया सिस्टम है जिसे बिना किसी इंसान द्वारा लाखों लाइनों को पढ़े, तुरंत सटीक "टूटी हुई" पर्ची खोजने के लिए डिज़ाइन किया गया है।

FAME कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "एक ही आकार सबके लिए" वाला जाल (The "One-Size-Fits-All" Trap)

अधिकांश वर्तमान सिस्टम एक अकेले, अत्यधिक काम करने वाले सुरक्षा गार्ड की तरह काम करते हैं जो 1 करोड़ लोगों की भीड़ में चोर को पहचानने की कोशिश कर रहा है। वे समूहों को देखते हैं। यदि समूह संदिग्ध लगता है, तो वे पूरे समूह को चिह्नित कर देते हैं। लेकिन वास्तविक चोर को खोजने के लिए, आपको अभी भी उस समूह में मौजूद हर व्यक्ति का इंटरव्यू लेना होगा।

इसके अलावा, "चोर" (त्रुटियां) कई अलग-अलग रूपों में आते हैं: एक टूटा हुआ मेमोरी चिप, एक नेटवर्क ग्लिच, एक सॉफ्टवेयर क्रैश। एक ही गार्ड को एक साथ इन सभी अलग-अलग प्रकार के अपराधों को पहचानने के लिए सिखाना अविश्वसनीय रूप से कठिन है और इससे अक्सर गलतियां होती हैं।

2. समाधान: "विशेषज्ञों की टीम" (Mixture of Experts)

FAME खेल बदल देता है क्योंकि यह एक सामान्य विशेषज्ञ के बजाय विशेषज्ञों की एक टीम को काम पर रखता है।

  • अवधारणा: एक अस्पताल की कल्पना करें। इसके बजाय कि एक डॉक्टर हार्ट अटैक, टूटी हुई हड्डियों और फ्लू के लक्षणों को एक साथ डायग्नोज करने की कोशिश करे, आपके पास एक कार्डियोलॉजिस्ट, एक ऑर्थोपेडिस्ट और एक वायरोलॉजिस्ट होता है।
  • FAME इसे कैसे करता है: यह लाखों लॉग संदेशों को विभिन्न "फेलियर डोमेन" (जैसे अलग-अलग मेडिकल विभाग) में विभाजित करता है।
    • एक विशेषज्ञ केवल "मेमोरी एरर" को देखता है।
    • दूसरा केवल "नेटवर्क फेलियर" को देखता है।
    • तीसरा "सॉफ्टवेयर क्रैश" को देखता है।

चूंकि प्रत्येक विशेषज्ञ केवल एक विशिष्ट प्रकार की समस्या पर ध्यान केंद्रित करता है, इसलिए वे इसे पहचानने में अविश्वसनीय रूप से कुशल हो जाते हैं।

3. "स्मार्ट रिसेप्शनिस्ट" (The Router)

आप हर एक पर्ची को हर विशेषज्ञ के पास नहीं भेज सकते; इससे अराजकता मच जाएगी। FAME एक स्मार्ट रिसेप्शनिस्ट (एक हल्का AI राउटर) का उपयोग करता है।

  • जब एक नया लॉग मैसेज आता है, तो रिसेप्शनिस्ट उस पर एक नज़र डालता है और कहता है, "यह एक मेमोरी इश्यू लग रहा है," और तुरंत उसे मेमोरी एक्सपर्ट के पास भेज देता है।
  • यदि यह एक नेटवर्क इश्यू जैसा दिखता है, तो वह इसे नेटवर्क एक्सपर्ट के पास भेज देता है।
  • यदि यह एक सामान्य "मैं ठीक हूँ" वाला मैसेज है, तो वह इसे एक "यूनिवर्सल नॉर्मल" बिन में डाल देता है।

यह मिलीसेकंड में होता है। रिसेप्शनिस्ट को जीनियस होने की आवश्यकता नहीं है; उसे बस यह जानने की आवश्यकता है कि कौन सा दरवाजा खोलना है।

4. "एक बार का मंथन" (Using the Big AI)

यहाँ सबसे चतुर हिस्सा है। आप यह कैसे तय करते हैं कि किन विशेषज्ञों को काम पर रखना है और उनके जॉब टाइटल क्या होने चाहिए?

  • पुराना तरीका: आप पूरी टीम को शुरू से प्रशिक्षित करने की कोशिश कर सकते हैं, जिसके लिए लाखों लेबल किए गए उदाहरणों (एक इंसान द्वारा हर एक पर्ची को "टूटी हुई" या "ठीक" के रूप में टैग करना) को पढ़ने की आवश्यकता होती है। यह बहुत महंगा और धीमा है।
  • FAME का तरीका: आप केवल एक बार, ऑफलाइन, एक सुपर-इंटेलिजेंट AI (एक लार्ज लैंग्वेज मॉडल) को बुलाते हैं।
    • आप सुपर AI को विभिन्न त्रुटियों के कुछ उदाहरण दिखाते हैं।
    • सुपर AI कहता है, "ठीक है, मैं एक पैटर्न देख रहा हूँ। चलिए एक 'मेमोरी एरर' टीम, एक 'नेटवर्क एरर' टीम, आदि बनाते हैं।"
    • सुपर AI फैक्ट्री का नक्शा बनाता है और भूमिकाएं असाइन करता है।
    • महत्वपूर्ण रूप से: एक बार जब यह नक्शा बन जाता है, तो आप उस महंगे सुपर AI को फिर कभी नहीं बुलाते। आप उस दिन के लिए सुपर AI को काम से निकाल देते हैं।

उस बिंदु के बाद, फैक्ट्री पूरी तरह से सस्ते, तेज़, स्थानीय विशेषज्ञों और रिसेप्शनिस्ट पर चलती है।

5. "फ्यू-शॉट" ट्रिक (लेबल पर पैसे बचाना)

आमतौर पर, किसी विशेषज्ञ को प्रशिक्षित करने के लिए, आपको "टूटी हुई" पर्चियों के हजारों उदाहरणों की आवश्यकता होती है। FAME एक सांख्यिकीय ट्रिक का उपयोग करता है।

  • यदि आप एक विशिष्ट प्रकार के लॉग मैसेज (एक "टेम्प्लेट") को देखते हैं और आप 100 उदाहरण देखते हैं, और सभी 100 टूटे हुए हैं, तो आपको इसके लिए जटिल डिटेक्टर प्रशिक्षित करने की आवश्यकता नहीं है। आप बस रिसेप्शनिस्ट को बता सकते हैं: "यदि आप इस प्रकार का संदेश देखते हैं, तो यह टूटा हुआ है। इसे टूटे हुए ढेर में भेजें।"
  • यदि 100 उदाहरण मिश्रित हैं (कुछ टूटे हुए और कुछ ठीक), तब आप उस विशिष्ट समूह के लिए एक छोटा, स्थानीय डिटेक्टर प्रशिक्षित करते हैं।
  • परिणाम: हमें 4.7 मिलियन लाइनों को लेबल करने के लिए इंसानों की आवश्यकता नहीं थी, FAME को केवल लगभग 53,000 लाइनों को लेबल करने की आवश्यकता थी (76 गुना की कमी)। यह एक उत्पाद लाइन के हर आइटम की जांच करने के बजाय केवल कुछ नमूनों की जांच करने के लिए एक इंसान को काम पर रखने जैसा है।

6. परिणाम: तेज़, सस्ता और सटीक

  • गति: यह एक मानक कंप्यूटर पर प्रति घंटे 1 मिलियन से अधिक लॉग लाइन को प्रोसेस कर सकता है।
  • लागत: इसे सेटअप करने और चलाने में लगभग $10 खर्च होते हैं (मुख्य रूप से उस एक-बार के AI मंथन के लिए)। इसके विपरीत, हर एक लाइन को चेक करने के लिए एक बड़े AI का उपयोग करने में प्रति रन हजारों डॉलर खर्च होंगे।
  • सटीकता: एक वास्तविक दुनिया के सुपरकंप्यूटर डेटासेट पर, इसने बहुत कम गलत अलार्म के साथ 98% त्रुटियों को खोजा। इसने उन लॉग प्रकारों में भी त्रुटियां पाईं जिन्हें इसने पहले कभी नहीं देखा था, क्योंकि इसने संदेश की सामग्री के आधार पर अनुमान लगाया कि वे किस "विशेषज्ञ" से संबंधित हैं।

सारांश

FAME एक अत्यधिक कुशल फैक्ट्री निरीक्षण लाइन बनाने जैसा है। हर एक नोट को पढ़ने के लिए एक विशाल, महंगे रोबोट को काम पर रखने के बजाय, आप:

  1. एक स्मार्ट सलाहकार को एक बार वर्कफ़्लो डिजाइन करने के लिए कहते हैं।
  2. सस्ते, तेज़, स्थानीय विशेषज्ञों की एक टीम को काम पर रखते हैं जो केवल एक विशिष्ट प्रकार की समस्या को देखते हैं।
  3. नोट्स को सही विशेषज्ञ के पास भेजने के लिए एक सरल रिसेप्शनिस्ट का उपयोग करते हैं।

परिणाम यह है कि यह एक सिस्टम है जो तेज़, सस्ता है, इसे चलाने के लिए बहुत कम मानव प्रशिक्षण डेटा की आवश्यकता है, और यह तुरंत सटीक टूटे हुए हिस्से को ढूंढ लेता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →