← नवीनतम पेपर
🤖 machine learning

FailureAtlas: A Taxonomy of Failure Modes in Multi-Provider LLM Serving Infrastructure

यह शोधपत्र FailureAtlas प्रस्तुत करता है, जो मूल परत (origin layer) और पता लगाने की क्षमता (detectability) के आधार पर मल्टी-प्रदाता LLM सर्विंग गेटवे में विफलता मोड को वर्गीकृत करने वाला एक द्वि-अक्षीय वर्गीकरण (two-axis taxonomy) है, जो यह प्रकट करता है कि सबसे परिचालन रूप से गंभीर मुद्दे वे "मौन" (silent) विफलताएं हैं जो सफल HTTP प्रतिक्रियाएं लौटाते हुए भी एप्लिकेशन की स्थिति (application state) को दूषित कर देते हैं।

मूल लेखक: Vishal Pandey, Gopal Singh

प्रकाशित 2026-07-21
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vishal Pandey, Gopal Singh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक लाइब्रेरी चला रहे हैं जहाँ हजारों लोग एक सुपर-स्मार्ट रोबोट लाइब्रेरियन से मदद मांग रहे हैं। पुराने दिनों में, आप बस रोबोट से पूछते और वह जवाब दे देता। लेकिन अब, लाइब्रेरी इतनी बड़ी हो गई है कि कोई भी अकेला रोबोट भीड़ को नहीं संभाल सकता। इसलिए, लाइब्रेरियनों ने एक "गेटवे" (Gateway) बनाया है—एक बेहद कुशल रिसेप्शनिस्ट जो भीड़ और रोबोटों के बीच खड़ा है। इस गेटवे का काम आपका सवाल लेना, यह पता लगाना कि कौन सा रोबोट खाली है, सवाल को वहां भेजना और जवाब वापस लाना है। यह इंटरनेट के लिए एक ट्रैफिक पुलिसकर्मी की तरह है, जो सुनिश्चित करता है कि हर किसी को अपनी बारी मिले और कुछ भी खो न जाए।

लेकिन पेचीदा हिस्सा यह है कि ये रोबट (जिन्हें लार्ज लैंग्वेज मॉडल्स कहा जाता है) सिर्फ एक शब्द के जवाब नहीं देते। वे लंबी कहानियाँ सुनाते हैं, एक बार में एक शब्द करके, जैसे पानी की एक धारा। और वे बातचीत में पहले कही गई हर बात को याद रखते हैं। इसका मतलब है कि गेटवे को अविश्वसनीय रूप से सावधान रहना होगा। वह सिर्फ संदेश पास नहीं कर सकता; उसे कहानी को सही रखना होगा, यह याद रखना होगा कि कौन किससे बात कर रहा है, और यह सुनिश्चित करना होगा कि शब्दों की धारा आपस में न मिल जाए। यदि गेटवे गलती करता है, तो रोबोट भले ही सही जवाब दे, लेकिन वह गलत सवाल का जवाब दे सकता है, या वह भूल सकता है कि आपने उसे कविता लिखने को कहा था और इसके बजाय किराने की सूची लिख सकता है। समस्या यह है कि गेटवे को अक्सर पता भी नहीं चलता कि उसने गलती की है। वह बस कहता है, "काम पूरा हुआ!" और आगे बढ़ जाता है।

यहीं पर एक नया पेपर FAILUREATLAS आता है। लेखक, जो डिजिटल जासूसों की तरह हैं, ने महसूस किया कि जबकि हमारे पास सामान्य रूप से कंप्यूटर के टूटने के नक्शे हैं, हमारे पास इन विशिष्ट "गेटवे" प्रणालियों के विफल होने के तरीके का कोई नक्शा नहीं है। उन्होंने एक नया प्रकार का नक्शा बनाया—एक "टैक्सोनॉमी" (Taxonomy)—जो ठीक से वर्गीकृत करता है कि चीजें कैसे गलत होती हैं। उन्होंने पाया कि सबसे खतरनाक विफलताएं वे नहीं हैं जो सिस्टम को क्रैश करती हैं और मदद के लिए चिल्लाती हैं (जैसे एक टूटा हुआ बल्ब)। इसके बजाय, सबसे खराब विफलताएं "साइलेंट" (Silent) होती हैं। वे मशीन में एक भूत की तरह होती हैं: सिस्टम पूरी तरह स्वस्थ दिखता है, लाइटें हरी हैं, लेकिन रोबोट द्वारा सुनाई जाने वाली कहानी गुप्त रूप से दूषित हो चुकी है। पेपर केवल अनुमान नहीं लगाता; उन्होंने इन प्रणालियों का स्ट्रेस-टेस्ट किया और पाया कि ऐसा पांच विशिष्ट तरीकों से होता है, जो यह साबित करता है कि हमारे कंप्यूटरों को देखने का वर्तमान तरीका सबसे खतरनाक बग्स के प्रति अंधा है।

टूटी हुई चीजों का नक्शा

लेखकों ने इन विफलताओं को क्रमबद्ध करने के लिए एक सरल दो-भाग वाला ग्रिड बनाया है। एक शतरंज के बोर्ड की कल्पना करें जहाँ पंक्तियाँ (Rows) यह बताती हैं कि कहाँ टूट हुआ और कॉलम (Columns) यह बताते हैं कि हम इसे कैसे नोटिस करते हैं।

पंक्तियाँ (कहाँ टूटता है):

  1. सड़क (नेटवर्क/ट्रांसपोर्ट): केबल या वाई-फाई गड़बछाड़ कर रहे हैं, या कंप्यूटर एक साथ दो चीजें करने की कोशिश कर रहा है और फंस गया है।
  2. धारा (स्ट्रीमिंग/प्रोटोकॉल): रोबोट शब्दों को पानी की तरह बाहर निकाल रहा है, लेकिन गेटवे बूंदों की गिनती करने में गलती कर रहा है, जिससे शब्द बकवास में मिल रहे हैं।
  3. स्मृति (स्टेट/सेशन): गेटवे भूल जाता है कि आपने पांच मिनट पहले क्या कहा था, या इससे भी बुरा, वह आपकी बातचीत को आपके दोस्त की बातचीत के साथ मिला देता है।
  4. दिमाग (मॉडल व्यवहार): रोबдно खुद अजीब व्यवहार करने लगते हैं (हालांकि लेखक स्वीकार करते हैं कि अभी ठोस सबूतों के साथ इसे साबित करना कठिन है)।
  5. बटुआ (गवर्नेंस/लागत): सिस्टम पैसे बचाने या उपयोग को सीमित करने की कोशिश करता है लेकिन गलती से दरवाजा हमेशा के लिए बंद कर देता है।

कॉलम (हम इसे कैसे नोटिस करते हैं):

  • लाउड (Loud): सिस्टम चिल्लाता है! यह क्रैश हो जाता है, लाल एरर मैसेज दिखाता है, या काम करना बंद कर देता है। हम इसे तुरंत देख लेते हैं।
  • साइलेंट (Silent): सिस्टम फुसफुसाता है। यह कहता है "सब ठीक है!" (HTTP 200), लेकिन जवाब गलत है। यह डरावना हिस्सा है क्योंकि कोई इसकी तलाश ही नहीं कर रहा होता।

मशीन में पांच भूत

पेपर इन विफलताओं को भरने के लिए पांच वास्तविक, सत्यापित उदाहरण देता है। तीन अन्य डेवलपर्स की सार्वजनिक बग रिपोर्टों को देखकर पाए गए थे, और दो लेखक स्वयं अपने सिस्टम का स्ट्रेस-टेस्ट करते समय खोजे गए थे।

1. "कॉपी-पेस्ट" का गड़बड़ (साइलेंट)

  • क्या हुआ: जब रोबोट एक साथ कई निर्देश भेजता है (जैसे "बिल्ली बनाओ" और "कविता लिखो"), तो वह उन्हें एक स्ट्रीम में भेजता है। गेटवे ने इन निर्देशों को गिनने की कोशिश की लेकिन हर एक शब्द प्राप्त होने पर अपना काउंटर रीसेट कर दिया।
  • परिणाम: गेटवे ने कंप्यूटर को बताया, "यहाँ दो निर्देश हैं!" लेकिन वास्तव में उन्हें एक बड़े, उलझे हुए ढेर के रूप में भेजा। कंप्यूटर ने इसे पढ़ने की कोशिश की, विफल रहा, और बाद में क्रैश हो गया। गेटवे को कभी पता ही नहीं चला कि उसने कुछ गलत किया है; उसे लगा कि उसने अपना काम कर दिया।
  • समाधान: गेटवे को निर्देशों का एक चलता हुआ हिसाब रखना चाहिए, न कि हर शब्द के लिए उसे रीसेट करना चाहिए।

2. "हमेशा के लिए बंद" दरवाजा (लाउड)

  • क्या हुआ: गेटवे एक डिजिटल "काउंटर" का उपयोग करता है ताकि यह सुनिश्चित हो सके कि वह रोबोट से एक साथ बहुत अधिक सवाल न पूछे। यदि रोबोट बीमार हो जाता है और जवाब देना बंद कर देता है, तो गेटवे को काउंटर कम करना चाहिए। लेकिन यदि गेटवे काउंटर कम करने की कोशिश करते समय क्रैश हो जाता है, तो काउंटर "फुल" पर ही अटक जाता है।
  • परिणाम: भले ही रोबोट ठीक हो, गेटवे सोचता है कि वह फुल है और सभी को अस्वीकार करने लगता है। यह एक बाउंसर की तरह है जो सोचता है कि क्लब भरा हुआ है क्योंकि वह बाहर जाने वाले लोगों को दर्ज करना भूल गया।
  • समाधान: सुनिश्चित करें कि काउंटर हमेशा नीचे जाए, भले ही चीजें गलत हो जाएं।

3. "ट्रैफिक जाम" (लाउड)

  • क्या हुआ: रोबोट एक पल के लिए बीमार हो गया। गेटवे ने 100 अलग-अलग कंप्यूटरों को एक ही सेकंड में "फिर से प्रयास करें!" करने के लिए कहा।
  • परिणाम: सभी 100 कंप्यूटरों ने एक साथ रोबोट पर हमला किया, जिससे "थंडरिंग हर्ड" (Thundering Herd) पैदा हुआ। रोबोट इतना अभिभूत हो गया कि वह पूरी तरह से क्रैश हो गया, और गेटवे उबर नहीं सका।
  • समाधान: कंप्यूटरों को दोबारा प्रयास करने से पहले याद से कुछ समय इंतजार करने के लिए कहें, ताकि वे एक साथ रोबोट पर हमला न करें।

4. "भूलने की बीमारी" (साइलेंट)

  • क्या हुआ: यह लेखकों की अपनी खोज थी। उनके पास दो कंप्यूटर एक ही समय में रोबोट से बात कर रहे थे। क्योंकि गेटवे तेज़ होने की कोशिश कर रहा था, उसने दोनों कंप्यूटरों को बातचीत की एक ही "मेमोरी" साझा करने दी।
  • परिणाम: कंप्यूटर A ने एक सवाल पूछा, और कंप्यूटर B ने उसका जवाब दिया। फिर कंप्यूटर A ने एक फॉलो-अप सवाल पूछने की कोशिश की, लेकिन गेटवे ने कंप्यूटर B के डेटा के साथ उसकी मेमोरी को पहले ही ओवरराइट कर दिया था। रोबोट ने उस सवाल का जवाब दिया जो कभी पूछा ही नहीं गया था। सिस्टम ने "सफलता!" कहा, लेकिन बातचीत का कोई अर्थ नहीं था।
  • समाधान: हर बातचीत को अपनी निजी नोटबुक दें ताकि वे एक-दूसरे के पन्ने चुरा न सकें।

5. "जमी हुई हथेली" (लाउड)

  • क्या हुआ: गेटवे को बहुत तेज़ और कई चीजें एक साथ संभालने के लिए बनाया गया था। लेकिन इसके एक हिस्से ने एक धीमा, पुराना कार्य (जैसे डेटाबेस चेक करना) करने की कोशिश की जबकि इसे तेज़ चीजें करनी चाहिए थीं।
  • परिणाम: उस एक धीमे कार्य ने पूरे गेटवे को फ्रीज कर दिया। यह किसी भी अन्य प्रश्न का उत्तर नहीं दे सका, और सिस्टम ने सोचा कि गेटवे मर गया है, इसलिए इसने इसे बार-बार रीस्टार्ट करने की कोशिश की।
  • समाधान: धीमी प्रक्रियाओं को तेज़ प्रक्रियाओं को फ्रीज न करने दें; उन्हें एक अलग लाइन में रखें।

बड़ा सबक: साइलेंट किलर

सबसे महत्वपूर्ण बात जो पेपर ने पाई वह यह है कि सबसे डरावने बग वे हैं जिन्हें हम देख नहीं सकते।

कंप्यूटर की दुनिया में, हम आमतौर पर "लाउड" विफलताओं को देखते हैं। यदि कोई सर्वर क्रैश होता है, तो हम उसे ठीक करते हैं। यदि कोई एरर कोड दिखाई देता है, तो हम उसे ठीक करते हैं। लेकिन लेखक दिखाते हैं कि इन नई AI प्रणालियों में, "साइलेंट" विफलताएं बहुत बदतर हैं। वे एक आदर्श "OK" संदेश लौटाते हैं, सभी हेल्थ चेक पास करते हैं, और ऐसा लगता है जैसे सब कुछ ठीक चल रहा है। लेकिन अंदर ही अंदर, बातचीत का इतिहास डिलीट हो रहा है, निर्देश आपस में मिल रहे हैं, और रोबोट धीरे-धीरे अपना मानसिक संतुलन खो रहा है।

पेपर का तर्क है कि हमें एक नए प्रकार के "वॉचडॉग" (Watchdog) की आवश्यकता है। हम केवल यह चेक नहीं कर सकते कि कंप्यूटर चालू है या नहीं; हमें यह देखना होगा कि क्या कहानी समझ में आ रही है। हमें ऐसे उपकरणों की आवश्यकता है जो बातचीत को पढ़ सकें और कह सकें, "हे, रोबोट अभी तीन टर्न पहले कही गई बात भूल गया है," भले ही कंप्यूटर कहे कि सब कुछ ठीक है। जब तक हम वे उपकरण नहीं बनाते, तब तक हमारे AI इंफ्रास्ट्रक्चर के सबसे खतरनाक बग अदृश्य भूत बने रहेंगे, जो चुपचाप चीजों को बिगाड़ते रहेंगे जबकि हमें लगेगा कि सब कुछ एकदम सही है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →