← नवीनतम पेपर
🤖 AI

Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability

यह शोध पत्र एक विफलता-जागरूक (failure-aware) अवलोकन ढांचे को प्रस्तुत करता है जो आवर्ती विफलता मोडों को ऑनलाइन ट्रेस संकेतों के साथ मैप करके मल्टी-एजेंट एलएलएम (LLM) प्रणालियों में बर्बाद हुई गणना का निदान करता है, जिससे अंतिम-उत्तर मूल्यांकन से पहले गैर-पुनर्प्राप्त प्रगति हानि का शीघ्र पता लगाना सक्षम होता है।

मूल लेखक: Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang, Mengwei Yuan, Jianan Liu, Jing Yang

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang, Mengwei Yuan, Jianan Liu, Jing Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक जटिल रहस्य सुलझाने के लिए तीन विशेषज्ञ जासूसों की एक टीम (एक "मल्टी-एजेंट एलएलएम सिस्टम") को काम पर रखा है। उनके पास फोन कॉल, यात्रा और अनुसंधान समय के लिए एक सीमित बजट है। उनका लक्ष्य सच्चाई का पता लगाना और एक अंतिम रिपोर्ट लिखना है।

कभी-कभी, वे मामला पूरी तरह से सुलझा लेते हैं। लेकिन अक्सर, वे एक डेड एंड (बंद रास्ते) पर पहुँच जाते हैं, भ्रमित हो जाते हैं, या चक्कर काटते रहते हैं, जिससे उनका पूरा बजट बर्बाद हो जाता है और वे हार मान लेते हैं या ऐसी रिपोर्ट लिखते हैं जिसका कोई अर्थ नहीं निकलता।

यह शोध पत्र इन जासूस टीमों के लिए एक "ब्लैक बॉक्स" डैशबोर्ड बनाने के बारे में है। केवल यह देखने के बजाय कि अंतिम रिपोर्ट अच्छी है या बुरी, यह डैशबोर्ड जासूसों को काम करते समय देखता है ताकि यह पहचाना जा सके कि वे कब समय और पैसा बर्बाद कर रहे हैं।

यहाँ इस शोध पत्र का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "मौन बर्बादी" (The Silent Waste)

वर्तमान में, यदि आप एक एआई टीम से कोई प्रश्न पूछते हैं, तो आपको केवल एक परिणाम मिलता है: सफलता या विफलता

  • दोष: यदि टीम विफल होती है, तो आपको केवल यह पता चलता है कि वे विफल रहे। आपको यह नहीं पता चलता कि वे क्यों विफल हुए या वे कब गलत रास्ते पर निकल पड़े थे।
  • उपमा: कल्पना कीजिए कि एक जीपीएस (GPS) केवल यह बताता है कि "आप गलत गंतव्य पर पहुँच गए।" यह आपको यह नहीं बताता कि आपने तीन मील पीछे गलत मोड़ लिया था, या आप एक घंटे तक ट्रैफिक के चक्कर में फंसे रहे। यह शोध पत्र तर्क देता है कि हमें केवल मंजिल को नहीं, बल्कि पूरी यात्रा को देखने की आवश्यकता है।

2. समाधान: "विफलता-जागरूक अवलोकन" (Failure-Aware Observability)

लेखकों ने एक ऐसा सिस्टम बनाया है जो एक ट्रैफिक पुलिसकर्मी और एक मैकेनिक के संयोजन की तरह कार्य करता है। यह एआई की "विचार प्रक्रिया" (ट्रेस) को वास्तविक समय में देखता है और विशिष्ट चेतावनी संकेतों की तलाश करता है।

उन्होंने पहचाना कि जासूस मुख्य रूप से किन पांच तरीकों से अपना बजट बर्बाद करते हैं:

  • टूटा हुआ टूल (The Broken Tool): जासूस एक टूल (जैसे सर्च इंजन या कोड कैलकुलेटर) का उपयोग करने की कोशिश करता है, लेकिन वह बार-बार क्रैश होता रहता है।
    • उपमा: एक ऐसी कार को स्टार्ट करने की कोशिश करना जो बार-बार बंद हो जाती है।
  • टूटा हुआ लूप (The Broken Loop): जासूस बार-बार एक ही सवाल पूछता है या एक ही क्रिया करता है बिना कुछ नया सीखे।
    • उपमा: एक हैम्स्टर (hamster) जो पहिये पर दौड़ रहा है। वह बहुत हिल-डुल रहा है, लेकिन कहीं पहुँच नहीं रहा है।
  • खाली खोज (The Empty Search): जासूस को बहुत सारे दस्तावेज़ मिलते हैं, लेकिन उनमें से किसी में भी वास्तव में उत्तर नहीं होता।
    • उपमा: एक रेसिपी खोजने के लिए 50 किताबें पढ़ना, केवल यह महसूस करने के लिए कि उनमें से किसी में भी सामग्री नहीं है जिसकी आपको आवश्यकता है।
  • बजट खत्म होना (The Budget Run-Out): जासूस काम पूरा करने से पहले ही अपना समय या पैसा खत्म कर देता है।
  • नकली उत्तर (The Fake Answer): जासूस एक अंतिम रिपोर्ट लिखता है, लेकिन वह मिले हुए किसी भी साक्ष्य द्वारा समर्थित नहीं होती है।

3. प्रयोग: "द GAIA टेस्ट ड्राइव"

शोधकर्ताओं ने इस डैशबोर्ड का परीक्षण 165 अलग-अलग रहस्य मामलों (जिसे GAIA बेंचमार्क कहा जाता है) पर किया, जो आसान (लेवल 1) से लेकर बहुत कठिन (लेवल 3) तक थे।

उन्होंने क्या पाया:

  • विफलता आम है: सबसे कठिन कार्यों पर भी, सिस्टम आधे समय लगभग विफल रहा।
  • कठिनाई के साथ बर्बादी बढ़ती है: जैसे-जैसे पहेलियाँ कठिन होती गईं, एआई ने बेहतर परिणाम प्राप्त किए बिना लगभग दोगुने "टोकन" (जो एआई की मुद्रा या मस्तिष्क शक्ति की तरह है) का उपयोग किया।
  • विफलता के अलग-अलग कारण:
    • आसान कार्यों पर, वे अक्सर इसलिए विफल हुए क्योंकि उन्हें सबूत नहीं मिल पाए।
    • कठिन कार्यों पर, वे अक्सर इसलिए विफल हुए क्योंकि वे "लूप" (एक ही गलती दोहराना) में फंस गए या उनका समय समाप्त हो गया।

4. "दो-स्तरीय" चेकअप (The "Two-Layer" Checkup)

यह शोध पत्र बर्बादी को समझने के लिए दो प्रकार के चेक का सुझाव देता है:

  1. सस्ता, तेज़ चेक (ऑनलाइन सिग्नल): यह सरल संख्याओं को देखता है, जैसे "क्या टूल क्रैश हुआ?" या "क्या उन्होंने एक ही क्रिया को दोहराया?" यह इंजन की लाइट चेक करने जैसा है। यह तेज़ है और तुरंत बताता है कि कुछ गलत है।
  2. गहरा, स्मार्ट चेक (ऑफलाइन ऑडिट): यह एक दूसरे, अधिक स्मार्ट एआई का उपयोग करता है जो अंतिम रिपोर्ट और साक्ष्य को पढ़ता है ताकि यह देख सके कि क्या वे वास्तव में मेल खाते हैं। यह एक वरिष्ठ जासूस द्वारा केस फाइल की समीक्षा करने जैसा है। यह अधिक सटीक है लेकिन इसे चलाने की लागत अधिक है।

5. मुख्य निष्कर्ष (The Big Takeaway)

यह शोध पत्र निष्कर्ष निकालता है कि हमें केवल अंतिम स्कोर को देखना बंद करना होगा।

यदि एक जासूस टीम 1,000केकामकेलिए1,000 के काम के लिए 10 का खर्च करती है, या यदि वे हार मानने से पहले घंटों तक चक्कर काटते रहते हैं, तो वह केवल उत्तर की विफलता नहीं, बल्कि प्रक्रिया (process) की विफलता है।

इस "विफलता-जागरूक" डैशबोर्ड का उपयोग करके, डेवलपर्स इन बर्बाद क्षणों को जल्दी पहचान सकते हैं। केवल यह कहने के बजाय कि "एआई विफल रहा," वे कह सकते हैं, "एआई स्टेप 4 पर एक लूप में फंस गया," या "एआई स्टेप 7 पर सबूतों की कमी के कारण रुक गया।" यह उन्हें सिस्टम के उस विशिष्ट भाग को ठीक करने की अनुमति देता जो टूटा हुआ है, बजाय इसके कि वे केवल अनुमान लगाएं।

संक्षेप में: यह शोध पत्र हमें एआई के "मस्तिष्क" को काम करते समय देखने का एक तरीका देता है, ताकि हम बहुत देर होने से पहले उसे समय और पैसा बर्बाद करने से पकड़ सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →