← नवीनतम पेपर
💻 computer science

Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows

यह शोध पत्र Trajel प्रस्तुत करता है, जो एक डेटासेट और मूल्यांकन ढांचा है जो पांच विशिष्ट विफलता प्रकारों को वर्गीकृत करके मल्टी-एजेंट औद्योगिक वर्कफ़्लो में प्रक्षेपवक्र-स्तरीय (trajectory-level) मतिभ्रम का ऑडिट करता है, यह प्रदर्शित करते हुए कि मौजूदा बेंचमार्क महत्वपूर्ण मध्यवर्ती त्रुटियों को छोड़ देते हैं और सुरक्षित एजेंटिक परिनियोजन के लिए वर्गीकरण-आधारित, प्रक्षेपवक्र-जागरूक पहचान आवश्यक है।

मूल लेखक: Harshada Badave, Santosh Borse, Andrea Gomez, Harshitha Narahari, Sara Carter, Vishwa Bhatt, Aishani Rachakonda, Shuxin Lin, Dhaval Patel

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Harshada Badave, Santosh Borse, Andrea Gomez, Harshitha Narahari, Sara Carter, Vishwa Bhatt, Aishani Rachakonda, Shuxin Lin, Dhaval Patel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक जटिल मशीन को ठीक करने के लिए विशेषज्ञ रोबोटों की एक टीम को काम पर रखा है। आप केवल उनसे अंतिम मरम्मत रिपोर्ट नहीं मांगते; बल्कि आप उनकी पूरी प्रक्रिया को देखते हैं: वे क्या सोचते हैं, वे कौन से उपकरण उठाते हैं, वे क्या देखते हैं, और वे आपस में कैसे बात करते हैं।

यह शोध पत्र, जिसे Trajel कहा जाता है, इस बारे में है कि इन रोबोटों को उनके काम के बीच में "सपने" देखते हुए (भ्रम या Hallucination करते हुए) कैसे पकड़ा जाए, न कि केवल तब जब वे अंतिम उत्तर गलत देते हैं।

यहाँ सरल उपमाओं का उपयोग करके इस शोध पत्र का विवरण दिया गया है:

1. समस्या: "अंतिम उत्तर" का जाल

वर्तमान में अधिकांश AI परीक्षण एक छात्र के निबंध को केवल उसके अंतिम वाक्य को पढ़कर ग्रेड देने के समान हैं। यदि निष्कर्ष अच्छा दिखता है, तो छात्र को 'A' ग्रेड मिल जाता है। लेकिन क्या होगा यदि छात्र ने दूसरे पैराग्राफ में तथ्य बना लिए हों, तीसरे पैराग्राफ में एक पूरा चरण छोड़ दिया हो, या चौथे पैराग्राफ में गलत शिक्षक से बात की हो?

वास्तविक दुनिया में, औद्योगिक रोबोट (एजेंट) केवल निबंध नहीं लिखते; वे सेंसर की जांच करने या पुर्जों का ऑर्डर देने जैसे बहु-चरणीय कार्य करते हैं। यदि कोई रोबोट सुरक्षा जांच को छोड़ देता है या गलत सिस्टम से बात करता है, तो वह अभी भी एक "सही दिखने वाला" अंतिम उत्तर दे सकता है, लेकिन मशीन फिर भी टूट सकती है। यह शोध पत्र तर्क देता है कि हमें केवल मंजिल को ही नहीं, बल्कि पूरी यात्रा (ट्रैजेक्टरी) का ऑडिट करने की आवश्यकता है।

2. नया टूल: एक "हैलुसिनेशन वर्गीकरण" (Hallucination Taxonomy)

लेखकों ने एक नया तरीका बनाया है जिससे यह वर्गीकृत किया जा सके कि रोबोट कैसे भ्रमित होते हैं। वे इसे एक Taxonomy (वर्गीकरण प्रणाली के लिए एक फैंसी शब्द) कहते हैं। उन्होंने पाया कि रोबोट काम करते समय पांच विशिष्ट तरीकों से "सपने" देखते हैं:

  • तथ्यात्मक (झूठा): रोबोट कहता है, "तापमान 100 डिग्री है," लेकिन सेंसर ने वास्तव में 20 कहा था। वह डेटा खुद बना रहा है।
  • संदर्भ संबंधी (भूत/Ghost): रोबोट कहता है, "मैंने अभी नीला वाल्व चेक किया," लेकिन उसने कभी नीला वाल्व चेक ही नहीं किया। वह उन चीजों को याद कर रहा है जो कभी हुई ही नहीं।
  • तार्किक (भ्रमित): रोबोट कहता है, "मशीन गर्म है, इसलिए मुझे हीटर चालू करना चाहिए।" यहाँ तर्क टूटा हुआ है, भले ही तथ्य सही हों।
  • प्रक्रियात्मक (छोड़ने वाला/Skipper): रोबोट कहता है, "मैंने काम पूरा कर लिया," लेकिन वास्तव में उसने उस चरण को छोड़ दिया जहाँ उसे तेल के दबाव को सत्यापित करना था। वह वह काम करने का नाटक कर रहा है जो उसने वास्तव में नहीं किया।
  • दायरा (बहरूपिया/Imposter): रोबोट कहता है, "मैंने इंजन ठीक कर दिया," लेकिन वह वास्तव में एक ऐसा रोबोट है जिसे केवल टायर चेक करने के लिए बनाया गया है। वह वह काम कर रहा है जिसके लिए उसे काम पर नहीं रखा गया था।

मुख्य निष्कर्ष: शोध पत्र में पाया गया कि लगभग आधी बार जब रोबोट गलती करते हैं, तो वे एक साथ इनमें से कई चीजें करते हैं। यह केवल एक गलती नहीं है; यह एक श्रृंखला अभिक्रिया (chain reaction) है।

3. डेटासेट: "Trajel"

इसका अध्ययन करने के लिए, शोधकर्ताओं ने Trajel नामक एक विशाल लाइब्रेरी बनाई।

  • इसके अंदर क्या है? औद्योगिक मशीनों (जैसे कूलिंग सिस्टम) को ठीक करने की कोशिश करने वाले रोबोटों की 225 विस्तृत रिकॉर्डिंग।
  • किसने इसकी जांच की? उन्होंने काम की जांच के लिए किसी अन्य AI का उपयोग नहीं किया। उन्होंने मानव विशेषज्ञों (जैसे वरिष्ठ इंजीनियरों) से रोबोट की विचार प्रक्रिया के हर एक चरण को पढ़ा ताकि यह देखा जा सके कि वह कहाँ गलत हुआ।
  • परिणाम: उन्होंने पाया कि रोबोट उम्मीद से कहीं अधिक बार विफल होते हैं (रोबोट मॉडल के आधार पर 52% से 81% के बीच), और इनमें से कई विफलताएं अदृश्य होती हैं यदि आप केवल अंतिम परिणाम को देखते हैं।

4. जासूसी कार्य: क्या AI, AI को पकड़ सकता है?

शोधकर्ताओं ने इन गलतियों को स्वचालित रूप से पकड़ने के लिए कंप्यूटर प्रोग्राम (डिटेक्टर) बनाने की कोशिश की।

  • अच्छी खबर: सरल जाँच स्पष्ट झूठ (तथ्यात्मक) या छूटे हुए चरणों (प्रक्रियात्मक) के लिए अच्छी तरह काम करती है।
  • बुरी खबर: डिटेक्टर "भूत" (संदर्भ संबंधी) और "भ्रमित" (तार्किक) गलतियों को पकड़ने में बहुत खराब हैं। उन्नत AI भी यह बताने में संघर्ष करता है कि क्या कोई रोबोट ऐसी चीज़ों को याद कर रहा है जो कभी हुई ही नहीं, या उसका तर्क कितना उलझा हुआ है।
  • सरप्राइज विजेता: सबसे अच्छा "डिटेक्टर" एक जटिल AI मॉडल नहीं था। यह एक सरल स्पष्टता जांच (Clarity Check) थी। यदि रोबोट का तर्क स्पष्ट और न्यायसंगत लग रहा था, तो वह आमतौर पर सही था। यदि रोबंतु अस्पष्ट लग रहा था या वह यह समझाने में असमर्थ था कि उसने कुछ क्यों किया, तो वह लगभग निश्चित रूप से भ्रमित (hallucinating) था (94% बार)।

5. यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि हम औद्योगिक रोबोट से केवल अंतिम उत्तर पर भरोसा नहीं कर सकते। हमें ऐसे "सुरक्षा जाल" (safety nets) बनाने की आवश्यकता है जो वास्तविक समय में रोबोट की पूरी विचार प्रक्रिया पर नज़र रखें।

यदि कोई रोबोट चरण छोड़ना (प्रक्रियात्मक) शुरू कर देता है या उन उपकरणों के बारे में बात करता है जो उसके पास नहीं हैं (संदर्भ संबंधी), तो सिस्टम को मशीन के टूटने का इंतज़ार करने के बजाय उसे तुरंत रोकना होगा। यह शोध पत्र भविष्य के औद्योगिक स्वचालन (automation) के लिए इन सुरक्षा जालों को बनाने में मदद करने हेतु उपकरणों और नियमों का पहला सेट प्रदान करता है।

संक्षेप में: पहले हम केवल यह देखते थे कि रोबोट ने काम पूरा किया या नहीं। अब, Trajel की मदद से, हम जानते हैं कि हमें यह देखना होगा कि वह कैसे सोचता है, उसे क्या याद रहता है, और वह किससे बात करता है, क्योंकि असली खतरा वहीं छिपा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →