Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
यह शोध पत्र TRACE प्रस्तुत करता है, जो एक संदर्भ-मुक्त (reference-free) ढांचा है जो टूल-ऑगमेंटेड LLMs के बहु-आयामी तर्क पथों (reasoning trajectories) को कुशलतापूर्वक और सटीक रूप से मूल्यांकन करने के लिए एक साक्ष्य बैंक (evidence bank) का लाभ उठाता है, जो पारंपरिक उत्तर-मिलान मेट्रिक्स और ग्राउंड-ट्रुथ एनोटेशन की उच्च लागत की सीमाओं को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ी समस्या: केवल कवर देखकर किताब का न्याय करना
कल्पना कीजिए कि आपने एक विशिष्ट व्यंजन बनाने के लिए दो अलग-अलग शेफ को काम पर रखा है।
- शेफ A रेसिपी का पूरी तरह से पालन करता है, ताजी सामग्री का उपयोग करता है, और 20 मिनट में काम पूरा कर लेता है।
- शेफ B पहले बर्तन को जला देता है, एक टूटे हुए चाकू का उपयोग करने की कोशिश करता है, सामग्रियों का अनुमान लगाता है, और गलती से चीनी के बजाय नमक डाल देता है, लेकिन फिर भी किसी तरह एक ऐसी प्लेट तैयार कर लेता है जो दिखने में बिल्कुल तैयार व्यंजन जैसी ही होती है।
यदि आप केवल अंतिम प्लेट का स्वाद लेते हैं, तो दोनों शेफ को "पास" मिल जाता है। लेकिन यदि आपने उन्हें खाना बनाते हुए देखा होता, तो आप जानते कि शेफ A एक पेशेवर है और शेफ B एक आपदा है जो कभी भी घटित हो सकती है।
यह बिल्कुल वही है जो इस पेपर के लेखक AI एजेंट्स (स्मार्ट कंप्यूटर प्रोग्राम जो कैलकुलेटर या सर्च इंजन जैसे टूल्स का उपयोग करते हैं) के बारे में कह रहे हैं। वर्तमान में, हम इन AI को मुख्य रूप से इस आधार पर परखते हैं कि क्या उनका अंतिम उत्तर सही है। हम इस बात को अनदेखा कर देते हैं कि वे वहां कैसे पहुंचे। यह पेपर तर्क देता है कि दो AI एक ही सही उत्तर दे सकते हैं, लेकिन एक कुशल और तार्किक हो सकता है, जबकि दूसरा बर्बादी भरा, भ्रमित, या चीजें बना रहा (हैलुसिनेट कर रहा) हो सकता है।
समाधान: TRACE (एक "एविडेंस बैंक" जासूस)
इसे ठीक करने के लिए, लेखकों ने TRACE नामक एक नई मूल्यांकन प्रणाली बनाई है। TRACE को एक शिक्षक के रूप में न देखें जो अंतिम परीक्षा का ग्रेड देता है, बल्कि एक जासूस के रूप में देखें जो अपराध स्थल की समीक्षा करता है।
केवल अंतिम परिणाम की जांच करने के बजाय, TRACE उस पूरी "कहानी" को देखता है जो AI ने वहां तक पहुँचने के लिए खुद को सुनाई थी। यह एक विशेष टूल का उपयोग करता है जिसे एविडेंस बैंक (Evidence Bank) कहा जाता है।
- उपमा: कल्पना कीजिए कि AI एक रहस्य सुलझाने वाला जासूस है। हर बार जब AI एक टूल का उपयोग करता है (जैसे मैप देखना या गवाह से पूछना), तो वह मेज पर सबूत का एक टुकड़ा छोड़ देता है।
- TRACE कैसे काम करता है: TRACE इन सभी सबूतों के टुकड़ों का एक "बैंक" बनाता है। फिर, यह एक दूसरे AI (जज) से कहता है कि वह बैंक और अंतिम उत्तर को देखे। वह पूछता है: "क्या आपको उत्तर खोजने के लिए वास्तव में मैप देखने की आवश्यकता थी? या वह समय की बर्बादी थी?"
तीन चीजें जो TRACE जाँचता है
TRACE केवल "अच्छा काम किया" या "बुरा काम किया" नहीं कहता। यह AI को तीन विशिष्ट गुणों पर स्कोर देता है, जैसे कि एक वीडियो गेम के पात्र के आंकड़े (stats):
दक्षता (Efficiency - "स्पीड रनर"):
- यह क्या है: क्या AI ने सबसे छोटा रास्ता लिया?
- रूपक: यदि आपको अपने घर से किराने की दुकान तक जाना है, तो क्या आप सीधे वहां जाते हैं, या आप लाइब्रेरी, फिर पार्क, फिर जिम और फिर स्टोर तक जाते हैं?
- TRACE का काम: यह गिनता है कि AI ने कितने "अतिरिक्त स्टॉप" लिए। यदि AI ने ऐसे टूल का उपयोग किया जिसकी आवश्यकता नहीं थी, तो TRACE इसे अक्षम (inefficient) के रूप में चिह्नित करता है।
हैलुसिनेशन (Hallucination - "झूठा"):
- यह क्या है: क्या AI ने ऐसे तथ्य बनाए जो सबूतों में नहीं थे?
- रूपक: कल्पना कीजिए कि AI एक लाल सेब की फोटो देख रहा है। यदि AI कहता है, "मुझे एक लाल सेब दिख रहा है," तो यह अच्छा है। यदि AI कहता है, "मुझे एक लाल सेब दिख रहा है, और इसका स्वाद चॉकलेट जैसा है," तो यह एक हैलुसिनेशन है। "चॉकलेट" वाला हिस्सा फोटो में नहीं था।
- TRACE का काम: यह AI के हर विचार की जांच "एविडेंस बैंक" के विरुद्ध करता है। यदि AI कुछ ऐसा दावा करता है जो उसके द्वारा उपयोग किए गए टूल्स द्वारा सिद्ध नहीं हुआ है, तो TRACE उस झूठ को पकड़ लेता है।
अनुकूलन क्षमता (Adaptivity - "समस्या समाधानकर्ता"):
- यह क्या है: जब कोई टूल टूट जाता है तो क्या होता है?
- रूपक: कल्पना कीजिए कि आप एक चाबी से दरवाजा खोलने की कोशिश कर रहे हैं, लेकिन चाबी टूट जाती है।
- एक खराब AI (गैर-अनुकूल) बार-बार उसी टूटी हुई चाबी का उपयोग करने की कोशिश करता रहता है, या बस हार मान लेता है।
- एक अच्छा AI (अनुकूल) कहता है, "ओह, चाबी टूट गई। मैं इसके बजाय लॉकपिक (lockpick) का उपयोग करूँगा," या "मैं ताला खोलने वाले (locksmith) को बुलाऊंगा।"
- TRACE का काम: शोधकर्ताओं ने अपने परीक्षणों में जानबूझकर कुछ टूल्स को खराब किया। TRACE यह देखता है कि क्या AI ने त्रुटि को पहचाना और एक अलग योजना में बदलाव किया, या वह वहीं फंस गया।
यह क्यों महत्वपूर्ण है ("अहा!" क्षण)
लेखकों ने इस सिस्टम का कई अलग-अलग AI मॉडल (कुछ बड़े और महंगे, कुछ छोटे और मुफ्त) पर परीक्षण किया। उन्होंने कुछ आश्चर्यजनक बातें पाईं:
- समान स्कोर, अलग वास्तविकता: दो AI एक टेस्ट पर 60% सही हो सकते हैं। लेकिन जब आप उनके "ट्रैजेक्टरीज" (उनकी सोचने की प्रक्रिया) को देखते हैं, तो एक जीनियस हो सकता है जो बस भाग्यशाली था, जबकि दूसरा एक अनाड़ी बॉट हो सकता है जो भाग्यशाली रहा।
- छोटे मॉडल भी बेहतरीन जज हो सकते हैं: आप सोच सकते हैं कि दूसरे AI को जज करने के लिए आपको एक बहुत ही महंगे, विशाल AI की आवश्यकता है। लेखकों ने पाया कि उनका TRACE सिस्टम छोटे, सस्ते, ओपन-सोर्स मॉडल्स के साथ भी उतना ही अच्छा काम करता है। यह बहुत सारा पैसा और समय बचाता है।
- अधिक कदम = अधिक गलतियाँ: उन्होंने देखा कि जब एक AI बहुत अधिक कदम उठाता है (अक्षम होता है), तो उसके गलत उत्तर देने की संभावना वास्तव में बढ़ जाती है। यह एक भूलभुलैया (maze) में चलने जैसा है; आप जितना अधिक भटकेंगे, आपके डेड एंड (dead end) पर टकराने की संभावना उतनी ही अधिक होगी।
निचोड़
यह पेपर AI एजेंट्स को ग्रेड करने का एक नया तरीका पेश करता है। केवल यह पूछने के बजाय कि, "क्या आपने सही उत्तर प्राप्त किया?" हमें यह पूछना चाहिए कि, "क्या आप वहां कुशलतापूर्वक, बिना झूठ बोले, और समस्याओं को अच्छी तरह से संभालते हुए पहुंचे?"
TRACE का उपयोग करके, हम यह देख सकते हैं कि एक AI कैसे सोचता है, जो हमें अधिक स्मार्ट, अधिक विश्वसनीय और अधिक ईमानदार AI सहायक बनाने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।