Structured Feedback Improves Repair in an LLM Agent Loop
यह शोध पत्र VeriHarness को प्रस्तुत करता है, जो एक कोड-नियंत्रित एजेंट लूप है जो यह प्रदर्शित करता है कि LLMs को विफलता के स्थान, प्रेक्षित मानों और स्वीकार्य विकल्पों से युक्त संरचित फीडबैक प्रदान करने से कच्चे निदान (raw diagnostics) या अपूर्ण फीडबैक की तुलना में पुनरावृत्ति कार्यों में मरम्मत सफलता दर में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक (literal) स्वभाव वाले रोबोट को वीडियो गेम खेलना सिखा रहे हैं। आप रोबोट को एक लक्ष्य देते हैं, जैसे "खजाना ढूंढो," और वह दुनिया में इधर-उधर घूमने की कोशिश करता है। कभी-कभी, रोबोट गलती कर देता है—शायद वह एक ऐसा दरवाजा खोलने की कोशिश करता है जो पहले से खुला है, या वह ऐसी चीज़ उठाने की कोशिश करता है जो वहां मौजूद ही नहीं है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस रोबोट को "LLM एजेंट" कहा जाता है, और जो हिस्सा यह जांचता है कि रोबोट का कदम सही या वैध (legal) है या नहीं, उसे "वैलिडेटर" (validator) कहा जाता है।
लंबे समय तक, जब रोबोट गलती करता था, तो वैलिडेटर बस इतना कहता था, "नहीं, यह गलत है," और रोबोट को फिर से कोशिश करने देता था। यह एक शिक्षक की तरह था जो कहता, "फिर से कोशिश करो," बिना यह बताए कि छात्र ने उत्तर गलत क्यों दिया या सही उत्तर क्या हो सकता है। रोबोट बस फिर से अनुमान लगाता रहता, इस उम्मीद में कि शायद इस बार किस्मत चमक जाए। लेकिन क्या होगा अगर वैलिडेटर अधिक मददगार हो सके? क्या होगा अगर वह ठीक से बता सके कि गलती कहाँ हुई, रोबोट ने वास्तव में क्या किया, और यहाँ तक कि विकल्पों की एक सूची भी सुझा सके कि रोबोट के पास और क्या-क्या विकल्प थे जो वह कर सकता था? यह शोध पत्र एक सरल लेकिन शक्तिशाली प्रश्न पूछता है: क्या रोबोट को जानकारी का एक विस्तृत "रिपेयर किट" देने से वह अपने सरल "फिर से कोशिश करो" संदेश की तुलना में अपनी गलतियों को तेज़ी से और बेहतर तरीके से सुधार पाता है?
इन शोधकर्ताओं ने एक विशेष परीक्षण स्थल बनाया जिसे VeriHarness कहा जाता है। इसे एक वीडियो गेम लेवल की तरह समझें जहाँ एक सख्त रेफरी (वैलिडेटर) रोबोट (AI मॉडल) को खेलते हुए देखता है। यदि रोबोट कोई गलत चाल चलता है, तो रेफरी खेल को रोकता है और रोबोट को एक नोट थमा देता है। टीम देखना चाहती थी कि किस तरह का नोट सबसे अच्छा काम करता है। उन्होंने चार अलग-अलग प्रकार के नोट्स का परीक्षण किया:
- द रॉ नोट (The Raw Note): केवल त्रुटि संदेश, जैसे "कमांड 1 अमान्य है।"
- द प्रोज़ नोट (The Prose Note): एक मैत्रीपूर्ण पैराग्राफ जो समझाता है कि गलती कहाँ हुई, रोबोट ने क्या देखा, और उसे क्या करना चाहिए था।
- द स्ट्रक्चर्ड नोट (The Structured Note): प्रोज़ नोट जैसा ही विवरण, लेकिन तकनीकी सूची (जैसे JSON फ़ाइल) के रूप में व्यवस्थित।
- द "लोकेशन ओनली" नोट (The "Location Only" Note): रोबोट को यह बताना कि उसने कहाँ गलती की और उसने क्या देखा, लेकिन बिना किसी विकल्प का सुझाव दिए।
उन्होंने दो अलग-अलग AI मॉडल (एक जिसे Qwen और दूसरा Llama कहा जाता है) के साथ टेक्स्ट-आधारित एडवेंचर गेम्स खेलते हुए इस प्रयोग को 50 बार चलाया। लक्ष्य यह देखना था कि रोबोट कितनी बार चार प्रयासों की सीमा के भीतर फिनिश लाइन तक पहुँच पाता है (खेल जीत जाता है)।
"रॉ नोट" के समर्थकों के लिए परिणाम एक बड़ा आश्चर्य थे। जब रोबोट को वे विस्तृत नोट्स मिले जिनमें यह शामिल था कि गलती कहाँ हुई, उसने क्या देखा, और वैध विकल्पों (जो चालें वह चल सकता था) की एक सूची, तो वह एक चैंपियन बन गया।
- Qwen मॉडल के लिए, सफलता दर 28% (रॉ एरर मैसेज के साथ) से बढ़कर 72% (विस्तृत नोट्स के साथ) हो गई। यह 44 प्रतिशत अंक का सुधार है।
- Llama मॉडल के लिए, यह 16% से बढ़कर 58% हो गई, जो 42 प्रतिशत अंक की वृद्धि है।
इस खोज का सबसे रोमांचक हिस्सा यह है कि यह क्यों सफल हुआ। शोधकर्ताओं को संदेह था कि शायद रोबोट को "स्ट्रक्चर्ड नोट" (तकनीकी लेबल वाला नोट) का साफ-सुथरा, व्यवस्थित रूप पसंद आया होगा। लेकिन उन्होंने प्रोज़ नोट (साधारण अंग्रेजी) की तुलना स्ट्रक्चर्ड नोट से करके इसका परीक्षण किया। परिणाम? वे लगभग एक जैसा प्रदर्शन करते थे। चाहे सलाह एक मैत्रीपूर्ण पैराग्राफ में लिखी गई हो या एक तकनीकी सूची में, इससे बहुत अधिक फर्क नहीं पड़ा। जादुई तत्व फॉर्मेटिंग नहीं था; बल्कि सामग्री (content) थी।
विशेष रूप से, "लोकेशन ओनली" नोट (जिसने रोबोट को बताया कि वह कहाँ विफल हुआ और उसने क्या देखा, लेकिन उसे नए विचार नहीं दिए) बहुत अधिक मदद नहीं कर सका। यह रॉ एरर मैसेज के निम्न सफलता दर के करीब ही रहा। यह साबित करता है कि केवल गलती की ओर इशारा करना पर्याप्त नहीं है; रोबोट को चुनने के लिए वैध विकल्पों की एक सूची की आवश्यकता होती है। यह एक शिक्षक के कहने के बीच का अंतर है, "आपने 'cat' गलत लिखा है," बनाम "आपने 'cat' गलत लिखा है; आप 'bat', 'hat', या 'mat' लिख सकते थे।"
अध्ययन ने यह भी जांचा कि क्या यह तरीका कोडिंग कार्यों (HumanEval नामक समस्याओं के सेट का उपयोग करके) के लिए काम करता है। उन्होंने पाया कि यह तरीका तभी काम करता है जब वैलिडेटर वास्तव में गलती देख सके। यदि रोबोट एक दृश्य (visible) टेस्ट पास करता है लेकिन एक छिपे हुए (hidden) टेस्ट में विफल हो जाता है जिसे वैलिडेटर देख नहीं सकता, तो कोई भी फीडबैक उसे ठीक नहीं कर सकता। यह सुझाव देता है कि हालांकि विस्तृत फीडबैक एक सुपरपावर है, लेकिन यह जादू नहीं है—यह केवल उसे ठीक कर सकता है जिसे वह देख सकता है।
अंत में, यह शोध पत्र सुझाव देता है कि यदि हम चाहते हैं कि हमारे AI एजेंट अपनी गलतियों को सुधारने में बेहतर हों, तो हमें उन्हें केवल दोबारा अनुमान लगाने के लिए नहीं छोड़ना चाहिए। हमें ऐसे वैलिडेटर बनाने की आवश्यकता है जो एक सहायक कोच की तरह काम करें: विशिष्ट त्रुटि को इंगित करें, दिखाएं कि वास्तव में क्या हुआ, और आगे आज़माने के लिए सही विकल्पों का एक मेनू पेश करें। यह साबित होता है कि AI के लिए, विशिष्ट और कार्रवाई योग्य सलाह का महत्व हज़ार "फिर से कोशिश करो" के मुकाबले कहीं अधिक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।