StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure
StructAgent एक अवस्था-केंद्रित (state-centered) ढांचे को पेश करता है जो लंबी अवधि के डिजिटल एजेंट कार्यों को प्रबंधित करने के लिए एकीकृत कारण संरचनाओं (unified causal structures) का उपयोग करता है, जो सत्यापन योग्य, साक्ष्य-आधारित प्रगति ट्रैकिंग और रिकवरी को सक्षम करके विविध LLM/VLM बैकबोन और परिवेशों में सफलता दर और सामान्यीकरण क्षमता में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को एक लंबा, जटिल काम सिखाने की कोशिश कर रहे हैं, जैसे कि "मेरे नवीनतम ईमेल में फोटो ढूँढो, उसे सेव करो, और उसे अपने डेस्कटॉप वॉलपेपर के रूप में सेट करो।" यदि आप रोबोट को बस "जाओ इसे करो" कह देते हैं और उसे काम करते समय खुद से चैट करने देते हैं, तो चीजें बहुत जल्दी गड़बड़ा जाती हैं। रोबोट भूल सकता है कि उसने अभी क्या किया, वह अपनी एक असफल कोशिश से भ्रमित हो सकता है, या उसे लग सकता है कि वह काम पूरा कर चुका है जबकि वह वास्तव में अभी भी बीच में ही अटका हुआ है। यह एक अंधे पट्टी पहनकर भूलभुलैया में रास्ता खोजने और केवल पिछले कदम को याद रखने जैसा है।
यही वह समस्या है जिसे StructAgent नामक पेपर हल करने की कोशिश करता है। लेखक तर्क देते हैं कि रोबोट को उसके अपने पिछले कार्यों के एक विशाल, अव्यवस्थित ढेर (जिसे वे "रॉ इंटरेक्शन हिस्ट्री" कहते हैं) में भटकने देने के बजाय, हमें उसे यह ट्रैक रखने के लिए एक संरचित, व्यवस्थित नोटबुक देनी चाहिए कि वह वास्तव में कहाँ खड़ा है।
मुख्य विचार: एक "सत्य बताने वाली" नोटबुक
यह पेपर डिजिटल एजेंटों को चलाने का एक नया तरीका प्रस्तावित करता है जिसे StructAgent कहा जाता है। इसे एक रोबोट को उसकी एक विशेष, तीन-भाग वाली नोटबुक देने के रूप में समझें जिसे अगले कदम पर जाने से पहले उसे अपडेट करना ही होगा। यह नोटबुक केवल एक डायरी नहीं है; यह वास्तविकता का एक सख्त, सत्यापित रिकॉर्ड है।
- क्या बाकी है: वर्तमान आवश्यकताओं की एक सूची (जैसे, "मुझे ईमेल अटैचमेंट ढूँढना है")।
- हम क्या जानते हैं: अब तक एकत्र किए गए उपयोगी तथ्य (जैसे, "फ़ाइल पाथ
/home/user/picsहै")। - कार्य का प्रमाण (Proof of Work): सत्यापित साक्ष्य कि एक चरण वास्तव में पूरा हो गया है (जैसे, "मैंने फोल्डर की जाँच की, और इमेज फ़ाइल निश्चित रूप से वहां है")।
जादू केवल नोटबुक में नहीं है; यह इसे उपयोग करने के नियमों में है। अधिकांश रोबोट सिस्टम में, यदि रोबोट कहता है "मैं हो गया," तो वह हो गया। StructAgent में, रोबोट केवल जीत का दावा नहीं कर सकता। उसे अपना काम एक वेरिफायर (Verifier) (एक सख्त रेफरी) को सौंपना होगा। वेरिफायर साक्ष्य की जाँच करता है। केवल तभी जब वेरिफायर कहता है, "हाँ, मैं फ़ाइल देख रहा हूँ, और यह नियमों से मेल खाती है," नोटबुक को अपडेट किया जाता है। यदि वेरिफायर कहता है, "नहीं, यह सही फ़ाइल नहीं है," तो नोटबुक वैसी ही रहती है, और रोबोट को फिर से प्रयास करना पड़ता है या अपनी गलती सुधारनी पड़ती है।
वे किसके विरुद्ध तर्क देते हैं
यह पेपर स्पष्ट रूप से इस विचार के विरुद्ध तर्क देता है कि एजेंटों को केवल अपनी "भावना" या उनके द्वारा किए गए सब कुछ की एक लंबी, असंरचित सूची के आधार पर चलते रहना चाहिए। वे दिखाते हैं कि जब कार्य लंबे और जटिल होते हैं, तो यह "रॉ हिस्ट्री" वाला दृष्टिकोण रोबोट को रास्ता भटका देता है। रोबोट असफल प्रयासों और आधे-अधूरे कामों के नीचे दब जाता है, जिससे यह जानना असंभव हो जाता है कि क्या वह वास्तव में प्रगति कर रहा है या बस गोल-गोल घूम रहा है। StructAgent कहता है: "अनुमान लगाना बंद करो। एक अव्यवस्थित स्मृति पर भरोसा करना बंद करो। एक सत्यापित, संरचित अवस्था का उपयोग करो।"
परिणाम: क्या यह वास्तव में काम करता है?
लेखकों ने केवल इसकी कल्पना नहीं की; उन्होंने वास्तविक कंप्यूटर कार्यों पर इसका परीक्षण किया। उन्होंने OSWorld-Verified नामक एक बेंचमार्क पर प्रयोग चलाए, जो यह परीक्षण करता है कि एजेंट वास्तविक डेस्कटॉप एप्लिकेशन (जैसे ईमेल, स्प्रेडशीट और फोटो एडिटर) का उपयोग कितनी अच्छी तरह कर सकते हैं।
यहाँ वे परिणाम दिए गए हैं, जो उनके अध्ययन के सटीक आंकड़े हैं:
- जब उन्होंने Qwen3.5-9B नामक एक छोटे AI मॉडल का उपयोग किया, तो सफलता दर (बिना StructAgent के) 27.0% से बढ़कर 46.9% (StructAgent के साथ) हो गई। यह एक बड़ी सुधार है!
- थोड़े बड़े मॉडल, Qwen3.5-27B के साथ, सफलता दर 31.6% से बढ़कर 62.2% हो गई।
- जब उन्होंने अपने सबसे शक्तिशाली ओपन-सोर्स मॉडल, MiniMax-M3 का उपयोग किया, तो StructAgent ने इसे 78.9% की सफलता दर तक पहुँचाने में मदद की। यह इस विशिष्ट परीक्षण के लिए किसी भी ओपन-सोर्स विधि के लिए उनका उच्चतम स्कोर है।
उन्होंने इस सिस्टम को एक पूरी तरह से अलग दुनिया में भी आजमाया: वीडियो गेम Minecraft। डेस्कटॉप फ़ाइलों की जाँच करने के बजाय, "वेरिफायर" ने खिलाड़ी के इन्वेंट्री (inventory) की जाँच की। इस पूरी तरह से अलग वातावरण के बावजूद, सिस्टम ने काम किया, जिससे पता चलता है कि "सत्यापित नोटबुक" का विचार लचीला है।
"गॉट्स" (कमियां) और सीमाएं
पेपर सावधानी से कहता है कि यह कोई जादुई छड़ी नहीं है जो सब कुछ हल कर देगी।
- यह अभी भी पूर्ण नहीं है: StructAgent के साथ भी, कुछ कार्य अभी भी विफल हो जाते हैं। जब उन्होंने विफलताओं का विश्लेषण किया, तो उन्होंने पाया कि लगभग 33% इसलिए थे क्योंकि रोबोट (एक्टर) ने क्रिया (action) में गलती की, 30% इसलिए थे क्योंकि प्लानर भ्रमित हो गया था, और अन्य 30% इसलिए थे क्योंकि वेरिफायर ने कुछ मिस कर दिया था।
- यह कार्य पर निर्भर करता है: यह सिस्टम तब सबसे अच्छा काम करता है जब स्पष्ट, जांचने योग्य प्रमाण (जैसे कंप्यूटर पर एक फ़ाइल का अस्तित्व) मौजूद हों। यह उन कार्यों में थोड़ा संघर्ष करता है जो दृश्य विवरणों (जैसे "टेक्स्ट को सुंदर बनाना") पर बहुत अधिक निर्भर करते हैं जहाँ जाँचने के लिए कोई सरल फ़ाइल नहीं होती है।
- यह एक फ्रेमवर्क है, न कि एक एकल मॉडल: पेपर दिखाता है कि यह संरचना कई अलग-अलग AI मॉडलों की मदद करती है। ऐसा नहीं है कि उन्होंने एक नया सुपर-ब्रेन बनाया है; उन्होंने किसी भी मस्तिष्क के लिए अपने काम को व्यवस्थित करने का एक बेहतर तरीका बनाया है।
निष्कर्ष
पेपर सुझाव देता है कि AI एजेंटों को लंबे, जटिल कार्यों के लिए विश्वसनीय बनाने के लिए, हमें उन्हें मुक्त-प्रवाह वाले चैटबॉट्स की तरह मानना बंद करना होगा और उन्हें एक सख्त, सत्यापित चेकलिस्ट वाले सावधानीपूर्वक प्रोजेक्ट मैनेजर की तरह मानना शुरू करना होगा। एजेंट को आगे बढ़ने से पहले अपनी प्रगति सिद्ध करने के लिए मजबूर करके, StructAgent इन डिजिटल सहायकों को बहुत अधिक विश्वसनीय, पारदर्शी और वास्तविक दुनिया के लंबे, जटिल कार्यों को संभालने में सक्षम बनाता है। यह उन एजेंटों की ओर एक कदम है जो केवल काम करने की कोशिश नहीं करते, बल्कि वास्तव में जानते हैं कि उन्होंने उन्हें कर लिया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।