← नवीनतम पेपर
🤖 AI

Scaffold Effects on GAIA: A Controlled Comparison

यह प्री-रजिस्टर्ड नियंत्रित अध्ययन यह प्रदर्शित करता है कि स्कैफोल्ड का चयन GAIA बेंचमार्क पर एजेंट के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है, जो यह प्रकट करता है कि मापी गई क्षमता स्कोर अत्यधिक स्कैफोल्ड-सशर्त हैं और मॉडल में सुधार के साथ स्कैफोल्ड संवेदनशीलता में अपेक्षित कमी नहीं आती है, जिसमें संरचित मल्टी-एजेंट डिज़ाइन अक्सर मानक ReAct दृष्टिकोणों की तुलना में पर्याप्त सटीकता लाभ प्रदान करते हैं।

मूल लेखक: Jason Starace

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jason Starace

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह आंकने की कोशिश कर रहे हैं कि एक शेफ एक जटिल भोजन बनाने में कितना कुशल है। आपके पास उन्हें परखने के लिए तीन अलग-अलग रसोईघर (स्कैफोल्ड्स) हैं:

  1. अकेला शेफ (ReAct): शेफ सोचता है, एक सामग्री उठाता है, खाना पकाता है, फिर से सोचता है और अगली सामग्री उठाता है, यह सब एक निरंतर प्रवाह में चलता है।
  2. रसोई की टीम (Planner-Actor-Rater): एक मैनेजर रेसिपी लिखता है, एक कुक चरणों को क्रियान्वित करता है, और एक क्रिटिक हर चरण के बाद स्वाद चखकर देखता है कि क्या वह सही है, इससे पहले कि अगले चरण पर बढ़ा जाए।
  3. ब्लूप्रिंट और बिल्डर (Planner-then-Executor): पहले, एक प्लानर बिना किसी औजार के एक विस्तृत, चरण-दर-चरण ब्लूप्रिंट लिखता है। फिर एक बिल्डर उस ब्लूप्रिंट का उपयोग करके व्यंजन बनाता है।

इस अध्ययन ने एक सरल प्रश्न पूछा: क्या जिस रसोईघर में आप शेफ को रखते हैं, उससे उनकी कुशलता दिखाई देती है?

इसका उत्तर स्पष्ट रूप से हाँ है। वास्तव में, "रसोईघर" उतना ही महत्वपूर्ण है जितना कि शेफ की वास्तविक प्रतिभा।

बड़ी खोज: "रसोईघर" आपकी सोच से कहीं अधिक महत्वपूर्ण है

शोधकर्ताओं ने पाँच अलग-अलग "शेफ" (Anthropic, Google और OpenAI के AI मॉडल) को कठिन पहेलियों (जिन्हें GAIA कहा जाता है) पर परखा। उन्होंने पाया कि केवल रसोईघर के सेटअप को बदलने से एक मॉडल का स्कोर 28 प्रतिशत अंक तक बदल सकता है।

इसे समझने के लिए: यदि आपने एक मॉडल को "अकेला शेफ" रसोईघर में टेस्ट किया और उसने 56% स्कोर प्राप्त किया, लेकिन फिर आपने उसी मॉडल को "रसोई की टीम" सेटअप में डाल दिया, तो अचानक उसका स्कोर 84% हो सकता है। शेफ नहीं बदला; बल्कि काम करने का तरीका बदल गया।

इसका मतलब है कि जब हम देखते हैं कि "मॉडल X 80% स्मार्ट है", तो वह संख्या केवल मॉडल के बारे में नहीं है। यह मॉडल के दिमाग और उसे दिए गए विशिष्ट निर्देशों और उपकरणों का मिश्रण है। यदि आप अलग-अलग रसोईघरों में टेस्ट किए गए दो मॉडलों की तुलना करते हैं, तो आप उनके दिमाग की तुलना नहीं कर रहे हैं; आप उनके रसोईघरों की तुलना कर रहे हैं।

मिथक का खंडन: "स्मार्ट" मॉडल्स को कम मदद की आवश्यकता नहीं होती

शोधकर्ताओं को एक संदेह (परिकल्पना) था कि सबसे शक्तिशाली, "फ्रंटियर" मॉडल इतने स्मार्ट होंगे कि उन्हें रसोईघर के सेटअप की ज्यादा परवाह नहीं होगी। उन्होंने सोचा कि एक सुपर-ब्रेन एक अस्त-व्यस्त रसोई को भी उतनी ही अच्छी तरह संभाल लेगा जितनी कि एक व्यवस्थित रसोई को।

वे गलत थे।

वास्तव में, उनके द्वारा टेस्ट किए गए सबसे शक्तिशाली मॉडल (Anthropic का Opus) को कठिन कार्यों के दौरान एक संरचित, व्यवस्थित रसोई ( "रसोई की टीम" सेटअप) से सबसे अधिक लाभ हुआ। सबसे "स्मार्ट" मॉडल सबसे स्वतंत्र नहीं था; बल्कि वह था जिसे मैनेजर और क्रिटिक की मदद से सबसे अधिक लाभ मिला। सबसे अच्छे और सबसे खराब प्रदर्शन के बीच का अंतर स्मार्ट मॉडल्स के लिए कम नहीं हुआ; यह या तो स्थिर रहा या और भी बढ़ गया।

"परिवार" बनाम "रैंक" का आश्चर्य

एक और आश्चर्य यह था कि एक शानदार रसोई का लाभ इस बात पर निर्भर करता था कि मॉडल किस परिवार से आता है, न कि केवल इस पर कि उसकी रैंक कितनी है।

  • Anthropic परिवार (Haiku, Sonnet, Opus) को "रसोई की टीम" सेटअप से भारी उछाल मिला।
  • Google और OpenAI के मॉडल्स को वह उछाल नहीं मिला।

यह कहने जैसा है कि एक विशिष्ट प्रकार का कार इंजन एक विशिष्ट ब्रांड के ईंधन के साथ बहुत बेहतर चलता है, लेकिन एक अलग ब्रांड का इंजन इसकी परवाह नहीं करता। आप यह मान नहीं सकते कि एक "उच्च श्रेणी" का मॉडल हमेशा बेहतर टूल्स से अधिक लाभ उठाएगा; यह इस पर निर्भर करता है कि इंजन किसने बनाया है।

लागत और दक्षता

अध्ययन ने "रसीद" (लागत) को भी देखा।

  • "अकेला शेफ" (ReAct) सबसे महंगा और धीमा था। इसने बहुत सारी गलतियाँ कीं और इसे अक्सर दोबारा प्रयास करना पड़ा।
  • "रसोई की टीम" और "ब्लूप्रिंट" सेटअप तेज़ थे, कम गलतियाँ करते थे, और कार्य के बीच में कुछ गलत होने पर बेहतर तरीके से संभल जाते थे।
  • विजेता: सबसे कठिन कार्यों के लिए Google के Gemini मॉडल का "ब्लूप्रिंट" सेटअप के साथ विशिष्ट संयोजन सबसे सस्ता और सटीक विकल्प था।

निष्कर्ष

यह पेपर हमें बताता है कि क्षमता के आंकड़े सशर्त होते हैं। आप यह नहीं कह सकते कि एक मॉडल "X% सक्षम" है। आपको कहना होगा, "X% सक्षम जब वह इन विशिष्ट निर्देशों और उपकरणों का उपयोग कर रहा हो।"

यदि आप जानना चाहते हैं कि एक AI वास्तव में कितना अच्छा है, तो आप केवल एक स्कोर नहीं देख सकते। आपको यह समझना होगा कि स्कोर मॉडल और उसे सहारा देने वाले स्कैफोल्डिंग का एक स्नैपशॉट है। यदि आप स्कैफोल्डिंग बदलते हैं, तो स्कोर बदल जाता है, जो कभी-कभी नाटकीय होता है। एक मॉडल जो कर सकता है और जो वह परीक्षण में वास्तव में करता है, उसके बीच का "अंतर" बहुत बड़ा है, और यह जरूरी नहीं कि मॉडल स्मार्ट होने के साथ छोटा होता जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →