VeRO: An Evaluation Harness for Agents to Optimize Agents
यह शोधपत्र VeRO को प्रस्तुत करता है, जो एक व्यापक मूल्यांकन हारनेस और बेंचमार्क सुइट है जिसे पुनरावृत्ति एजेंट अनुकूलन चक्रों के माध्यम से कोडिंग एजेंटों का व्यवस्थित रूप से आकलन करने और सुधारने के लिए डिज़ाइन किया गया है, जो उन प्रणालियों के मूल्यांकन की अनूठी चुनौतियों का समाधान करता है जो नियत (deterministic) कोड को स्टोकेस्टिक (stochastic) LLM पूर्णताओं के साथ जोड़ती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ा अनाड़ी, रोबोट सहायक है। यह रोबोट ईमेल पढ़ सकता है, कोड लिख सकता है और वेब सर्च कर सकता है, लेकिन कभी-कभी यह भ्रमित हो जाता है, गलतियाँ करता है, या अपना काम चेक करना भूल जाता है।
अतीत में, यदि आप इस रोबोट को बेहतर बनाना चाहते थे, तो आपको (एक इंसान को) इसे विफल होते हुए देखना पड़ता, अनुमान लगाना पड़ता कि क्या गलत हुआ, इसके निर्देशों को फिर से लिखना पड़ता, और फिर से प्रयास करना पड़ता। यह धीमा, महंगा और बहुत अधिक मानवीय प्रयास वाला काम था।
समस्या:
इस पेपर के लेखकों ने पूछा: "क्या होगा अगर हम एक दूसरा रोबोट बना सकें जिसका एकमात्र काम पहले रोबोट को ठीक करना हो?"
यह दूसरा रोबोट (द ऑप्टिमाइज़र/Optimizer) पहले रोबोट (द टारगेट एजेंट/Target Agent) को विफल होते हुए देखेगा, गलतियों को सुधारने के लिए नया कोड लिखेगा, सुधार का परीक्षण करेगा, और यह प्रक्रिया स्वचालित रूप से दोहराएगा। इसे एजेंट ऑप्टिमाइज़ेशन (Agent Optimization) कहा जाता है।
चुनौती:
एक रोबोट को दूसरे रोबोट को ठीक करने के लिए बनाना आश्चर्यजनक रूप से कठिन है। यह कुछ ऐसा है जैसे किसी को रेडियो ट्यून करते समय ट्यून करना, जबकि कोई दूसरा व्यक्ति लगातार स्टेशन, वॉल्यूम और मौसम बदल रहा हो।
- यह अव्यवस्थित है: रोबोट का दिमाग (AI) अप्रत्याशित है। कभी यह काम करता है, कभी नहीं, यहाँ तक कि समान निर्देशों के साथ भी।
- यह महंगा है: हर बार जब आप किसी सुधार का परीक्षण करते हैं, तो इसमें पैसा और समय लगता है।
- इसे ट्रैक करना कठिन है: यदि सुधार करने वाला रोबोट कोड को 50 बार बदलता है, तो आपको कैसे पता चलेगा कि वास्तव में किस बदलाव ने मदद की? क्या इसने इसलिए मदद की क्योंकि नया कोड आया, या सिर्फ इसलिए क्योंकि बाहर धूप खिली थी?
समाधान: VERO (द "रोबोट जिम")
Scale AI की टीम ने VERO (वर्जनिंग, रिवॉर्ड्स और ऑब्जर्वेशन्स/Versioning, Rewards, and Observations) नामक एक नया सिस्टम बनाया है। VERO को एक हाई-टेक जिम के रूप में सोचें।
VERO कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. "टाइम-ट्रैवल कैमरा" (वर्जनिंग/Versioning)
एक सामान्य जिम में, यदि आप एक नया व्यायाम करते हैं और असफल हो जाते हैं, तो आप शायद भूल जाते हैं कि आपने क्या गलत किया था।
VERO जिम में, सुधार करने वाला रोबोट जो भी बदलाव करता है, उसे एक Git commit (समय का एक स्नैपशॉट) की तरह सहेजा जाता है।
- उपमा: एक वीडियो गेम की कल्पना करें जिसमें "अनडू" (Undo) बटन है। यदि सुधार करने वाला रोबोट एक नई रणनीति आज़माता है और टारगेट रोबोट क्रैश हो जाता है, तो VERO तुरंत समय को पिछले अच्छे वर्जन पर वापस ले जाता है। यह सुनिश्चित करता है कि हम कभी भी प्रगति न खोएं और हमेशा देख सकें कि वास्तव में क्या बदला।
2. "सख्त रेफरी" (बजट और नियम/Budget & Rules)
एक वास्तविक दुनिया के परिदृश्य में, एक सुधार करने वाला रोबोट एक टेस्ट पास करने के लिए एक सुपर-पावरफुल (और महंगे) दिमाग का उपयोग करके धोखाधड़ी कर सकता है, जो कि एक निष्पक्ष सुधार नहीं है।
- उपमा: VERO एक बॉक्सिंग मैच में एक सख्त रेफरी की तरह कार्य करता है। यह एक बजट (जैसे टाइमर या आप कितने पंच मार सकते हैं की सीमा) निर्धारित करता है। यह दरवाजे भी बंद कर देता है ताकि सुधार करने वाला रोबोट "उत्तर कुंजी" (टेस्ट डेटा) को देख न सके या खेल के नियम न बदल सके। यह सुनिश्चित करता है कि सुधार वास्तविक हों, न कि केवल भाग्यशाली अनुमान।
3. "स्कोरबोर्ड" (संरचित फीडबैक/Structured Feedback)
आमतौर पर, जब एक रोबोट विफल होता है, तो वह केवल "Error" कहता है। एक सुधारने वाले के लिए यह मददगार नहीं है।
- उपमा: VERO सुधार करने वाले रोबोट को एक विस्तृत स्कोरकार्ड देता है। केवल "Fail" कहने के बजाय, यह कहता है: "आप विफल हुए क्योंकि आपने ईमेल भेजने से पहले मौसम की जांच करना भूल गए। यहाँ वह सटीक लॉग है कि क्या हुआ था।" यह सुधार करने वाले रोबोट को यह सीखने में मदद करता है कि वह क्यों विफल हुआ, न कि केवल यह कि वह विफल हुआ।
उन्होंने क्या खोजा? (परिणाम)
टीम ने अलग-अलग प्रकार के सुधार करने वाले रोबोटों के साथ प्रयोग चलाने के लिए VERO का उपयोग किया। यहाँ मुख्य बातें दी गई हैं, जिन्हें सरल भाषा में अनुवादित किया गया है:
- साधारण रोबोटों को बड़ा बढ़ावा मिलता है: यदि आप एक बहुत ही बुनियादी, सरल रोबोट से शुरुआत करते हैं, तो सुधार करने वाला रोबोट बड़े सुधार कर सकता है (जैसे नए उपकरण या कौशल जोड़ना)। लेकिन यदि आप एक अत्यंत परिष्कृत रोबट से शुरुआत करते हैं, तो सुधार की गुंजाइश कम होती है। यह एक सस्ती कार बनाम एक फेरारी को ट्यून करने जैसा है; सस्ती कार में सुधार करने के लिए अधिक "लो-हैंगिंग फ्रूट" (आसान अवसर) होते हैं।
- निर्देश मायने रखते हैं: आप सुधार करने वाले रोबोट को उसका काम करने के लिए कैसे बताते हैं, यह सब कुछ बदल देता है।
- यदि आप सुधार करने वाले को एक कुकबुक (कठोर नियमों और पैटर्न की सूची) देते हैं, तो यह साधारण रोबोटों पर बहुत अच्छा काम करता है।
- लेकिन यदि रोबोट पहले से ही स्मार्ट है, तो बहुत अधिक नियम वास्तव में उसे बाधित करते हैं। स्मार्ट रोबोट को अपने स्वयं के समाधान आविष्कार करने के लिए "रचनात्मक स्वतंत्रता" की आवश्यकता होती है।
- "प्रॉम्प्ट" का जाल: अधिकांश सुधार करने वाले रोबोट आलसी होते हैं। वे वास्तविक कोड संरचना को फिर से लिखने के बजाय केवल टेक्स्ट निर्देशों (प्रॉम्प्ट्स) को बदलने को प्राथमिकता देते हैं। यह इंजन को ठीक करने के लिए हुड को लाल रंग से पेंट करने जैसा है। यह अच्छा दिखता है, लेकिन इंजन अभी भी टूटा हुआ है। पेपर दिखाता है कि हमें इन रोबोटों को कोड को फिर से लिखने का भारी काम करने के लिए तैयार करने की आवश्यकता है।
- विशेषज्ञता (Specialization): एक सुधार जो एक रोबोट को गणित में महान बनाता है, वह उसे खरीदारी करने में खराब बना सकता है। कोई "एक आकार सभी के लिए उपयुक्त" (one size fits all) वाला सुधार नहीं है।
यह क्यों मायने रखता है?
अभी, AI एजेंट बनाना हाथ से ईंट-दर-ईंट घर बनाने जैसा है, जिसमें एक मानव वास्तुकार शामिल है। यह धीमा है।
VERO स्वचालित निर्माण की ओर पहला कदम है। यह साबित करता है कि हम ऐसे AI सिस्टम बना सकते हैं जो न केवल कार्य कर सकते हैं बल्कि उन कार्यों को बेहतर बनाने के लिए अपना स्वयं का कोड भी लिख सकते हैं।
बड़ी तस्वीर:
यह पेपर केवल आज के रोबोटों को स्मार्ट बनाने के बारे में नहीं है; यह भविष्य की मशीनें बनाने वाली मशीन बनाने के बारे में है। इन "फिक्सर रोबोट्स" को टेस्ट करने का एक निष्पक्ष, सुरक्षित और पुनरुत्पादक (reproducible) तरीका बनाकर, लेखकों ने पूरी AI कम्युनिटी को यह समझने के लिए एक प्लेग्राउंड दिया है कि हमारे डिजिटल सहायकों को वास्तव में आत्म-सुधार करने वाला कैसे बनाया जाए।
संक्षेप में: उन्होंने एक सुरक्षित सैंडबॉक्स बनाया है जहाँ रोबोट दूसरे रोबोटों को ठीक करने का अभ्यास कर सकते हैं, और उन्होंने पाया कि हालांकि यह संभव है, हमें उन्हें इस तरह से निर्देशित करने में सावधानी बरतने की आवश्यकता है ताकि वे केवल सतह को न बदलें बल्कि वास्तव में इंजन को ठीक करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।