Rethinking the Evaluation of Harness Evolution for Agents
यह शोध पत्र समान बजट के तहत सरल टेस्ट-टाइम स्केलिंग के विरुद्ध निष्पक्ष रूप से तुलना करने पर यह प्रदर्शित करते हुए एलएलएम (LLM) एजेंटों में स्वचालित हार्नेस विकास (automatic harness evolution) के वर्तमान मूल्यांकन प्रोटोकॉल की आलोचना करता है कि हार्नेस विकास कोई निरंतर प्रदर्शन लाभ प्रदान नहीं करता है और सीमित सामान्यीकरण प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक (एक AI एजेंट) है जिसे जटिल कंप्यूटर पहेलियाँ सुलझाने की आवश्यकता है। इसे मदद करने के लिए, आप इसे एक "हार्नेस" (harness) देते हैं—निर्देशों, उपकरणों और नियमों का एक शानदार सेट जो यह बताता है कि रोबोट को कंप्यूटर से कैसे बात करनी है, कौन से बटन दबाने हैं, और अपने काम की जाँच कैसे करनी है।
कुछ समय के लिए, शोधकर्ताओं ने यह माना कि इन रोबोटों को बेहतर बनाने का सबसे अच्छा तरीका एक "रोबोट मैकेनिक" बनाना है जो स्वचालित रूप से हार्नेस को बार-बार ट्यून और अपग्रेड कर सके। यह मैकेनिक रोबोट की विफलता को देखेगा, सोचेगा "हम्म, शायद अगर मैं इस नियम को बदल दूँ," एक नया हार्नेस आजमाएगा, और एक आदर्श सेटअप खोजने के लिए इसे दोहराता रहेगा। उन्होंने इसे ऑटोमैटिक हार्नेस इवोल्यूशन (Automatic Harness Evolution) कहा।
लेकिन इस नए पेपर में, शोधकर्ताओं की एक टीम ने इस पर दोबारा विचार करने का निर्णय लिया कि क्या यह "रोबोट मैकेनिक" वास्तव में कुछ विशेष कर रहा है, या यह केवल हमें मूर्ख बना रहा है। उन्होंने यह देखने के लिए एक निष्पक्ष दौड़ आयोजित की कि क्या मैकेनिक वास्तव में बेहतर उपकरण डिजाइन कर रहा है, या वह केवल बहुत सारे अनुमान लगाकर भाग्यशाली हो रहा है।
बड़ी दौड़: इवोल्यूशन बनाम सिर्फ कड़ी मेहनत करना
शोधकर्ताओं ने टर्मिनल-बेंच 2.1 (Terminal-Bench 2.1) नामक एक प्रसिद्ध पहेली सेट पर एक प्रतियोगिता आयोजित की, जिसमें 89 अलग-अलग टर्मिनल कार्य शामिल हैं। उन्होंने उपलब्ध तीन सबसे स्मार्ट AI मॉडल का उपयोग किया: Claude Opus 4.6, GPT-5.4, और GPT-5.4 mini।
उन्होंने चार अलग-अलग रणनीतियों की तुलना की, जिन्हें समान मात्रा में "सोचने का समय" (कंप्यूट बजट) दिया गया था:
- पैरेलल सैंपलिंग (Parallel Sampling): कल्पना कीजिए कि रोबोट को पहेली को हल करने के लिए एक साथ 5 अलग-अलग बार प्रयास करने के लिए कहा जाता है, और फिर सबसे अच्छा उत्तर चुना जाता है। यह पासे को 5 बार फेंकने और छह आने की उम्मीद करने जैसा है।
- सीक्वेंशियल रिफाइनमेंट (Sequential Refinement): कल्पना कीजिए कि रोबोट एक बार प्रयास करता है, देखता है कि उसने कहाँ गलती की, अपनी सोच को ठीक करता है, और फिर से प्रयास करता है। यह एक निबंध के ड्राफ्ट को संशोधित करने जैसा है।
- हार्नेस इवोल्यूशन (Harness Evolution): यह "रोबोट मैकेनिक" है। यह पिछले विफलताओं के आधार पर रोबोट के निर्देश मैनुअल को फिर से लिखने का प्रयास करता है, इस उम्मीद में कि एक बेहतर उपकरण बनाया जा सके।
- हार्नेस स्केलिंग (Harness Scaling): यह ऐसा है जैसे मैकेनिक रोबोट के पहेली हल करने के दौरान ही उस विशिष्ट पहेली के लिए निर्देशों को फिर से लिख रहा है।
चौंकाने वाले परिणाम
पेपर में पाया गया कि "रोबोट मैकेनिक" (Harness Evolution) लगातार दौड़ में नहीं जीत सका। वास्तव में, यह अक्सर सरल तरीकों से हार गया।
जब "उत्तर कुंजियाँ" (Unit Tests) नहीं थीं:
यदि रोबोट को खुद अनुमान लगाना पड़ता कि वह सही है या गलत, तो "रोबोट मैकेनिक" ने चीजों को वास्तव में बदतर बना दिया।
- सरल "5 बार प्रयास करें" विधि (Parallel Sampling) ने औसत स्कोर को 68.2 से बढ़ाकर 72.3 कर दिया।
- "रोबोट मैकेनिक" (Harness Evolution) केवल 67.4 तक पहुँच सका, जो कि बिना किसी बदलाव के मूल निर्देशों का उपयोग करने से भी कम था!
- लेखकों का सुझाव है कि बिना किसी स्पष्ट "उत्तर कुंजी" के जो रोबोट को बता सके कि क्या सही है, मैकेनिक ने शोर भरे, भ्रमित करने वाले बदलाव करने शुरू कर दिए जिससे रोबोट के प्रदर्शन को नुकसान पहुँचा।
जब "उत्तर कुंजियाँ" (Unit Tests) मौजूद थीं:
भले ही रोबोट एक पूर्ण समाधान के विरुद्ध अपने काम की जाँच कर सकता था, मैकेनिक फिर भी चमक नहीं सका।
- "5 बार प्रयास करें" विधि 86.0 के औसत स्कोर तक पहुँची।
- "रोबोट मैकेनिक" केवल 75.8 तक पहुँचा।
- लेखकों ने गौर किया कि कुछ अजीब था: मैकेनिक के सुधार केवल तभी दिखाई दिए जब उन्हें 5 प्रयासों में से सर्वश्रेष्ठ चुनने की अनुमति दी गई (pass@5)। जब उन्हें पहली बार में ही सही होना था (pass@1), तो मैकेनिक ने कुछ भी खास सुधार नहीं किया। यह सुझाव देता है कि मैकेनिक वास्तव में एक बेहतर उपकरण डिजाइन नहीं कर रहा था; यह केवल रोबोट को अधिक अनुमान लगाने में मदद कर रहा था।
"ओवरफिटिंग" (Overfitting) का जाल
सबसे बड़ा आश्चर्य तब आया जब शोधकर्ताओं ने परीक्षण किया कि क्या "रोबोट मैकेनिक" कोई ऐसा सबक सीख सकता है जो नए पहेलियों पर लागू हो। उन्होंने मैकेनिक को 45 प्रशिक्षण कार्यों पर अभ्यास करने दिया, फिर उसका परीक्षण 34 बिल्कुल नए कार्यों पर किया जिन्हें उसने पहले कभी नहीं देखा था।
परिणाम? मैकेनिक ने बहुत कम बदलाव किया।
- नए कार्यों पर, स्कोर औसतन केवल 0.6 अंक बढ़ा।
- एक मॉडल (GPT-5.4) के लिए, स्कोर में कोई बदलाव नहीं हुआ (72.1 से 72.1)।
पेपर का सुझाव है कि मैकेनिक एक अच्छे रोबोट होने के सामान्य नियम नहीं सीख रहा था। इसके बजाय, वह विशिष्ट पहेलियों के लिए "शॉर्टकट याद कर रहा था"। यह उस छात्र की तरह था जो अभ्यास परीक्षा के उत्तर रट लेता है लेकिन वास्तविक परीक्षा में असफल हो जाता है क्योंकि उसने वास्तव में विषय को नहीं सीखा।
तो, निष्कर्ष क्या है?
पेपर तर्क देता है कि हमें "ऑटोमैटिक हार्नेस इवोल्यूशन" को केवल इसलिए एक जादुई समाधान के रूप में मनाने से बचना चाहिए क्योंकि यह उन्हीं पहेलियों पर उच्च स्कोर करता है जिनका उसने अभ्यास किया है।
- यह क्या खारिज करता है: यह इस विचार को खारिज करता है कि ये इवोल्यूशन विधियाँ वर्तमान में केवल अधिक मेहनत करने (टेस्ट-टाइम कंप्यूटेशन को स्केल करने) की तुलना में श्रेष्ठ हैं।
- यह क्या सुझाव देता है: यह सुझाव देता है कि जो लाभ हम देखते हैं वे केवल अधिक बार प्रयास करने का परिणाम हो सकते हैं, न कि इसलिए कि हार्नेस डिजाइन अधिक स्मार्ट हो गया है।
- मुख्य बात: लेखक प्रस्ताव करते हैं कि हार्नेस इवोल्यूशन के वास्तव में उपयोगी होने के लिए, हमें इसे उन पहेलियों पर टेस्ट करने की आवश्यकता है जो उपकरणों में वास्तविक अपग्रेड की मांग करती हैं, और हमें इसे नई पहेलियों पर टेस्ट करना चाहिए ताकि यह सुनिश्चित हो सके कि यह केवल पुराने वाले को रटकर धोखाधड़ी नहीं कर रहा है।
संक्षेप में, "रोबोट मैकेनिक" अभी भी विकास के दौर में है। फिलहाल, यह एक एकल पहेली के लिए निर्देशों को ट्यून करने में बेहतर लगता है, बजाय एक सार्वभौमिक उपकरण बनाने के जो सभी के लिए काम करे। पेपर का सुझाव है कि इस पद्धति को विजेता घोषित करने से पहले हमें अधिक निष्पक्ष परीक्षणों की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।