← नवीनतम पेपर
🤖 machine learning

TTHE: Test-Time Harness Evolution

यह शोध पत्र टेस्ट-टाइम हार्नेस इवोल्यूशन (TTHE) को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड फ्रेमवर्क है जो निष्पादन ट्रेसेस (execution traces) के आधार पर कैंडिडेट हार्नेसेज की एक आबादी को विकसित करके मूल्यांकन के दौरान एक LLM एजेंट के निष्पादन योग्य नियंत्रण कार्यक्रम (executable control program) को गतिशील रूप से अनुकूलित करता है, जिससे मॉडल वेट्स को अपडेट किए बिना या ग्राउंड-ट्रुथ लेबल की आवश्यकता के बिना टेस्ट-टाइम डिस्ट्रीब्यूशन्स के प्रति निरंतर अनुकूलन सक्षम होता है।

मूल लेखक: Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक (एक LLM एजेंट) है जो कोड लिख सकता है, गणित की समस्याओं को हल कर सकता है, या आपकी उड़ानों की बुकिंग कर सकता है। आमतौर पर, जब हम इन रोबोटों को बनाते हैं, तो हम उन्हें हफ्तों तक प्रशिक्षित करते हैं और फिर उनके दिमाग को "फ्रीज" (स्थिर) कर देते हैं। एक बार जब वे फ्रीज हो जाते हैं, तो हम उनके आंतरिक वायरिंग को नहीं बदल सकते। यदि वे कोई गलती करते हैं, तो हम उन्हें बस यह नहीं कह सकते, "हे, अगली बार अलग तरह से सोचने की कोशिश करना।"

लेकिन क्या होगा यदि रोबोट के निर्देश—वह छोटा सा प्रोग्राम जो उसे अपना दिमाग इस्तेमाल करने का तरीका बताता है—चलते-फिरते बदल सकें? यही टेस्ट-टाइम हार्नेस इवोल्यूशन (TTHE) नामक एक नई विधि के पीछे का बड़ा विचार है।

"फ्रोझन ब्रेन, फ्लेक्सिबल सूट" का रूपक (Analogy)

रोबोट के दिमाग को एक जमी हुई मूर्ति के रूप में सोचें। आप इसे पिघला या नया आकार नहीं दे सकते। लेकिन रोबोट ने एक हाई-टेक सूट (हार्नेस) पहना हुआ है। इस सूट में औजारों के लिए जेबें, चरणों की एक चेकलिस्ट और यह जांचने का तरीका है कि रोबोट ने गलती की या नहीं।

अधिकांश रोबोट एक स्टैटिक सूट (स्थिर सूट) पहनते हैं। एक बार जब रोबोट फैक्ट्री से बाहर निकलता है, तो सूट सिलकर बंद कर दिया जाता है। यदि रोबोट दरवाजा खोलने की कोशिश करता है और विफल रहता है, तो सूट को पता नहीं चलता कि अगली बार इस समस्या को कैसे ठीक किया जाए। वह बस उसी टूटे हुए तरीके को बार-बार आजमाता रहता है।

TTHE एक ऐसे सूट की तरह है जो रोबोट के काम करते समय अपने स्वयं के सिलाई निर्देशों को फिर से लिख सकता है।

यह यहाँ कैसे काम करता है:

  1. रोबोट प्रयास करता है: रोबोट एक कार्य करने का प्रयास करता है (जैसे SQL क्वेरी लिखना या बग ठीक करना)। वह अपने पीछे "ब्रेड क्रम्ब्स" (रोटी के टुकड़ों) का एक निशान (एग्जीक्यूशन ट्रेस) छोड़ता है जो दिखाता है कि उसने वास्तव में क्या किया, किन औजारों का उपयोग किया, और कहाँ वह लड़खड़ाया।
  2. सूट उन निशानों को पढ़ता है: सूट का एक विशेष हिस्सा (प्रपोजर - Proposer) उन निशानों को देखता है। इसे किसी शिक्षक या सही उत्तर कुंजी की आवश्यकता नहीं है। यह बस पूछता है, "हम्म, रोबोट ने दरवाजा खोलने की कोशिश की, लेकिन हैंडल जंग लगा हुआ था। शायद अगली बार, हमें पहले हैंडल में तेल डालना चाहिए?"
  3. सूट खुद को फिर से लिखता है: प्रपोजर सूट के कोड को संपादित करता है। यह जंग की जांच के लिए एक नया चरण जोड़ सकता है, या हैंडल को दोबारा चेक करने के लिए एक नया नियम बना सकता है।
  4. सकीट सबसे अच्छे संस्करण को चुनता है: सूट का एक अन्य हिस्सा (जज - Judge) उन सभी नए संस्करणों को देखता है और उनमें से उस संस्करण को चुनता है जो रोबोट के अपने प्रदर्शन के आधार पर सबसे अच्छा लगता है।
  5. रोबोट आगे बढ़ता है: रोबोट इस नए, बेहतर सूट के साथ अपना काम जारी रखता है।

यह विधि क्या नहीं करती

यह जानना महत्वपूर्ण है कि यह विधि क्या अस्वीकार करती है:

  • कोई ब्रेन सर्जरी नहीं: पेपर स्पष्ट रूप से कहता है कि वे रोबोट के फ्रीज किए गए दिमाग (मॉडल वेट्स) को नहीं बदलते हैं। वे AI को फिर से प्रशिक्षित नहीं करते हैं। वे केवल सूट (हार्नेस) को बदलते हैं।
  • कोई जादुई उत्तर कुंजी नहीं: वे काम करते समय "गोल्ड लेबल्स" (सही उत्तर) का उपयोग नहीं करते हैं। रोबोट को अपनी गलतियों और सफलताओं को देखकर खुद समझना पड़ता है कि क्या काम कर रहा है।
  • कोई प्री-प्लानिंग नहीं: वे रोबोट के काम शुरू करने से पहले परफेक्ट सूट की तलाश नहीं करते हैं। सूट काम के दौरान विकसित होता है।

परिणाम: यह कितना अच्छा काम कर गया?

शोधकर्ताओं ने कुछ कठिन चुनौतियों पर इसका परीक्षण किया, जैसे डेटाबेस क्वेरी लिखना, प्रतिस्पर्धी प्रोग्रामिंग, और सॉफ्टवेयर बग को ठीक करना। उन्होंने "फ्रोझन सूट" वाले रोबोटों की तुलना "इवॉल्विंग सूट" वाले रोबोटों से की।

यहाँ उन्हें जो मिला (उनके परीक्षणों के सटीक नंबरों का उपयोग करते हुए):

  • टेक्स्ट-टू-SQL (BIRD): बेसलाइन रोबोट 12.0% सही था। TTHE के साथ, यह उछलकर 50.0% पर पहुँच गया। यह एक बहुत बड़ा सुधार है!
  • प्रतिस्पर्धी प्रोग्रामिंग (LiveCodeBench): यह 30.0% से बढ़कर 38.3% हो गया।
  • सॉफ्टवेयर इंजीनियरिंग (SWE-bench): यह 20.0% से सुधरकर 35.0% हो गया।
  • डेटा साइंस (DS-1000): यह 38.0% से बढ़कर 44.0% हो गया।

उन्होंने टूल-यूज़ कार्य claw-eval पर भी इसे आजमाया, जहाँ स्कोर थोड़ा अलग है (0 से 1 के बीच एक ग्रेड)। स्कोर 48.9% से बढ़कर 69.8% हो गया।

कमी: यह परफेक्ट नहीं है

पेपर बहुत ईमानदारी से बताता है कि यह विधि कहाँ रुक जाती है। "जज" जो सबसे अच्छा सूट चुनता है, वह परफेक्ट नहीं है। कभी-कभी, जज एक ऐसा सूट चुन लेता है जो दिखने में तो अच्छा लगता है लेकिन वास्तव में छिपे हुए टेस्ट में फेल हो जाता है।

  • सिलेक्शन रिग्रेट (चयन का पछतावा): एक परीक्षण में, यदि जज ने उपलब्ध उम्मीदवारों में से सबसे अच्छा सूट चुना होता, तो वह 64.0% सटीकता तक पहुँच सकता था। लेकिन क्योंकि जज ने गलती की और थोड़ा कम अच्छा वाला चुना, इसलिए उन्हें केवल 50.0% ही मिला।
  • कवरेज गैप (कवरेज की कमी): भले ही जज परफेक्ट होता, कुछ कार्य (एक परीक्षण में 50 में से लगभग 15) ऐसे थे जिन्हें कोई भी सूट हल नहीं कर सका। रोबोट के पास अभी तक सही औजार या विचार नहीं थे।

निचोड़

लेखक सुझाव देते हैं कि टेस्ट-टाइम हार्नेस इवोल्यूशन AI एजेंटों को उनके दिमाग को छुए बिना स्मार्ट बनाने का एक शक्तिशाली तरीका है। यह रोबोट के अपने कार्य लॉग को एक शिक्षक में बदल देता है।

हालाँकि, वे चेतावनी देते हैं कि यह अभी तक "हल की गई समस्या" नहीं है। यह विधि इस बात पर बहुत अधिक निर्भर करती है कि "जज" एक भाग्यशाली अनुमान और एक वास्तविक समाधान के बीच अंतर करने में सक्षम है या नहीं। यदि जज एक पेचीदा टेस्ट से भ्रमित हो जाता है, तो रोबोट गलत सबक सीख सकता है। लेकिन फिलहाल, यह दिखाता है कि AI को एक ऐसा सूट देना जो काम करते समय खुद को ठीक कर सके, एक बहुत ही आशाजनक दिशा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →