HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry
HarnessX एक कंपोजेबल (composable) और एडेप्टिव (adaptive) फाउंड्री पेश करता है जो सब्स्टीट्यूशन अलजेब्रा (substitution algebra) और ट्रेस-ड्रिवन मल्टी-एजेंट इवोल्यूशन (trace-driven multi-agent evolution) के माध्यम से AI एजेंट रनटाइम इंटरफेस को व्यवस्थित रूप से विकसित करता है, जिससे केवल मॉडल स्केलिंग पर निर्भर हुए बिना विविध बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अनुभवहीन इंटर्न है (AI मॉडल)। आप चाहते हैं कि वह एक जटिल समस्या को हल करे, जैसे कि यात्रा की योजना बनाना, एक टूटी हुई वेबसाइट को ठीक करना, या एक वीडियो गेम खेलना।
अभी, अधिकांश लोग इस कोशिश में लगे हैं कि एक "सुपर-इंटर्न" (एक बड़ा, अधिक महंगा AI मॉडल) को काम पर रखकर इंटर्न को और अधिक स्मार्ट बनाया जाए। लेकिन यह पेपर, HarnessX, तर्क देता है कि असली रहस्य केवल एक बेहतर इंटर्न को काम पर रखने में नहीं है; बल्कि उनके काम करने के लिए एक बेहतर ऑफिस, टूलकिट और नियम पुस्तिका बनाने में है।
लेखक इस "ऑफिस सेटअप" को Harness कहते हैं।
समस्या: "हस्तनिर्मित" (Hand-Crafted) ऑफिस
वर्तमान में, यदि आप चाहते हैं कि एक AI कोई नया काम करे, तो एक मानव इंजीनियर को उसके लिए मैन्युअल रूप से एक कस्टम ऑफिस बनाना पड़ता है। वे विशिष्ट निर्देश (प्रॉम्प्ट्स) लिखते हैं, विशिष्ट टूल्स जोड़ते हैं, और मेमोरी सिस्टम सेट करते हैं।
- समस्या: ये ऑफिस स्थिर (static) होते हैं। यदि इंटर्न बदल जाता है या काम बदल जाता है, तो पूरे ऑफिस को फिर से बनाना पड़ता है।
- बर्बादी: जब इंटर्न विफल होता है, तो हम गलती देखते हैं, ऑफिस को मैन्युअल रूप से ठीक करते हैं, और फिर से प्रयास करते हैं। हम उन गलतियों का उपयोग ऑफिस को स्वचालित रूप से बेहतर बनाने के लिए या अगली बार के लिए इंटर्न को बेहतर प्रशिक्षित करने के लिए शायद ही कभी करते हैं।
समाधान: "Harness Foundry"
HarnessX एक फैक्ट्री (एक "फाउंड्री") है जो इन ऑफिसों को स्वचालित रूप से बनाती है। यह ऑफिस सेटअप को एक जीवित चीज़ के रूप में मानता है जिसे अपने आप असेंबल, अनुकूलित और विकसित किया जा सकता है।
यह कैसे काम करता है, यहाँ तीन सरल भागों में दिया गया है:
1. संरचना (Composition): द LEGO ऑफिस
एक अव्यवध और उलझे हुए ऑफिस के बजाय, HarnessX ऑफिस को टाइप्ड, इंटरचेंजेबल LEGO ब्लॉक्स से बनाता है जिन्हें "प्रोसेसर" (Processors) कहा जाता है।
- उपमा: कल्पना कीजिए कि ऑफिस में विशिष्ट स्लॉट हैं: "टूल्स" के लिए एक, "मेमोरी" के लिए एक, "नियमों" के लिए एक, और "कॉन्टेक्स्ट" के लिए एक।
- यह कैसे काम करता है: आप "वेब सर्च" ब्लॉक को "टूल्स" स्लॉट में या "लॉन्ग-टर्म मेमोरी" ब्लॉक को "मेमोरी" स्लॉट में लगा सकते हैं। क्योंकि ये मानकीकृत ब्लॉक हैं, आप पूरे ढांचे को तोड़े बिना इन्हें बदल सकते हैं। यह ऑफिस को मॉड्यूलर और बदलने के लिए सुरक्षित बनाता है।
2. अनुकूलन (Adaptation): स्व-सुधार करने वाला मैनेजर (AEGIS)
यह सिस्टम का मस्तिष्क है। HarnessX एक विशेष मैनेजर का उपयोग करता है जिसे AEGIS कहा जाता है, जो इंटर्न के काम करने पर नज़र रखता है और स्वचालित रूप से ऑफिस को ठीक करता है।
- दर्पण (The Mirror): AEGIS ऑफिस को एक वीडियो गेम कैरेक्टर की तरह देखता है। यह "ट्रेस" (इंटर्न द्वारा किए गए कार्यों का स्टेप-दर-स्टेप लॉग) को देखता है और पूछता है: "वे क्यों विफल हुए? क्या यह टूल था? नियम था? या प्रॉम्प्ट?"
- 4-चरणीय लूप:
- डाइजेस्ट (Digest): यह अस्त-व्यस्त लॉग्स को पढ़ता है और विफलताओं का सारांश बनाता है।
- प्लान (Plan): यह तय करता है कि किस प्रकार के बदलाव की आवश्यकता है (जैसे, "हमें एक नए टूल की आवश्यकता है" बनाम "हमें निर्देशों को फिर से लिखने की आवश्यकता है")।
- इवॉल्व (Evolve): यह वास्तव में नया ऑफिस कॉन्फ़िगरेशन बनाता है।
- क्रिटिक (Critic): यह एक सख्त सुरक्षा निरीक्षक के रूप में कार्य करता है। यह नए ऑफिस का परीक्षण करता है ताकि यह सुनिश्चित हो सके कि यह उन चीजों को न तोड़ दे जो पहले से काम कर रही थीं।
- परिणाम: ऑफिस बिना किसी मानव के कोड को हर बार फिर से लिखे, अपने आप बेहतर होता जाता है।
3. सह-विकास (Co-Evolution): एक दो-तरफा रास्ता
आमतौर पर, हम या तो ऑफिस को ठीक करते हैं या इंटर्न को प्रशिक्षित करते हैं। HarnessX दोनों को एक साथ करता है।
- उपमा: कल्पना कीजिए कि ऑफिस बेहतर होता है, जिससे इंटर्न को नई तरकीबें सीखने में मदद मिलती है। फिर, इंटर्न स्मार्ट होता है, जिससे ऑफिस और भी जटिल कार्यों को आज़माने में सक्षम होता है।
- लूप: सिस्टम इंटर्न की विफलताओं का उपयोग ऑफिस को अपग्रेड करने के लिए करता है और नए ऑफिस का उपयोग इंटर्न के दिमाग को अपग्रेड करने के लिए बेहतर ट्रेनिंग डेटा जेनरेट करने हेतु करता है। वे एक-दूसरे को ऊपर उठाते हैं।
प्रयोगों में क्या हुआ?
टीम ने वेब शॉपिंग से लेकर सॉफ्टवेयर इंजीनियरिंग तक पांच अलग-अलग "गेम्स" (बेंचमार्क्स) पर इसका परीक्षण किया। उन्होंने छोटे से बड़े, तीन अलग-अलग प्रकार के AI मॉडल्स का उपयोग किया।
- बड़ी जीत: औसतन, सिस्टम ने प्रदर्शन में 14.5% का सुधार किया।
- सुपर विन: कमजोर AI मॉडल्स के लिए, सुधार बहुत बड़ा था—44% तक।
- क्यों? पेपर नोट करता है कि कमजोर मॉडल्स में अधिक "व्यवहार संबंधी अंतराल" (behavioral gaps) होते हैं (उन्हें चीजें कैसे करनी हैं, यह नहीं पता होता)। एक बेहतर ऑफिस (हार्नेस) उन अंतरालों को तुरंत भर सकता है। मजबूत मॉडल्स पहले से ही काफी अच्छे हैं, इसलिए ऑफिस उनकी कम मदद करता है।
- "अटकने" वाली समस्या (The "Stuck" Problem): एक बहुत ही मिश्रित टेस्ट (GAIA) पर, एक अकेला ऑफिस सब कुछ ठीक नहीं कर सका क्योंकि कुछ कार्यों के लिए विपरीत नियमों की आवश्यकता थी। सिस्टम ने इसे ऑफिस के कई संस्करण (variants) बनाकर हल किया और प्रत्येक कार्य को सबसे उपयुक्त संस्करण पर भेजा। इसने सिस्टम को पिछले कार्यों को करने के तरीके को "भूलने" से रोका।
मुख्य निष्कर्ष (The Takeaway)
पेपर निष्कर्ष निकालता है कि बेहतर परिणाम प्राप्त करने के लिए हमें AI मॉडल्स के अनंत रूप से स्मार्ट होने का इंतज़ार करने की ज़रूरत नहीं है। एक कंपोजेबल, स्व-विकसित रनटाइम एनवायरनमेंट (द हार्नेस) बनाकर, हम प्रदर्शन में भारी वृद्धि प्राप्त कर सकते हैं, विशेष रूप से छोटे या कम सक्षम मॉडल्स के लिए।
संक्षेप में: केवल एक स्मार्ट इंटर्न न खरीदें; उनके लिए एक स्मार्ट, स्व-मरम्मत करने वाला ऑफिस बनाएं, और उन्हें अपनी गलतियों से सीखने दें ताकि वे ऑफिस को और भी बेहतर बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।