← नवीनतम पेपर
💬 NLP

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

हार्नेसफोर्ज (HarnessForge) एक मेटा-एडेप्टिव फ्रेमवर्क है जो दोष-निर्देशित अनुकूलन (fault-guided tailoring) और हार्नेस-कंडीशन्ड एलाइनमेंट के माध्यम से एलएलएम (LLM) एजेंटों के बाहरी निष्पादन हार्नेस और आंतरिक तर्क नीति को संयुक्त रूप से विकसित करता है, जो विविध कार्य व्यवस्थाओं में उनकी निष्पादन योग्य अनुकूलता को अनुकूलित करके अलग-थलग अनुकूलन विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ HarnessForge पेपर का एक स्पष्टीकरण है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी समस्या: "कठोर रोबोट" (The Rigid Robot)

कल्पना कीजिए कि आपने अलग-अलग काम करने के लिए एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट सहायक (एक LLM Agent) को काम पर रखा है।

  • काम A: आपको उसे फ्लाइट बुक करने की आवश्यकता है। उसे एक सख्त चेकलिस्ट और कैलेंडर की आवश्यकता है।
  • काम B: आपको उसे एक रहस्यमयी कहानी लिखने की आवश्यकता है। उसे कहानी के मुख्य बिंदुओं की याद रखने की क्षमता और एक रचनात्मक प्रवाह की आवश्यकता है।
  • काम C: आपको उसे एक सिमुलेशन में लीक होने वाले पाइप को ठीक करने की आवश्यकता है। उसे यह पता होना चाहिए कि कौन से औज़ार कब और किस क्रम में उठाने हैं।

समस्या यह है कि अधिकांश रोबोट सहायक एक निश्चित निर्देश पुस्तिका (जिसे Harness कहा जाता है) के साथ आते हैं। यह मैनुअल रोबोट को बताता है कि उसे कैसे सोचना और कार्य करना है।

  • यदि मैनुअल बहुत कठोर है, तो रोबोट रचनात्मक कार्यों में विफल हो जाएगा।
  • यदि मैनुअल बहुत ढीला है, तो रोबोट जटिल, चरण-दर-चरण कार्यों के दौरान भ्रमित हो जाएगा।

पारंपरिक रूप से, शोधकर्ताओं ने इसे दो अलग-अलग तरीकों से ठीक करने की कोशिश की:

  1. मैनुअल को फिर से लिखना: रोबोट को वही रहने दें, लेकिन हर नए काम के लिए एक बेहतर निर्देश पुस्तिका लिखने की कोशिश करें। (यह धीमा है और अक्सर लक्ष्य से चूक जाता है)।
  2. रोबोट को प्रशिक्षित करना: मैनुअल को वही रहने दें, लेकिन रोबोट को परीक्षण और त्रुटि (trial and error) के माध्यम से स्मार्ट बनने के लिए "सिखाने" की कोशिश करें। (यह महंगा है और रोबोट एक खराब मैनुअल के कारण अभी भी भ्रमित हो सकता है)।

HarnessForge कहता है: "क्यों चुनना? आइए दोनों को एक साथ विकसित करें।"


समाधान: एक "जुगलबंदी" (A Tandem Dance)

लेखक एक प्रणाली प्रस्तावित करते हैं जिसे HarnessForge कहा जाता है। एजेंट सिस्टम को एक डांस जोड़ी (Dance Pair) के रूप में सोचें:

  • द हार्नेस (कोरियोग्राफर - Choreographer): यह बाहरी संरचना है। यह तय करता है कि कदम क्या होंगे, संगीत क्या होगा, नियम क्या होंगे और डांसर कौन से औज़ारों का उपयोग कर सकता है।
  • द पॉलिसी (डांसर - Dancer): यह रोबोट का मस्तिष्क है। यह तय करता है कि कोरियोग्राफी का पालन करने के लिए वास्तव में अपने पैरों को कैसे हिलाना है।

अतीत में, लोगों ने कोरियोग्राफर को ठीक करने या डांसर को अलग से प्रशिक्षित करने की कोशिश की। HarnessForge महसूस करता है कि वे एक-दूसरे से जुड़े (coupled) हुए हैं। एक महान कोरियोग्राफी बेकार है यदि डांसर कदम उठाने में सक्षम नहीं है। एक प्रतिभाशाली डांसर बेकार है यदि कोरियोग्राफी ही बेतुकी है।

HarnessForge उन्हें एक लूप में एक साथ विकसित करता है:

चरण 1: "दोष निदान" (गलती का पता लगाना)

सिस्टम डांस जोड़ी को कार्यों की एक श्रृंखला के माध्यम से चलाता है। जब वे लड़खड़ाते हैं (विफल होते हैं), तो एक "मेटा-एजेंट" (एक सुपर-स्मार्ट रेफरी) फुटेज देखता है।

  • क्या डांसर इसलिए लड़खड़ाया क्योंकि वह थक गया था? (पॉलिसी संबंधी समस्या)
  • क्या डांसर इसलिए लड़खड़ाया क्योंकि कोरियोग्राफर ने उसे ऐसा कदम दिया जो शारीरिक रूप से असंभव था? (हार्नेस संबंधी समस्या)
  • क्या वे इसलिए लड़खड़ाए क्योंकि संगीत गलत समय पर रुक गया? (मेमोरी/स्ट्रक्चर संबंधी समस्या)

चरण 2: हार्नेस को अनुकूलित करना (कोरियोग्राफी को फिर से लिखना)

निदान के आधार पर, सिस्टम स्वचालित रूप से Harness को फिर से लिखता है।

  • यदि रोबोट योजना भूलता रहा, तो हार्नेस को एक "स्टिकी नोट" सिस्टम (मेमोरी) जोड़ने के लिए अपडेट किया जाता है।
  • यदि रोबोट बार-बार गलत औज़ार चुनता रहा, तो हार्नेस को एक "सेफ्टी गार्ड" जोड़ने के लिए अपडेट किया जाता है जो उपयोग से पहले औज़ार की जाँच करता है।
  • उपमा: यह एक कोच की तरह है जो एक फुटबॉल टीम को हारते हुए देखता है और विशिष्ट कमजोरी को ठीक करने के लिए तुरंत उनकी फॉर्मेशन या प्लेबुक बदल देता है।

चरण 3: पॉलिसी को संरेखित करना (डांसर को प्रशिक्षित करना)

एक बार जब नया हार्नेस (कोरियोग्राफी) तैयार हो जाता है, तो सिस्टम केवल पुराने रोबोट को उसमें नहीं झोंकता है। यह रोबोट को विशेष रूप से इस नए सेट के नियमों के लिए फाइन-ट्यून (Fine-tune) करता है।

  • यह पिछले दौर के सफल प्रयासों को लेता है और रोबोट को सिखाता है: "हे, जब हार्नेस कहे 'औज़ार की जाँच करें', तो तुम्हें यह विशिष्ट मूवमेंट करना चाहिए।"
  • उपमा: यह एक डांस इंस्ट्रक्टर की तरह है जो एक डांसर को एक विशिष्ट रूटीन सिखा रहा है, यह सुनिश्चित करते हुए कि उसकी मसल मेमोरी नए कदमों के साथ पूरी तरह मेल खाती है।

चरण 4: "सर्वाइवल ऑफ द फिटेस्ट" (योग्यतम की उत्तरजीविता)

सिस्टम सबसे अच्छे जोड़ों (Harness + Robot) को रखता है और उन्हें हटा देता है जो अभी भी विफल हो रहे हैं। यह प्रक्रिया कई राउंड में दोहराई जाती है। हर राउंड के साथ, कोरियोग्राफी स्मार्ट होती जाती है, और डांसर उस विशिष्ट कोरियोग्राफी का पालन करने में बेहतर होता जाता है।


यह क्यों काम करता है (परिणाम)

पेपर ने इसे पांच अलग-अलग "डांस फ्लोर" (बेंचमार्क) पर परखा, जिसमें शामिल थे:

  • पहेलियों को हल करने के लिए टूल्स का उपयोग करना।
  • उत्तरों के लिए वेब सर्च करना।
  • मूवी डेटा प्राप्त करने के लिए API (डिजिटल टूल्स) को कॉल करना।

निष्कर्ष:

  1. साथ मिलकर बेहतर: वे सिस्टम जिन्होंने हार्नेस और पॉलिसी दोनों को एक साथ विकसित किया, उन्होंने उन सिस्टमों की तुलना में काफी बेहतर प्रदर्शन किया जिन्होंने केवल एक को बदला था।
  2. दक्षता (Efficiency): इसे काम करने के लिए लाखों अतिरिक्त प्रयासों (rollouts) की आवश्यकता नहीं पड़ी। क्योंकि सिस्टम विफलता की संरचना से सीखता है, इसलिए यह तेजी से सीखता है।
  3. अनुकूलता (Compatibility) महत्वपूर्ण है: सबसे बड़ा सबक यह है कि एक "परफेक्ट" रोबोट शून्य में मौजूद नहीं होता है। एक रोबोट उतना ही अच्छा है जितना कि वह सिस्टम जिसमें वह काम करता है। रोबोट और उसके सिस्टम को एक साथ विकसित करके, वे पूरी तरह से संगत (compatible) हो जाते हैं।

सारांश उपमा

कल्पना कीजिए कि आप एक परम स्विस आर्मी नाइफ (Swiss Army Knife) बनाने की कोशिश कर रहे हैं।

  • पुराना तरीका: या तो आप हैंडल (Harness) को परफेक्ट बनाने की कोशिश करते हैं, या आप ब्लेड (Policy) को और तेज करने की कोशिश करते हैं, लेकिन आप कभी भी दोनों को एक साथ नहीं बदलते।
  • HarnessForge का तरीका: आप महसूस करते हैं कि यदि आप बाएं हाथ के बढ़ई के लिए एर्गोनोमिक हैंडल बनाते हैं, तो आपको ब्लेड के कोण को भी समायोजित करना ही होगा। आप एक ऐसी वर्कशॉप बनाते हैं जहाँ हैंडल और ब्लेड को एक साथ बनाया, टेस्ट किया और एक लूप में रिफाइन किया जाता है जब तक कि वे एक-दूसरे में पूरी तरह फिट न हो जाएं।

परिणाम एक ऐसा टूल है जो उस विशिष्ट कार्य के लिए पूरी तरह से अनुकूलित है जिसे उसे करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →