← नवीनतम पेपर
💬 NLP

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

यह शोध पत्र JIT-Agent को प्रस्तुत करता है, जो एक प्रशिक्षित मॉडल है जो वास्तविक समय में कार्य-विशिष्ट एजेंट हार्नेस (harness) को स्वचालित रूप से संश्लेषित और विकसित करता है, जो विभिन्न फाउंडेशन मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है और हार्नेस इंटेलिजेंस को एजेंट क्षमता के एक स्केलेबल, ऑर्थोगोनल आयाम के रूप में स्थापित करता है।

मूल लेखक: Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Ya
प्रकाशित 2026-08-27
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: जस्ट-इन-टाइम हार्नेस इवोल्यूशन के माध्यम से हार्नेस इंटेलिजेंस को स्केल करना

1. समस्या विवरण

एक LLM एजेंट की क्षमता केवल फाउंडेशन मॉडल के वेट्स (weights) द्वारा निर्धारित नहीं होती है, बल्कि यह एजेंट हार्नेस (agent harness) द्वारा संयुक्त रूप से परिभाषित होती है—जो कि मेमोरी मैनेजमेंट, प्लानिंग रणनीतियों, एक्शन प्रोटोकॉल और टूल/स्किल ऑर्केस्ट्रेशन से बना एक परिचालन ढांचा (operational scaffold) है। जबकि एक मजबूत मॉडल एक अनुपयुक्त हार्नेस के तहत विफल हो सकता है, एक मजबूत हार्नेस केवल तभी क्षमता को अनलॉक कर सकता है जब मॉडल उसे समझने और उसका पालन करने में सक्षम हो।

हार्नेस अनुकूलन के वर्तमान दृष्टिकोण मुख्य रूप से अहेड-ऑफ-टाइम (AOT) विधियों पर निर्भर करते हैं। ये सिस्टम हार्नेस को एक स्थायी आर्टिफैक्ट के रूप में देखते हैं जिसे भविष्य के कार्यों में सामान्यीकरण करने के लिए अनुभव स्ट्रीम पर अनुकूलित किया जाता है। हालांकि, AOT दृष्टिकोण इंस्टेंस-डिपेंडेंसी (instance-dependency) के साथ संघर्ष करते हैं: विभिन्न कार्यों (जैसे, वाइड-सर्च बनाम टर्मिनल टास्क बनाम डीप रिसर्च) के लिए मौलिक रूप से भिन्न हार्नेस प्रायर (priors) की आवश्यकता होती है। विषम मांगों के बीच एक एकल AOT हार्नेस को अनुकूलित करना बोझिल है, जिसके लिए बड़े डिज़ाइन स्पेस और ट्राजेक्टरी संचय की आवश्यकता होती है, जो अक्सर एक नए समस्या की विशिष्ट संरचना से मेल खाने में विफल रहता है। यह शोध पत्र प्रस्ताव देता है कि हार्नेस डिज़ाइन को एक मैनुअल, स्थिर इंजीनियरिंग कार्य से बदलकर एक जस्ट-इन-टाइम (JIT) क्षमता में परिवर्तित किया जाना चाहिए, जहाँ एक प्रशिक्षित मेटा-एजेंट ऑन-द-फ्लाई (on the fly) कार्य-विशिष्ट हार्नेस का संश्लेषण करता है।

2. कार्यप्रणाली: JIT-Agent

लेखक JIT-Agent का प्रस्ताव करते हैं, जो एक कॉम्पैक्ट मेटा-एजेंट है जिसे किसी भी ऑफ-द-शेल्फ एजेंटिक LLMs के लिए कार्य-अनुकूल हार्नेस को संश्लेषित, मरम्मत और विकसित करने के लिए डिज़ाइन किया गया है।

2.1 औपचारिकीकरण: फोर-मॉड्यूल प्रोटोकॉल

हार्नेस जनरेशन को व्यवहार्य और संरचित बनाने के लिए, पेपर एजेंट हार्नेस को एक कंपोजेबल, मशीन-जेनेरेटेबल आर्टिफैक्ट के रूप में औपचारिक रूप देता है जो एक निश्चित चार-मॉड्यूल प्रोटोकॉल Π=(M,P,A,F)\Pi = (M, P, A, F) द्वारा शासित है:

  1. मेमोरी (MM): इतिहास को एक देखे गए इतिहास (vtv_t) के दृश्य (view) में संकुचित करती है।
  2. प्लानिंग (PP): दृश्य को एक स्थानीय निर्देश (dtd_t) में परिवर्तित करती है।
  3. कैपेबिलिटी ऑर्केस्ट्रेशन (FF): निर्देश के आधार पर प्रासंगिक टूल्स/स्किल्स (CtC_t) का चयन और अनुक्रमण करती है।
  4. एक्शन (AA): असेंबल किए गए कॉन्टेक्स्ट का उपयोग करके कंट्रोलर स्टेट को अपडेट करती है और अगला एक्शन (ete_t) उत्सर्जित करती है।

यह गुणनखंड (factorization) विषम प्रोग्रामों को एक प्रोटोकॉल-अनुपालन स्पेस (HΠH_\Pi) के भीतर तुलनीय निर्देशांकों में बदल देता है। लेखक HarnessFactory पेश करते हैं, जो इस सामान्य इंटरफ़ेस के तहत 13 प्रतिनिधि समकालीन स्कैफोल्ड्स (जैसे, ReAct, Plan-and-Execute, Recursive agents) को लागू करने वाला एक एकीकृत कोडबेस है, जो एक सीड बैंक (B0B_0) के रूप में कार्य करता है।

2.2 ट्रेनिंग पाइपलाइन

JIT-Agent को हार्नेस इंटेलिजेंस (अनुकूलनशीलता, विश्वसनीयता और विकास क्षमता) प्राप्त करने के लिए तीन-चरणीय पाइपलाइन के माध्यम से प्रशिक्षित किया गया है:

  • चरण I: टास्क-कंडीशन्ड कस्टमाइजेशन

    • लक्ष्य: मॉडल को एक कार्य विशिष्टता (task specification) और एक छोटे संदर्भ (reference context) को प्रोटोकॉल-अनुपालन हार्नेस में मैप करना सिखाना।
    • विधि: एक फ्रोजन, अधिक शक्तिशाली टीचर मॉडल कार्य-अनुकूलित हार्नेस का संश्लेषण करता है। ट्रेनिंग डेटा में वैध जनरेशन पर सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) और प्रेफरेंस लर्निंग दोनों शामिल हैं। प्रेफरेंस ऑब्जेक्टिव (LprefL_{pref}) उन हार्नेस के लिए अनुकूलन करता है जो दक्षता (लेटेंसी या लागत) को कम किए बिना टास्क रिवॉर्ड में सुधार करते हैं, इसके लिए एक पारेटो-शैली के प्रेफरेंस नियम का उपयोग किया जाता है।
  • चरण II: हार्नेस की मरम्मत (Repairing Harnesses)

    • लक्ष्य: सिंथेसिस विफलताओं से उबरना सीखकर विश्वसनीयता सुनिश्चित करना।
    • विधि: विफल जनरेशन (कंपाइलर एरर, इंटरफेस मिसमैच, रनटाइम एक्सेप्शन) को बाउंडेड रिपेयर ट्राजेक्टरीज में बदला जाता है। एक टीचर स्ट्रक्चर्ड रिविज़न (Δ\Delta) प्रस्तावित करता है ताकि हार्नेस को ठीक किया जा सके। मॉडल इन रिपेयर ट्रांज़िशन की नकल करने के लिए प्रशिक्षित होता है, जिससे वह निष्पादन फीडबैक का उपयोग करके एक छोटे होराइजन (अधिकतम 2 राउंड) के भीतर प्रोटोकॉल-वैलिड निष्पादन को बहाल करना सीखता है।
  • चरण III: इवोल्यूशनरी ग्रुप-डीकपल्ड पॉलिसी ऑप्टिमाइजेशन (Evo-GDPO)

    • लक्ष्य: ऑनलाइन इवोल्यूशन को सक्षम करना जहाँ मॉडल ऐसे हार्नेस प्रस्तावित करना सीखता है जो वर्तमान आर्काइव फ्रंटियर से बेहतर हों।
    • विधि: प्रशिक्षण के दौरान, मॉडल उम्मीदवार हार्नेसों का एक समूह प्रस्तावित करता है। इनका मूल्यांकन एक इंकंबेंट (उस कार्य के लिए वर्तमान बैंक में सर्वश्रेष्ठ हार्नेस) के विरुद्ध किया जाता है। रिवॉर्ड सिग्नल को तीन चैनलों में डीकपल्ड किया गया है:
      1. रिवॉर्ड: प्राथमिक सिग्नल; उम्मीदवारों को इंकंबेंट के रिवॉर्ड के बराबर या उससे अधिक होना चाहिए।
      2. लेटेंसी और कॉस्ट: दक्षता सिग्नल जो केवल तभी सक्रिय होते हैं जब रिवॉर्ड सुरक्षित रहता है।
    • पॉलिसी को एक PPO-शैली के ऑब्जेक्टिव का उपयोग करके अपडेट किया जाता है जो एक नॉर्मलाइज्ड, एग्रीगेटेड एडवांटेज द्वारा संचालित होता है, जो दक्षता बनाए रखते हुए फ्रंटियर को पार करने के लिए पुरस्कृत करता है। हार्नेस बैंक (BnB_n) को रूढ़िवादी तरीके से अपडेट किया जाता है, केवल उन डिज़ाइनों को बनाए रखता है जो फ्रंटियर को आगे बढ़ाते हैं।

2.3 इन्फरेंस आर्किटेक्चर

JIT-Agent दो इन्फरेंस मोड का समर्थन करता है:

  • स्टैटिक इन्फरेंस (Static Inference): समानांतर में NN हार्नेस जेनरेट करता है, एक चुनता है, और उसे निष्पादित करता है। यह एनवायरनमेंट रोलआउट्स को बढ़ाए बिना उम्मीदवार विविधता को अधिकतम करने के लिए उपयोगी है।
  • स्ट्रीमिंग इन्फरेंस (Streaming Inference): टास्क स्ट्रीम्स के लिए डिज़ाइन किया गया है। मॉडल एक विकसित होते बैंक से संदर्भों को रिट्रीव करता है, एक हार्नेस जेनरेट करता है, उसे निष्पादित करता है, और फीडबैक के आधार पर बैंक को अपडेट करता है। यह अनुभव को डिप्लॉयमेंट के दौरान मॉडल पैरामीटर्स को अपडेट किए बिना कार्यों के बीच ट्रांसफर करने की अनुमति देता है।

3. मुख्य परिणाम

पेपर नौ बेंचमार्क में JIT-Agent का मूल्यांकन करता है जो डीप रिसर्च, डेली वर्क, प्लानिंग और वर्कस्पेस टास्क को कवर करते हैं, जिसमें GLM-5.2, DeepSeek-V4-Flash, Qwen3.6, और Mimo-V2.5 जैसे बैकबोन शामिल हैं।

  • प्रदर्शन लाभ (Performance Gains): डिफॉल्ट स्कैफोल्ड्स को JIT-जेनरेटेड हार्नेस से बदलने पर निरंतर सुधार होता है।

    • GLM-5.2: नौ बेंचमार्क में औसत सुधार +7.7 पॉइंट्स है। उल्लेखनीय लाभों में DeepPlanning-Travel पर +20.2 और OdysseyBench पर +4.3 शामिल हैं।
    • DeepSeek-V4-Flash: औसत सुधार +8.8 पॉइंट्स है। यह DeepSearchQA पर GPT-5.6 (+9.1) को भी पीछे छोड़ देता है।
    • सामान्यीकरण (Generalization): JIT-Agent सभी परीक्षण किए गए मॉडल परिवारों (DeepSeek, Qwen, Mimo) और वेरिएंट्स (Flash/Pro) में प्रदर्शन में सुधार करता है, जो दर्शाता है कि क्षमता का ट्रांसफर मॉडल वेट्स के बीच संभव है।
  • फिक्स्ड हार्नेस के साथ प्रतिस्पर्धात्मकता:

    • JIT-जेनरेटेड हार्नेस OpenCode और Claude Code जैसे परिपक्व रनटाइम्स के साथ प्रदर्शन में प्रतिस्पर्धी हैं।
    • DeepSeek-V4-Flash पर, JIT-Agent सबसे मजबूत फिक्स्ड हार्नेस (NanoBot) को DeepSearchQA पर +4.7 पॉइंट्स और xBench-DS पर +4.0 पॉइंट्स से पछाड़ता है।
  • लागत-दक्षता (Cost-Efficiency):

    • JIT-Agent सभी नियंत्रित सेटिंग्स में सबसे कम टोकन खपत और API लागत प्राप्त करता है।
    • सबसे सस्ते फिक्स्ड हार्नेस की तुलना में, यह प्रदर्शन में सुधार करते हुए प्रति-केस लागत को 14.9–54.1% (औसत 36.0%) कम करता है। उदाहरण के लिए, DeepSeek-V4-Flash xBench-DS पर, टोकन का उपयोग 527K से घटकर 212K हो गया जबकि प्रदर्शन 78.0 से बढ़कर 82.0 हो गया।
    • पारेटो फ्रंटियर विश्लेषण दिखाता है कि JIT-Agent ऑपरेटिंग पॉइंट्स को ऊपरी-बाएँ (उच्च प्रदर्शन, कम लागत) की ओर स्थानांतरित करता है, जो यह सिद्ध करता है कि लाभ लंबी ट्राजेक्टरीज के कारण नहीं बल्कि बेहतर ऑर्केस्ट्रेशन के कारण हैं।
  • टेस्ट-टाइम इवोल्यूशन:

    • स्ट्रीमिंग JIT (जो टास्क स्ट्रीम के ऊपर हार्नेस बैंक को अपडेट करता है) लगातार स्टैटिक JIT (स्वतंत्र जनरेशन) की तुलना में संचयी सटीकता (cumulative accuracy) में बेहतर प्रदर्शन करता है, जो निष्पादन फीडबैक से सीखने के महत्व को प्रदर्शित करता है।

4. महत्व और दावे

पेपर दावा करता है कि यह हार्नेस इंटेलिजेंस को स्थापित करता है, जो मॉडल स्केलिंग के समानांतर (orthogonal) एक नया, प्रशिक्षित और हस्तांतरणीय आयाम है।

  • पैराडाइम शिफ्ट: यह कार्य हार्नेस इंजीनियरिंग को "अहेड-ऑफ-टाइम" (एक स्थिर आर्टिफैक्ट को अनुकूलित करना) से बदलकर "जस्ट-इन-टाइम" (ऑन-द-फ्लाई कार्य-विशिष्ट स्कैफोल्ड का संश्लेषण करना) में ले जाता है।
  • मॉडल-एज़-अ-हार्नेस: यह प्रदर्शित करता है कि एक प्रशिक्षित मेटा-एजेंट ऐसे परिचालन स्कैफोल्ड जेनरेट कर सकता है जो कमजोर या अधिक कुशल बैकबोन को मजबूत मॉडल्स को टक्कर देने या उनसे आगे निकलने की अनुमति देते हैं।
  • स्केलेबिलिटी: हार्नेस को एक कंपोजेबल प्रोटोकॉल के रूप में औपचारिक रूप देकर और इसे विकसित करने के लिए एक जनरेटर को प्रशिक्षित करके, पेपर यह सुझाव देता है कि एजेंट क्षमता को केवल मॉडल पैरामीटर स्केलिंग के बजाय निष्पादन वातावरण के अनुकूलन के माध्यम से स्केल करने का मार्ग प्रशм है।
  • भविष्य की दिशा: लेखक इसे मॉडल-हार्नेस को-डिज़ाइन (Model-Harness Co-Design) की ओर एक कदम के रूप में देखते हैं, जहाँ फाउंडेशन मॉडल्स अंततः अपने स्वयं के निष्पादन सिस्टम को बनाने, संशोधित करने और विकसित करने की क्षमता को आंतरिक रूप से आत्मसात कर सकते हैं।

पेपर निष्कर्ष निकालता है कि हार्नेस इंटेलिजेंस केवल एक कार्यान्वयन विवरण नहीं है, बल्कि एजेंट प्रदर्शन का एक प्रथम-क्रम निर्धारक (first-order determinant) है, जो उस क्षमता को पुनः प्राप्त करने में सक्षम है जिसे अन्यथा महंगे बैकबोन स्केलिंग की आवश्यकता होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →