← नवीनतम पेपर
🤖 AI

HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness

यह शोधपत्र HarnessBridge को प्रस्तुत करता है, जो एक हल्का, सीखने योग्य द्वि-दिशीय नियंत्रक (bidirectional controller) है जो अवलोकन और क्रिया प्रक्षेपों (observation and action projections) के माध्यम से एजेंट-पर्यावरण इंटरफ़ेस को स्वचालित करता है, और विभिन्न LLMs में टोकन उपयोग और प्रक्षेपवक्र लंबाई (trajectory length) को काफी कम करते हुए विशिष्ट मैनुअल हार्नेस के बराबर या उससे बेहतर प्रदर्शन प्राप्त करता है।

मूल लेखक: Xiaoxuan Wang, Haixin Wang, Alexander Taylor, Jason Cong, Yizhou Sun, Wei Wang

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoxuan Wang, Haixin Wang, Alexander Taylor, Jason Cong, Yizhou Sun, Wei Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बेहद बुद्धिमान लेकिन थोड़े बिखरे हुए स्वभाव के जासूस (AI एजेंट) को एक जटिल रहस्य सुलझाने के लिए काम पर रख रहे हैं, जिसे सुलझाने में कई दिन लग सकते हैं। वह जासूस अविश्वसनीय रूप से स्मार्ट है, लेकिन उसकी एक बुरी आदत है: वह जो कुछ भी देखता, सुनता या सोचता है, उसे एक विशाल नोटबुक में लिख देता है। धीरे-धीरे, नोटबुक इतनी मोटी हो जाती है कि जासूस को महत्वपूर्ण सुराग ढूंढने में कठिनाई होने लगती है और वह बार-बार उन्हीं बेकार पन्नों को पढ़ने में फंस जाता है।

इसी बीच, जासूस उन दरवाजों को खोलने की कोशिश करता रहता है जो पहले से ही बंद हैं या उन दीवारों पर दस्तक देता रहता है जिनका अस्तित्व ही नहीं है, जिससे उसका समय और ऊर्जा बर्बाद होती है।

यही वह समस्या है जिसे यह शोध पत्र (paper) संबोधित करता है। "हार्नेस" (harness) वह सिस्टम है जो जासूस और दुनिया के बीच स्थित होता है, जो सूचना के प्रवाह को प्रबंधित करता है। आमतौर पर, यह सिस्टम मनुष्यों द्वारा कठोर नियमों (जैसे "हमेशा पिछले 10 पन्ने रखें") का उपयोग करके बनाया जाता है। लेकिन इस पेपर के लेखकों ने पूछा: क्या होगा अगर हम सिस्टम को खुद यह सिखा सकें कि जासूस की नोटबुक और उसके कार्यों को कैसे प्रबंधित किया जाए, बिल्कुल एक स्मार्ट असिस्टेंट की तरह?

यहाँ HarnessBridge कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. दो-तरफा पुल (The Two-Way Bridge)

HarnessBridge को एक स्मार्ट बाउंसर के रूप में सोचें जो जासूस (AI) और अपराध स्थल (कंप्यूटर वातावरण) के बीच के दरवाजे पर खड़ा है। इसके दो मुख्य काम हैं, जो विपरीत दिशाओं में काम करते हैं:

कार्य A: "संपादक" (अवलोकन प्रक्षेपण - Observation Projection)

  • समस्या: अपराध स्थल जासूस को डेटा का एक विशाल प्रवाह भेजता है: उनके द्वारा खोली गई हर फाइल, हर एरर मैसेज, हर असफल प्रयास। जासूस की याददाश्त (AI का कॉन्टेक्स्ट विंडो) "शोर" (noise) से भर जाती है।
  • HarnessBridge का समाधान: संपादक जासूस की नोटबुक को देखता है और तीन कार्य करता है:
    • रखना (Keep): यह महत्वपूर्ण सुरागों को सुरक्षित रखता है (जैसे "संद संदिग्ध शाम 5 बजे देखा गया था" या "कोड एक गायब फाइल के कारण विफल हुआ")।
    • सारांश बनाना (Summarize): यह लंबे, उबाऊ अनुभागों को संक्षिप्त करता है। 50 लाइनों का कोड पेस्ट करने के बजाय जो जासूस पहले ही पढ़ चुका है, यह लिखता है: "आपने डेटाबेस फाइलों की जांच की और पाया कि त्रुटि लाइन 42 में थी।"
    • हटाना (Drop): यह कचरे को फेंक देता है। यदि जासूस ने उस फाइल को खोजने में 10 मिनट बिताए जो मौजूद ही नहीं थी, तो संपादक उस पूरे अनुभाग को हटा देता है ताकि जासूस उसे दोबारा पढ़ने में समय बर्बाद न करे।
  • परिणाम: जासूस को एक 100 पन्नों के उपन्यास के बजाय एक साफ, संक्षिप्त और उच्च-गुणवत्ता वाला विवरण मिलता है। इससे पैसा (टोकन का उपयोग) बचता है और जासूस को ध्यान केंद्रित करने में मदद मिलती है।

कार्य B: "कोच" (क्रिया प्रक्षेपण - Action Projection)

  • समस्या: कभी-कभी जासूस एक लूप (loop) में फंस जाता है। वे शायद एक ऐसा दरवाजा खोलने की कोशिश करते हैं जो उन्हें पता है कि बंद है, या वे तर्क के बजाय अनुमान लगाकर किसी पहेली को हल करने की कोशिश करते हैं। वे ऐसा करते रहते हैं, जिससे कदम बेकार जाते हैं।
  • HarnessBridge का समाधान: जासूस के कार्य को अपराध स्थल पर भेजने से पहले, कोच उसकी जांच करता है।
    • पास करना (Pass): यदि कार्य समझ में आता है, तो कोच कहता है "आगे बढ़ो।"
    • अस्वीकार करना (Reject): यदि कार्य समय की बर्बादी है (जैसे कि एक ऐसा टेस्ट चलाना जिसे अभी तक ठीक नहीं किया गया है), तो कोच उसे ब्लॉक कर देता है।
    • फीडबैक (Feedback): महत्वपूर्ण बात यह है कि कोच केवल "नहीं" नहीं कहता। वह एक विशिष्ट नोट देता है: "अभी वह टेस्ट न चलाएं। आपने पहले login.py फाइल में बग को ठीक नहीं किया है। पहले उसे ठीक करें।"
  • परिणाम: जासूस बेकार की गलतियां करना बंद कर देता है और तुरंत फीडबैक से सीखता है।

2. यह कैसे सीखता है (प्रशिक्षण चरण - The "Training" Phase)

आप सोच सकते हैं, "इस बाउंसर को क्या पता कि क्या करना है?"
लेखकों ने HarnessBridge को नियमों की सूची देकर नहीं, बल्कि एक छात्र की तरह प्रशिक्षित किया।

  • उन्होंने सफल जासूसी मामलों के हजारों उदाहरण लिए (जहाँ AI ने समस्या को हल किया था)।
  • उन्होंने सिस्टम को दिखाया: "यह जासूस के पास मौजूद अव्यवस्थित नोटबुक है। यह वह साफ संस्करण है जिसने उन्हें तेजी से समस्या हल करने में मदद की होती। यह वह क्रिया है जो उन्होंने ली, और यह बेहतर क्रिया है जो उन्हें लेनी चाहिए थी।"
  • सिस्टम ने इन निर्णयों की नकल करना सीखा। इसने सीखा कि एक "सीखने योग्य नीति" (learnable policy) कैसे बनें, जिसका अर्थ है कि यह एक स्थिर नियम पुस्तिका के बजाय स्थिति के अनुसार अनुकूलित होता है।

3. परिणाम: स्मार्ट और सस्ता

इस पेपर ने वास्तविक दुनिया की कोडिंग चुनौतियों (जैसे सॉफ्टवेयर में बग ठीक करना) पर इस सिस्टम का परीक्षण किया।

  • प्रदर्शन (Performance): HarnessBridge ने AI को समस्याओं को हल करने में सबसे अच्छे मानव-निर्मित सिस्टम के समान या उनसे बेहतर प्रदर्शन करने में मदद की।
  • दक्षता (Efficiency): यही बड़ी जीत है। क्योंकि सिस्टम ने जानकारी को संकुचित किया और AI को बेकार के कदम उठाने से रोका, इसलिए इसने काफी कम "टोकन" (AI कंप्यूटिंग की मुद्रा) का उपयोग किया। कुछ मामलों में, इसने लागत को 50% या 90% तक कम कर दिया।
  • सामान्यीकरण (Generalization): सिस्टम को एक प्रकार के AI जासूस के लिए प्रशिक्षित किया गया था, लेकिन यह अलग, यहाँ तक कि बड़े AI मॉडल के साथ जुड़ने पर भी पूरी तरह से काम करता था। यह एक ऐसे कोच की तरह है जिसने एक विशिष्ट एथलीट को प्रशिक्षित करना सीखा, लेकिन वह किसी भी अन्य एथलीट के प्रदर्शन को तुरंत सुधार सकता है।

सारांश उपमा (Summary Analogy)

यदि AI एजेंट एक रेस कार ड्राइवर है, तो पारंपरिक हार्नेस एक स्थिर GPS है जो सभी को एक ही निर्देश देता है। HarnessBridge एक स्मार्ट को-पायलट है जो:

  1. रेडियो के शोर को फिल्टर करता है ताकि ड्राइवर ट्रैक को स्पष्ट रूप से सुन सके।
  2. रेस के इतिहास का सारांश देता है ताकि ड्राइवर को पूरा मैनुअल पढ़े बिना वर्तमान रणनीति का पता चल सके।
  3. ड्राइवर के हाथ पर थपकी देता है यदि वह ऐसा मोड़ लेने की कोशिश करता है जो दीवार की ओर ले जाता है, और उसे बताता है कि वास्तव में कहाँ मुड़ना है।

पेपर का दावा है कि यह दृष्टिकोण AI एजेंटों को तेज़, सस्ता और बिना किसी मानवीय हस्तक्षेप के जटिल कार्यों को हल करने में बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →