← नवीनतम पेपर
💻 computer science

Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents

यह शोध पत्र लाइफ-हार्नेस (Life-Harness) का प्रस्ताव करता है, जो एक नवीन दृष्टिकोण है जो मॉडल के भार (weights) को अपडेट करने के बजाय, इंटरैक्शन को मध्यस्थ बनाने के लिए एक पुन: प्रयोज्य, जीवनचक्र-जागरूक रनटाइम इंटरफेस को विकसित करके नियत (deterministic) वातावरण में फ्रोजन एलएलएम (LLM) एजेंटों के प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Tianshi Xu, Huifeng Wen, Meng Li

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianshi Xu, Huifeng Wen, Meng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत प्रतिभाशाली, उच्च शिक्षित इंटर्न (LLM) है जो अविश्वसनीय रूप से बुद्धिमान है लेकिन उसने पहले कभी आपका विशिष्ट कार्यालय नहीं देखा है। आप उन्हें एक कार्य देते हैं, जैसे "प्रिंटर ठीक करें" या "फाइलिंग कैबिनेट व्यवस्थित करें।"

कभी-कभी, इंटर्न विफल हो जाता है। इसलिए नहीं कि वह मूर्ख है, बल्कि इसलिए क्योंकि:

  • उसे प्रिंटर के विशिष्ट बटन लेआउट का पता नहीं है।
  • वह एक ऐसा दराज खोलने की कोशिश करता है जो लॉक है।
  • वह एक लूप में फंस जाता है, बार-बार एक ही दराज को खोलता और बंद करता रहता है।
  • वह फाइलिंग सिस्टम के नियमों को गलत समझ लेता है।

पारंपरिक रूप से, यदि कोई इंटर्न विफल होता है, तो कंपनियाँ इंटर्न को पुनः प्रशिक्षित (retrain) करने की कोशिश करती हैं। वे उन्हें स्कूल भेजती हैं, उन्हें अधिक किताबें पढ़ने के लिए कहती हैं, या उनके मस्तिष्क के रसायन विज्ञान (brain chemistry) में बदलाव करती हैं (यह मॉडल ट्रेनिंग है)। यह महंगा और धीमा है, और यदि आप कल एक अलग इंटर्न को काम पर रखते हैं, तो आपको उन सभी को फिर से प्रशिक्षित करना होगा।

यह शोध पत्र एक अलग विचार प्रस्तावित करता है: इंटर्न को पुनः प्रशिक्षित न करें। ऑफिस को ठीक करें।

लेखकों ने LIFE-HARNESS नामक एक प्रणाली बनाई है। इसे एक अति-बुद्धिमान ऑफिस मैनेजर के रूप में समझें जो इंटर्न और कार्यालय के उपकरणों के बीच खड़ा है। यह मैनेजर इंटर्न के दिमाग को नहीं बदलता; यह बस इस बात को बदल देता है कि इंटर्न दुनिया को कैसे देखता है और उसके साथ कैसे अंतःक्रिया (interact) करता है।

यहाँ बताया गया है कि LIFE-HARNESS कैसे काम करता है, जिसे चार सरल भूमिकाओं में विभाजित किया गया है:

1. नियम पुस्तिका स्पष्ट करने वाला (Environment Contract Layer)

इससे पहले कि इंटर्न काम शुरू करे, यह परत उन्हें एक चीट शीट (cheat sheet) थमा देती है।

  • समस्या: इंटर्न सोच सकता है, "मैं बस प्रिंटर पर चिल्लाकर उसे ठीक कर सकता हूँ।"
  • समाधान: मैनेजर कहता है, "नहीं, इस ऑफिस में, आपको लाल बटन दबाना होगा, फिर कोड टाइप करना होगा। साथ ही, नीले लीवर को कभी न छुएं।"
  • परिणाम: इंटर्न अनुमान लगाना बंद कर देता है और कमरे के विशिष्ट नियमों का पालन करता है।

2. स्मृति ताजा करने वाला (Procedural Skill Layer)

जब इंटर्न के सामने एक कठिन कार्य आता है, तो यह परत पिछले सफलताओं के आधार पर एक संकेत (hint) फुसफुसाती है।

  • समस्या: इंटर्न एक बिखरी हुई डेस्क को व्यवस्थित करने का सबसे अच्छा तरीका भूल जाता है।
  • समाधान: मैनेजर कहता है, "पिछली बार याद है? आपने पहले रंग के आधार पर, फिर आकार के आधार पर छाँटा था। वही दोबारा करें।"
  • परिणाम: इंटर्न को कौशल को शून्य से "सीखने" की आवश्यकता नहीं होती; वह बस एक सिद्ध रणनीति को याद करता है।

3. सुरक्षा निरीक्षक (Action Realization Layer)

यह परत किसी भी चीज़ को छूने से ठीक पहले एक बाउंसर (bouncer) की तरह काम करती है।

  • समस्या: इंटर्न एक ऐसा कमांड टाइप करने की कोशिश करता है जो सही दिखता है लेकिन वास्तव में त्रुटिपूर्ण है (जैसे, "Open file: report.txt" जब फ़ाइल वास्तव में "report.pdf" है)।
  • समाधान: बाउंसर उस क्रिया के होने से पहले ही उसे रोक देता है और कहता है, "हे, यह कमांड काम नहीं करेगा। क्या आपका मतलब 'report.pdf' था? चलिए आपके लिए इस टाइपो (typo) को ठीक करते हैं।"
  • परिणाम: इंटर्न सिस्टम को क्रैश नहीं करता या असंभव कार्यों में समय बर्बाद नहीं करता।

4. लूप तोड़ने वाला (Trajectory Regulation Layer)

यह परत पूरे प्रक्रिया पर नज़र रखती है ताकि यह सुनिश्चित हो सके कि इंटरल फंस न जाए।

  • समस्या: इंटर्न निराश हो जाता है और एक ही दराज को लगातार 10 बार खोलने लगता है।
  • समाधान: मैनेजर इस पैटर्न को देखता है, हस्तक्षेप करता है, और कहता है, "रुको! तुमने यह तीन बार आज़माया है। यह काम नहीं कर रहा है। चलो पूरी तरह से अलग दृष्टिकोण अपनाते हैं।"
  • परिणाम: इंटर्न अपनी ऊर्जा (या कंप्यूटर का समय) एक असफल रास्ते पर बर्बाद नहीं करता।

यह एक बड़ी बात क्यों है?

शोध पत्र ने इसे 18 अलग-अलग "इंटर्न" (विभिन्न AI मॉडल) और 7 अलग-अलग "ऑफिस" (कार्य जैसे उड़ान बुक करना, ऑनलाइन खरीदारी करना, या डेटाबेस प्रबंधित करना) पर परखा।

  • जादू: उन्होंने इस "ऑफिस मैनेजर" को केवल एक विशिष्ट इंटर्न (एक 4-बिलियन पैरामीटर मॉडल) का उपयोग करके प्रशिक्षित किया।
  • परिणाम: जब वे उसी समान ऑफिस मैनेजर को 17 अन्य इंटर्न (कुछ बहुत बड़े, कुछ छोटे, कुछ विशिष्ट) को दिए, तो 126 में से 116 संयोजनों में सुधार हुआ।
  • लाभ: औसतन, प्रदर्शन में 88.5% की उछाल आई।

निचोड़ (The Bottom Line)

यह शोध पत्र तर्क देता है कि कई AI विफलताएं इसलिए नहीं हैं क्योंकि AI "मूर्ख" है। वे इसलिए हैं क्योंकि AI गलत मानचित्र, गलत उपकरण या गलत नियमों के साथ दुनिया में नेविगेट करने की कोशिश कर रहा है।

AI के मस्तिष्क को हर बार नियम बदलने पर पुनः प्रशिक्षित करने में लाखों खर्च करने के बजाय, LIFE-HARNESS सुझाव देता है कि हमें बस एक बेहतर इंटरफ़ेस (एक बेहतर मैनेजर) बनाना चाहिए जो दुनिया के नियमों को AI के लिए अनुवादित कर सके। यह AI एजेंटों को वास्तविक दुनिया में बेहतर तरीके से काम करने के लिए एक सस्ता, तेज़ और पुन: प्रयोज्य (reusable) तरीका है।

संक्षेप में: AI को स्मार्ट बनाने की कोशिश न करें। बस उस दुनिया को समझना आसान बनाएं जिसमें वह रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →