← नवीनतम पेपर
🤖 machine learning

The Interplay of Harness Design and Post-Training in LLM Agents

मूल लेखक: Kyungmin Kim, Youngbin Choi, Seoyeon Lee, Suhyeon Jun, Dongwoo Kim, Sangdon Park

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kyungmin Kim, Youngbin Choi, Seoyeon Lee, Suhyeon Jun, Dongwoo Kim, Sangdon Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट नौकर को घर की सफाई करना सिखा रहे हैं। आपके पास दो मुख्य काम हैं:

  1. प्रशिक्षण (The Training): रोबोट को काम करने का तरीका सिखाना (पोस्ट-ट्रेनिंग)।
  2. निर्देश पुस्तिका (The Instruction Manual): वह विशिष्ट तरीका जिससे आप नियमों को लिखते हैं, उपकरणों की सूची बनाते हैं और हर चरण में रोबोट को क्या दिखाई देता है, उसे समझाते हैं (द हारनेस/The Harness)।

यह शोध पत्र तर्क देता है कि लंबे समय तक, शोधकर्ताओं ने रोबोट को प्रशिक्षित (Training) करने पर बहुत अधिक ध्यान केंद्रित किया लेकिन निर्देश पुस्तिका (Instruction Manual) को एक स्थिर, उबाऊ विवरण मान लिया। उन्होंने माना कि यदि वे बस रोबोट को पर्याप्त प्रशिक्षण दे दें, तो मैनुअल मायने नहीं रखता।

इस शोध पत्र के लेखक कहते हैं: "रुकिए! मैनुअल उतना ही महत्वपूर्ण है जितना कि प्रशिक्षण, खासकर जब रोबोट को नई स्थितियों का सामना करना पड़ता है।"

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. निर्देश पुस्तिकाओं के तीन प्रकार (द हारनेस)

शोधकर्ताओं ने यह देखने के लिए "निर्देश पुस्तिका" के तीन अलग-अलग संस्करण बनाए कि कौन सा सबसे अच्छा काम करता है। उन्होंने इन्हें h-low, h-mid, और h-high कहा।

  • h-low (बुनियादी मैनुअल): यह रोबोट को बिना किसी अतिरिक्त मदद के क्रियाओं की सूची देने जैसा है ("जाओ," "लो," "साफ करो")। यह रोबोट को यह नहीं बताता कि वह क्या पकड़े हुए है या वर्तमान में कौन से उपकरण उपलब्ध हैं। इसे लिखना सस्ता है लेकिन रोबोट के लिए इसका उपयोग करना कठिन है।
  • h-mid (सहायक मैनुअल): इस संस्करण में एक "वर्तमान स्थिति" (Current Status) की पंक्ति जोड़ी गई है। यह रोबोट को बताता है, "वैसे, आप अभी एक प्लेट पकड़े हुए हैं," और "यहाँ उन उपकरणों की सूची है जिनका आप अभी उपयोग कर सकते हैं।"
  • h-high (विशेषज्ञ मैनुअल): यह अंतिम मार्गदर्शिका है। यह समझाता है कि उपकरण एक साथ कैसे काम करते हैं (जैसे, "आपको चम्मच लेने से पहले दराज खोलनी होगी")। यह भी लगातार रोबोट को याद दिलाता रहता है कि वह क्या ले जा रहा है।

निष्कर्ष: ठीक वैसे ही जैसे एक मानव छात्र एक अस्पष्ट शब्दों की सूची के बजाय एक विस्तृत पाठ्यपुस्तक के साथ बेहतर सीखता है, रोबोट ने प्रशिक्षण शुरू होने से पहले ही h-high मैनुअल के साथ काफी बेहतर प्रदर्शन किया।

2. "कुकिंग क्लास" की उपमा (प्रशिक्षण बनाम मैनुअल)

शोधकर्ताओं ने पूछा: क्या हमें पहले सरल मैनुअल का उपयोग करके रोबोट को सिखाना चाहिए, और फिर बाद में विस्तृत मैनुअल पर स्विच करना चाहिए? या हमें पहले दिन से ही विस्तृत मैनुअल का उपयोग करके इसे सिखाना चाहिए?

  • गलती: कई लोगों ने सोचा, "आइए हम रोबोट को सरल मैनुअल (h-low) के साथ प्रशिक्षित करें क्योंकि यह आसान है, और फिर काम पर जाने के समय इसे विस्तृत मैनुअल (h-high) दे दें।"
  • वास्तविकता: यह एक छात्र को खाली पार्किंग में बिना स्टीयरिंग व्हील के कार चलाना सिखाने जैसा है, और फिर परीक्षण के पहले दिन उन्हें स्टीयरिंग व्हील वाली कार थमा देना। रोबोट भ्रमित हो जाता है।
  • परिणाम: रोबोट को विस्तृत मैनुअल देखते हुए ही प्रशिक्षित होना चाहिए। यदि आप इसे सरल मैनुअल के साथ प्रशिक्षित करते हैं और बाद में बदलते हैं, तो यह विफल हो जाता है। रोबोट को विस्तृत निर्देशों को पढ़ते हुए सोचना सीखना होगा।

3. "घर बदलना" परीक्षण (आउट-ऑफ-डिस्ट्रीब्यूशन)

वास्तविक जीवन अव्यवस्थित होता है। कभी-कभी रोबोट को एक अलग घर की सफाई करनी पड़ती है (टास्क शिफ्ट), या उपकरणों के नाम बदल जाते हैं (टूल एनवायरनमेंट शिफ्ट)।

  • उदाहरण: प्रशिक्षण वाले घर में, उपकरण का नाम "Go" है। नए घर में, उपकरण का नाम "Navigate" है।
  • परीक्षण: उन्होंने रोबोट को सरल मैनुअल (h-low) और विस्तृत मैनुल (h-high) के साथ प्रशिक्षित किया और फिर उन्हें इन "नए घरों" में भेजा।

चौंकाने वाला परिणाम:

  • सरल मैनुअल (h-low) के साथ प्रशिक्षित रोबोटों के उपकरण के नाम बदलने पर पूरी तरह से काम करना बंद कर दिया। वे अनुकूलन नहीं कर सके।
  • विस्तृत मैनुअल (h-high) के साथ प्रशिक्षित रोबोट 'गिरगिट' की तरह थे। क्योंकि वे उपकरणों के तर्क (logic) को समझते थे (विस्तृत मैनुअल की बदौलत), वे समझ सके कि "Navigate" केवल "Go" का एक नया नाम है और उन्होंने सफलतापूर्वक काम जारी रखा।

4. "क्रेडिट कार्ड" की समस्या (क्यों प्रशिक्षण मायने रखता है)

शोधकर्ताओं ने यह भी देखा कि रोबोट कैसे सीखता है। उन्होंने दो अलग-अलग शिक्षण विधियों (एल्गोरिदम) का उपयोग किया:

  • GRPO: कार्य के अंत में ग्रेड देता है (क्या आपने पूरा घर साफ किया? हाँ/नहीं)।
  • GiGPO: प्रत्येक चरण पर फीडबैक देता है (प्लेट उठाने के लिए अच्छा काम; उसे गिराने के लिए बुरा काम)।

उन्होंने पाया कि सबसे स्मार्ट शिक्षण पद्धति (GiGPO) भी उस रोबोट को नहीं बचा सकी जिसे खराब मैनुअल के साथ प्रशिक्षित किया गया था। यदि मैनुल बहुत सरल था, तो चाहे शिक्षक कितना भी अच्छा क्यों न हो, रोबोट भटक जाता था। लेकिन यदि मैनुल विस्तृत था, तो सबसे स्मार्ट शिक्षण पद्धति ने रोबोट को जीनियस बना दिया।

मुख्य निष्कर्ष

आप कैसे सिखाते हैं (प्रशिक्षण एल्गोरिदम) को किसके साथ सिखाते हैं (हारनेस/मैनुअल) से अलग नहीं कर सकते।

  • मैनुअल में कमी न करें: एक विस्तृत, सूचनात्मक मैनुल केवल "अतिरिक्त काम" नहीं है; यह वह आधार है जो रोबोट को प्रभावी ढंग से सीखने की अनुमति देता है।
  • अंतिम टूल के साथ प्रशिक्षित करें: आपको रोबोट को उन्हीं विस्तृत निर्देशों का उपयोग करके प्रशिक्षित करना चाहिए जिनका वह वास्तविक दुनिया में उपयोग करेगा। बाद में मैनुअल बदलना विफलता का नुस्खा है।
  • परिवर्तन के लिए तैयारी: यदि आप चाहते हैं कि आपका रोबोट अप्रत्याशित परिवर्तनों (जैसे नए टूल के नाम या अलग कमरे) को संभाल सके, तो आपको इसे यथासंभव सूचनात्मक मैनुल के साथ प्रशिक्षित करना ही होगा।

संक्षेप में: एक महान शिक्षक (प्रशिक्षण) बेकार है यदि पाठ्यपुस्तक (हारनेस) ऐसी भाषा में लिखी गई है जिसे छात्र समझ नहीं पाता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →