AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling
AgentHER एक ऐसा फ्रेमवर्क है जो 'हाइंडसाइट एक्सपीरियंस रिप्ले' (Hindsight Experience Replay) को अनुकूलित करता है ताकि विफल LLM एजेंट प्रक्षेप पथों (trajectories) को वैकल्पिक लक्ष्यों के लिए वैध प्रदर्शन (demonstrations) के रूप में पुन: लेबल किया जा सके, जिससे विस्थापित विफलताओं को उच्च-गुणवत्ता वाले सुपरवाइज्ड और प्रेफरेंस लर्निंग डेटा में बदलकर विभिन्न मॉडल परिवारों में प्रशिक्षण दक्षता और प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट बटलर (नौकर) को रात का खाना बनाना सिखा रहे हैं।
पुराना तरीका (मानक प्रशिक्षण):
आप रोबोट को बताते हैं, "मेरे लिए एक स्टेक बनाओ।"
- परिदृश्य A: रोबोट एक बेहतरीन स्टेक सफलतापूर्वक बनाता है। आप कहते हैं, "बहुत अच्छा काम किया!" और उस वीडियो को एक सबक के रूप में सहेज लेते हैं।
- परिदृश्य B: रोबोट स्टेक जला देता है क्योंकि उसने गर्मी बहुत अधिक कर दी थी। आप कहते, "विफलता!" और तुरंत उस वीडियो को डिलीट करके कचरे में फेंक देते हैं।
आप यह 100 बार करते हैं। आप उन 20 "बेहतरीन स्टेक" वाले वीडियो को रखते हैं और बाकी 80 "जले हुए स्टेक" वाले वीडियो को फेंक देते हैं। आपको लगता है कि आप अपनी गलतियों से सीख रहे हैं, लेकिन वास्तव में आप अपने 80% अनुभव को फेंक रहे हैं। जले हुए स्टेक वाले वीडियो में भी उपयोगी जानकारी होती है: "रोबोट जानता है कि प्याज कैसे काटना है," "वह जानता है कि चूल्हा कैसे चालू करना है," और "वह जानता है कि पैन गर्म होता है।" वह बस अंतिम तापमान जांच में विफल रहा।
नया तरीका (AgentHER):
यह पेपर AgentHER (Agents के लिए Hindsight Experience Replay) नामक एक सिस्टम पेश करता है। यह नियम बदल देता है: जले हुए स्टेक को फेंकें नहीं। बस रेसिपी बदल दें।
यह कहने के बजाय कि "यह वीडियो बेकार है क्योंकि इसने स्टेक नहीं बनाया," AgentHER उस वीडियो को देखता है और पूछता है: "इस रोबोट ने वास्तव में किस चीज़ में सफलता प्राप्त की?"
हो सकता है कि रोबोट ने सफलतापूर्वक स्टेक ढूंढ लिया हो, प्याज काट लिया हो, और पैन को गर्म कर दिया हो, लेकिन फिर उसने उसे जला दिया। AgentHER उस वीडियो के लक्ष्य को बदलकर "स्टेक को जलाने तक तैयार करना" या "स्टेक ढूंढना और प्याज काटना" कर देता है।
अचानक, वह "विफल" वीडियो एक नए, प्राप्त करने योग्य कार्य का परफेक्ट उदाहरण बन जाता है। अब आपके पास 80 अतिरिक्त सबक हैं, बजाय इसके कि आप उन्हें फेंक दें।
चार चरणों वाली "किचन" प्रक्रिया
लेखकों ने इस "रेसिपी बदलने" की प्रक्रिया को स्वचालित करने के लिए एक चार-चरणीय पाइपलाइन बनाई है:
- जासूस (Failure Detector - विफलता डिटेक्टर):
सिस्टम जले हुए स्टेक के वीडियो को देखता है और पूछता है, "क्या यह पूरी तरह से तबाही है, या बस एक छोटी सी गलती?"
- यदि रोबोट ने चूल्हा जला दिया (एक विनाशकारी त्रुटि), तो वीडियो कचरा है।
- यदि रोबोट ने बस मांस जला दिया (एक सुधारात्मक त्रुटि), तो वीडियो को अगले चरण के लिए सुरक्षित रखा जाता है।
- सारांशकर्ता (Summarizer - आउटकम एक्सट्रैक्टर):
सिस्टम वीडियो को देखता है और वास्तव में क्या हुआ है उसकी एक सूची लिखता है।
- परिणाम: "स्टेक मिला," "प्याज काटा," "पैन को 400°F तक गर्म किया।"
- यह सुनिश्चित करता है कि लक्ष्य को फिर से लिखते समय सिस्टम मनगढ़ंत बातें न बनाए (Hallucinate)।
- संपादक (Editor - प्रॉम्प्ट रीलेबलर):
एक AI संपादक उपलब्धियों की सूची देखता है और एक नया लक्ष्य लिखता है जो वीडियो के साथ पूरी तरह मेल खाता हो।
- पुराना लक्ष्य: "मीडियम-रेयर स्टेक पकाएं।" (विफल)
- नया लक्ष्य: "स्टेक तैयार करें और प्याज काटें।" (सफल!)
- सुरक्षा जांच: दो स्वतंत्र संपादक (जज) को यह तय करना होगा कि नया लक्ष्य निष्पक्ष है या नहीं, तभी वीडियो को सेव किया जाएगा। यह सिस्टम को यह झूठ बोलने से रोकता है कि रोबोट ने क्या किया।
- शिक्षक (Teacher - डेटा ऑगमेंटर):
सिस्टम इस नए "नया लक्ष्य + वीडियो" के जोड़े को एक प्रशिक्षण पाठ के रूप में पैक करता है। यह रोबोट को सिखाता है: "हे, अगर तुम प्याज काटना चाहते हो, तो इसे ऐसे किया जाता है!"
यह एक बड़ी बात क्यों है
- दोगुने सबक: "विफल" वीडियो का उपयोग करके, रोबोट दोगुना तेज़ी से सीखता है। पेपर दिखाता है कि AgentHER का उपयोग करके, एक रोबोट सफल उदाहरणों के 50% कम उपयोग के साथ भी उतना ही अच्छा सीख सकता है जितना पहले।
- छोटे दिमागों के लिए बेहतर: छोटे AI मॉडल (जैसे 7-बिलियन पैरामीटर वाला मॉडल) सबसे अधिक लाभ उठाते हैं। वे अक्सर चरणों को करने के लिए "काफी स्मार्ट" होते हैं लेकिन अंतिम लक्ष्य को समझने में "थोड़े कमज़ोर" हो सकते हैं। AgentHER उन्हें वह विशिष्ट अभ्यास देता जिसकी उन्हें आवश्यकता है।
- वास्तविक दुनिया का प्रमाण: उन्होंने दो कठिन वास्तविक कार्यों पर इसका परीक्षण किया:
- WebArena: चीजें खरीदने या जानकारी खोजने के लिए वेबसाइटों को नेविगेट करना।
- ToolBench: API और सॉफ़्टवेयर टूल्स का उपयोग करना।
- परिणाम: रोबोट अपने कामों में काफी बेहतर हो गए (सफलता दर में 7% से 11% का सुधार), जो AI की दुनिया में एक बड़ी छलांग है।
"हाइंडसाइट" (Hindsight) का रूपक
एक स्पोर्ट्स कोच के बारे में सोचें।
- पुराना कोच: "तुमने शॉट मिस कर दिया! घर जाओ, हम केवल उन्हीं वीडियो का अध्ययन करते हैं जहाँ तुमने स्कोर किया है।"
- AgentHER कोच: "तुमने शॉट मिस कर दिया, लेकिन तुमने एक बेहतरीन प्ले किया, गेंद को बखूबी पास किया, और सही स्थिति में आए। चलो उस वीडियो को देखते हैं और कहें, 'पास और पोजीशनिंग के लिए बहुत अच्छा काम किया!' अगली बार, हमें बस अंतिम शॉट पर काम करना है।"
मुख्य निष्कर्ष
AgentHER हमें सिखाता है कि AI की दुनिया में, असफलता सफलता का विपरीत नहीं है; यह केवल गलत लेबल के साथ मिली सफलता है। लेबल (लक्ष्य) को वास्तव में जो हुआ उसके अनुसार बदलकर, हम विफलताओं के ढेर को प्रशिक्षण डेटा के खजाने में बदल सकते हैं, जिससे AI एजेंट अधिक स्मार्ट, तेज़ और कुशल बनते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।