← नवीनतम पेपर
🤖 machine learning

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

यह शोध पत्र ग्रुप-ग्राफ पॉलिसी ऑप्टिमाइज़ेशन (G2PO) का प्रस्ताव करता है, जो एक नवीन समूह-आधारित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एल्गोरिदम है जो रिवॉर्ड स्पर्सिटी (पुरस्कार की विरलता) को कम करने और क्रेडिट असाइनमेंट में सुधार करने के लिए रैखिक इंटरेक्शन ट्रेजेक्टरीज को एक वैश्विक स्टेट-ट्रांज़िशन ग्राफ में परिवर्तित करता है, जिससे लॉन्ग-होराइज़न एजेंटिक कार्यों में लार्ज लैंग्वेज मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

मूल लेखक: Yunan Wang, Minghui Song, Zihan Zhang, Shaohan Huang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunan Wang, Minghui Song, Zihan Zhang, Shaohan Huang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: एक रोबोट को जटिल भोजन बनाना सिखाना

कल्पना कीजिए कि आप एक रोबोट को एक जटिल व्यंजन बनाना सिखा रहे हैं, जैसे कि 'सूफ़्ले' (soufflé)। यह कोई एक-चरण वाला कार्य नहीं है; इसमें दर्जनों चरण शामिल हैं: ओवन को पहले से गर्म करना, अंडे मिलाना, मैदा डालना और फिर उसे बेक करना।

AI की दुनिया में, इसे "लॉन्ग-होरिज़न एजेंटिक रीइन्फोर्समेंट लर्निंग" (Long-Horizon Agentic Reinforcement Learning) कहा जाता है। यहाँ "एजेंट" वह रोबोट है, और "एनवायरनमेंट" (वातावरण) रसोई है।

पुराना तरीका (ट्रैजेक्टरी-लेवल ट्रेनिंग):
पहले, AI शोधकर्ता पूरी कुकिंग प्रक्रिया को एक ही लंबी कहानी के रूप में देखते थे। यदि अंत में सूफ़्ले गिर जाता या खराब हो जाता, तो AI उस हर एक कदम को दोष देता जो उसने लिया था—ओवन चालू करने से लेकर उसे बाहर निकालने तक। यदि सूफ़्ले बेहतरीन बनता, तो वह हर कदम की प्रशंसा करता। यह अक्षम है क्योंकि AI यह नहीं बता पाता कि सफलता या विफलता के लिए कौन सा विशिष्ट कदम जिम्मेदार था। यह वैसा ही है जैसे आपको पूरे सेमेस्टर का रिपोर्ट कार्ड मिले जिसमें केवल "पास" या "फेल" लिखा हो, बिना यह जाने कि कौन से होमवर्क अच्छे थे और कौन से बुरे।

हालिया सुधार (स्टेप-लेवल ट्रेनिंग):
नए तरीकों ने प्रत्येक कदम को व्यक्तिगत रूप से देखकर इसे ठीक करने की कोशिश की। हालाँकि, वे अभी भी प्रत्येक कुकिंग प्रयास को एक अलग, सीधी रेखा के रूप में देखते थे। यदि रोबोट ने 10 बार सूफ़्ले बनाने की कोशिश की, तो AI उन 10 अलग-अलग रेखाओं को देखता। उसे यह अहसास नहीं होता कि प्रयास #1 और प्रयास #3 में, रोबोट रसोई में बिल्कुल एक ही जगह पर खड़ा था और फ्रिज के खुले हुए दरवाजे को देख रहा था।

मुख्य मुद्दा:
चूंकि AI इन समान क्षणों को अलग, असंबंधित घटनाओं के रूप में देखता था, इसलिए उसका निर्णय अस्थिर था।

  • उच्च विचलन (High Variance): हो सकता है कि प्रयास #1 में, रोबोट ने फ्रिज खोला (एक अच्छा कदम), लेकिन बाद में अंडे गिरा दिए (एक बुरा कदम), जिससे पूरा भोजन खराब हो गया। AI गलत तरीके से सोच सकता था कि "फ्रिज खोलना" एक बुरा कदम था क्योंकि अंतिम परिणाम विफल रहा।
  • अल्पदृष्टि (Myoric View): AI "बड़ी तस्वीर" नहीं देख पा रहा था। वह एक छोटे, महत्वहीन कदम (जैसे काउंटर पोंछना) और एक महत्वपूर्ण सफलता (जैसे सही सामग्री ढूँढना) के बीच अंतर नहीं कर पा रहा था।

समाधान: G2PO (द "ग्लोबल मैप" अप्रोच)

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे G2PO कहा जाता है। सीधी रेखाओं को देखने के बजाय, G2PO रसोई का एक नक्शा (Map) या ग्राफ (Graph) बनाता है।

1. स्टेट-ट्रांजिशन ग्राफ बनाना

कल्पना कीजिए कि AI रसोई का एक नक्शा बनाता है। रोबोट द्वारा सामना किया गया हर अद्वितीय सिचुएशन (स्थिति) नक्शे पर एक नोड (Node) यानी एक बिंदु बन जाता है।

  • नोड A: रोबलेट खुले फ्रिज के सामने खड़ा है।
  • नोड B: रोबोट के हाथ में अंडे हैं।
  • नोड C: रोबोट ओवन के पास है।

हर बार जब रोबोट कोई क्रिया (जैसे "फ्रिज खोलना") करता है, तो वह एक नोड से दूसरे नोड तक एक एज (Edge) यानी एक रेखा खींचता है।

2. ग्रुप-एग्रीगेशन (द "क्राउड विजडम" ट्रिक)

यहाँ सबसे चतुर हिस्सा है। AI 50 अलग-अलग कुकिंग प्रयासों में "नोड A" (फ्रिज खोलना) पर पहुँच सकता है।

  • 10 प्रयासों में, रोबोट सफल होता है।
  • 40 प्रयासों में, वह बाद में विफल हो जाता है।

पुराने तरीके एक विशिष्ट विफलता को देखकर कह सकते थे, "नोड A बुरा है।"
G2PO नोड A के सभी 50 दौरों को देखता है। यह औसत निकालता है। इसे समझ आता है कि, "ठीक है, खुला फ्रिज के सामने होना वास्तव में एक न्यूट्रल या अच्छा स्टेट है, क्योंकि कई सफल रास्ते यहाँ से होकर गुजरते हैं।" यह एकल खराब किस्मत वाली घटनाओं के "शोर" या रैंडमनेस को कम करता है। यह एक व्यक्ति से रास्ता पूछने के बजाय 50 लोगों से दिशा पूछने जैसा है, जो शायद भटक गया हो।

3. एज-सेंट्रिक एडवांटेज (द "वैल्यू जंप" मेट्रिक)

G2PO नोड्स के बीच के एजेस (Edges) (यानी ट्रांजिशन) को देखकर कार्यों का मूल्यांकन करता है। यह पूछता है: "इस विशिष्ट कदम को उठाने से स्थिति का मूल्य (Value) कितना सुधरा?"

  • लोकल व्यू (पुराना तरीका): "क्या मैंने यहीं पर अपने अन्य विकल्पों की तुलना में बेहतर प्रदर्शन किया?"
  • ग्लोबल व्यू (G2PO): "क्या इस कदम ने मुझे पूरी रसोई में किए गए सभी अन्य कदमों की तुलना में लक्ष्य के काफी करीब पहुँचा दिया?"

पूरे नक्शे के विरुद्ध हर कदम की तुलना करके, G2PO क्रिटिकल ट्रांजिशन्स (महत्वपूर्ण बदलावों) की पहचान कर सकता है। यह कह सकता है, "खाली हाथों से 'हाथ में अंडे' की स्थिति में पहुँचना एक बड़ी प्रगति है," भले ही रोबोट बाद में अंडे गिरा दे। यह केवल अंतिम परिणाम को नहीं, बल्कि प्रगति को पुरस्कृत करता है।

यह बेहतर क्यों काम करता है

लेखकों ने तीन कठिन कार्यों पर इसका परीक्षण किया:

  1. WebShop: एक AI शॉपिंग एजेंट जो विशिष्ट उत्पाद खोजने के लिए वेबसाइटों पर जाता है।
  2. ALFWorld: एक वर्चुअल घर जहाँ एक AI को सफाई, खाना बनाना और व्यवस्थित करना होता है।
  3. AppWorld: एक AI जो कार्यों को पूरा करने के लिए कंप्यूटर ऐप्स और कोड का उपयोग करता है।

परिणाम:

  • G2PO ने मौजूदा तरीकों को काफी पीछे छोड़ दिया।
  • WebShop पर, इसने पिछले सर्वश्रेष्ठ तरीके (GRPO) की तुलना में सफलता दर में 22.2% तक सुधार किया।
  • ALFWorld पर, इसमें 14.4% का सुधार हुआ।
  • इसने AI को अधिक कुशल भी बनाया, जिससे कार्य पूरा करने के लिए कम चरणों की आवश्यकता हुई, जिससे समय और कंप्यूटिंग पावर की बचत हुई।

संक्षेप में

  • पुराना AI: सीधी रेखाओं से सीखता था। यदि वह अंत में विफल होता, तो वह शुरुआत को दोष देता। वह 'बैड लक' (खराब किस्मत) से भ्रमित हो जाता था।
  • G2PO AI: एक नक्शे (Map) से सीखता है। यह समान स्थितियों को एक साथ जोड़कर उनका एक स्पष्ट औसत स्कोर प्राप्त करता है। यह उन कदमों को पुरस्कृत करता है जो लक्ष्य की ओर एक बड़ी छलांग लगाते हैं, चाहे मिशन अंत में सफल हुआ हो या विफल।

यह घर से काम पर जाने के लिए एक विशिष्ट यात्रा को याद करने के बजाय, पूरे शहर के सड़क नेटवर्क को समझने और यह जानने के बीच का अंतर है कि कौन से मोड़ आपको आपके गंतव्य के करीब ले जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →