← नवीनतम पेपर
💬 NLP

BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

BiPACE एक ड्रॉप-इन एडवांटेज एस्टिमेटर पेश करता है जो लॉन्ग-होरिज़न LLM एजेंटों को प्रशिक्षित करने के लिए पॉलिसी-इंड्यूस्ड बिसिमिल्यूशन (policy-induced bisimulation) के माध्यम से स्टेप्स को क्लस्टर करके और एक्शन-कंडीशन्ड काउंटरफैक्चुअल बेसलाइन (action-conditioned counterfactual baselines) लागू करके ग्रुप-आधारित सुदृढीकरण शिक्षण (reinforcement learning) में स्टेट-एक्शन क्रेडिट मिसमैच को हल करता है, जिससे बिना किसी सीखे गए क्रिटिक या अतिरिक्त रोलआउट्स के GiGPO जैसी मौजूदा विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Hanyang Wang, Weijieying Ren, Yuxiang Zhang, Ding Cao, Zhizhao Zeng, Ke Zeng, Tianxiang Zhao

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanyang Wang, Weijieying Ren, Yuxiang Zhang, Ding Cao, Zhizhao Zeng, Ke Zeng, Tianxiang Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट बटलर को एक बिखरे हुए घर की सफाई करना सिखा रहे हैं। रोबोट कमरे को देख सकता है, एक मोजा उठा सकता है, उसे लॉन्ड्री में डाल सकता है, और इसी तरह के अन्य कार्य कर सकता है। हालाँकि, एक समस्या है: रोबोट को दिन के बिल्कुल अंत में केवल एक "अच्छा काम!" (Good Job!) या "बुरा काम!" (Bad Job!) मिलता है। उसे यह नहीं पता चलता कि कौन सा विशिष्ट कदम—जैसे मोजा उठाना बनाम तौलिया मोड़ना—सफलता या विफलता का कारण बना।

यह AI एजेंटों को प्रशिक्षित करने की चुनौती है: यह पता लगाना कि घटनाओं की एक लंबी श्रृंखला में से किस छोटे से छोटे कदम को श्रेय दिया जाना चाहिए।

पुराना तरीका: "सटीक मिलान" (Exact Match) की समस्या

पिछले तरीकों (जैसे GiGPO) ने इस समस्या को रोबोट के कदमों को समूहों में बांटकर हल करने की कोशिश की। उन्होंने कहा, "आइए हम देखते हैं कि जब रोबोट ने 'बिखरा हुआ फर्श' देखा, तो उसके बाद क्या हुआ।"

हालाँकि, पेपर इस तर्क में एक दोष बताता है, जिसे वे "स्टेट-एक्शन क्रेडिट मिसमैच" (State-Action Credit Mismatch) कहते हैं। इसके दो भाग हैं:

  1. "बहुत ज्यादा बारीक" स्टेट की समस्या: पुराना तरीका एक ऐसे लाइब्रेरियन की तरह था जो किताबों को तभी समूह में रखता है यदि उनके कवर पर बिल्कुल समान शब्द हों। यदि एक किताब कहती है "बिखरा हुआ फर्श" (Messy Floor) और दूसरी कहती है "गंदा फर्श" (Dirty Floor), तो वे उन्हें अलग-अलग ढेरों में रख देते हैं, भले ही उनका अर्थ एक ही हो। इससे "सिंगलटन" (singleton) समूह बनते हैं (ऐसे ढेर जिनमें केवल एक ही किताब हो)। यदि किसी समूह में केवल एक ही किताब है, तो आप उसकी तुलना किसी और से नहीं कर सकते, इसलिए आप कुछ भी नहीं सीख पाते। रोबोट अपने सीखने के बहुत सारे समय को बर्बाद कर देता है क्योंकि वह सतही विवरणों पर बहुत अधिक ध्यान केंद्रित करता है।

  2. "एक ही आकार सबके लिए" एक्शन की समस्या: भले ही रोबोट समान स्थितियों का एक समूह ढूंढ लेता है, पुराना तरीका उस समूह के हर एक्शन को एक ही स्कोर देता था। यह एक कोच की तरह है जो कहता है, "इस खेल में, सभी को एक ही ग्रेड दिया जाता है," चाहे खिलाड़ी ने गेंद को गोल में किक किया हो या वह खुद फिसल गया हो। एक ही स्थान से किए गए अलग-अलग कार्यों को अलग-अलग स्कोर मिलना चाहिए।

नया समाधान: BiPACE

लेखक BiPACE पेश करते हैं, जो इन एजेंटों को प्रशिक्षित करने का एक नया तरीका है जो बिना किसी अतिरिक्त "कोच" (क्रिटिक्स) या अधिक अभ्यास दौरों के, इन दोनों समस्याओं को ठीक करता है। इसे रोबोट की आंतरिक स्मृति और ग्रेडिंग प्रणाली को अपग्रेड करने के रूप में समझें।

1. "व्यवहार संबंधी फिंगरप्रिंट" (BiGPO)

सतही शब्दों (जैसे "बिखरा हुआ फर्श") को देखने के बजाय, BiPACE उस क्षण में रोबोट के आंतरिक "विचारों" (इसके छिपे हुए न्यूरल स्टेट) को देखता है।

  • उपमा: कल्पना करें कि दो लोग एक कमरे में प्रवेश करते हैं। एक कहता है, "यह बहुत बिखरा हुआ है!" और दूसरा कहता है, "यह जगह तो आपदा है!" पुराना तरीका दो अलग-अलग वाक्यों को देखता है। BiPACE उनकी मस्तिष्क की गतिविधि को देखता है और महसूस करता है, "आह, वे दोनों अराजकता के एक ही स्तर को महसूस कर रहे हैं।"
  • परिणाम: यह कदमों को स्थिति के दिखने के तरीके के आधार पर नहीं, बल्कि रोबोट उस स्थिति के बारे में कैसा महसूस करता है इसके आधार पर समूहित करता है। यह "सिंगलटन" समस्या को रोकता है। 100 ढेरों के बजाय जिनमें एक-एक किताब हो, यह 20 ढेर बनाता है जिनमें 5-5 किताबें हों, जिससे बेहतर तुलना और सीखना संभव होता है।

2. "एक्शन-विशिष्ट कोच" (PACE)

एक बार जब रोबोट समान स्थितियों के एक समूह में होता है, तो BiPACE कार्यों को ग्रेड देने का तरीका बदल देता है।

  • उपमा: कोच को समूह में सबको एक ही ग्रेड देने के बजाय, विशिष्ट चाल को देखना चाहिए। "आपने गेंद को किक किया? बहुत अच्छा! आप फिसल गए? यह उतना अच्छा नहीं है।"
  • परिणाम: यह एक ऐसा स्कोर कैलकुलेट करता है जो विशेष रूप से पूछता है, "इसी स्थिति में किए गए अन्य कार्यों के औसत की तुलना में यह एक्शन कितना बेहतर था?" यह विशेष रूप से उस चाल के लिए क्रेडिट को अलग करता है जो रोबोट ने की थी।

परिणाम: तेज़ और स्मार्ट

पेपर ने तीन अलग-अलग "घरेलू" कार्यों पर इस नए तरीके का परीक्षण किया:

  1. ALFWorld: घर की सफाई का एक टेक्स्ट-आधारित सिमुलेशन।
  2. WebShop: ऑनलाइन खरीदारी का एक सिमुलेशन।
  3. TextCraft: वस्तुओं को बनाने (जैसे Minecraft में) का एक सिमुलेशन।

निष्कर्ष:

  • उच्च सफलता: एक बड़े मॉडल के साथ घर की सफाई के कार्य (ALFWorld) पर, नए तरीके ने 97.1% सफलता दर हासिल की, जो पिछले सर्वश्रेष्ठ 90.8% से बेहतर है।
  • निरंतरता: नया तरीका हर टेस्ट रन में 95% सफलता की सीमा को पार कर गया, जबकि पुराना तरीका समान समय सीमा के भीतर कभी नहीं कर सका।
  • दक्षता: यह बहुत तेज़ी से (कम स्टेप्स में) इन उच्च स्कोर तक पहुँच गया।
  • कम लागत: BiPACE द्वारा किया जाने वाला "अतिरिक्त काम" बहुत कम है—रोबोट को प्रशिक्षित करने में लगने वाले कुल समय का केवल लगभग 11%। इसके लिए महंगे नए हार्डवेयर या अतिरिक्त अभ्यास दौरों की आवश्यकता नहीं है।

सारांश

BiPACE एक छात्र की अध्ययन मार्गदर्शिका (study guide) को अपग्रेड करने जैसा है। पृष्ठ पर लिखे शब्दों के सटीक लेखन के आधार पर अध्ययन प्रश्नों को समूहबद्ध करने के बजाय (जो अक्सर आपको बिना किसी अभ्यास साथी के छोड़ देता है), यह उन्हें उस अवधारणा (concept) के आधार पर समूहबद्ध करता है जिसे छात्र सोच रहा है। फिर, पूरे अध्याय के लिए एक एकल ग्रेड देने के बजाय, यह प्रत्येक विशिष्ट उत्तर को उस अवधारणा समूह में अन्य उत्तरों के साथ तुलना करके ग्रेड देता है। परिणाम स्वरूप, एक ऐसा छात्र जो तेज़ी से सीखता है, कम गलतियाँ करता है और अध्ययन के समान समय में बेहतर ग्रेड प्राप्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →