← नवीनतम पेपर
💬 NLP

GEM: A Gym for Agentic LLMs

यह शोध पत्र GEM (General Experience Maker) को प्रस्तुत करता है, जो एक ओपन-सोर्स, मानकीकृत वातावरण सिम्युलेटर और मूल्यांकन टूलकिट है, जिसे उच्च-थ्रूपुट निष्पादन, विविध वातावरणों और REINFORCE, PPO और GRPO जैसे एल्गोरिदम की तुलना करने वाले व्यापक बेंचमार्क के माध्यम से अनुभव-आधारित शिक्षण को सुगम बनाकर एजेंटिक LLM अनुसंधान को गति देने के लिए डिज़ाइन किया गया है।

मूल लेखक: Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Ye
प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Yee Whye Teh, Wee Sun Lee, Min Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को शतरंज खेलना, गणित की समस्याओं को हल करना या कंप्यूटर कोड लिखना सिखाना चाहते हैं। अतीत में, हम रोबोट को हजारों स्थिर उदाहरण दिखाकर सिखाते थे, जैसे कि फ्लैशकार्ड्स। लेकिन वास्तविक दुनिया फ्लैशकार्ड्स का ढेर नहीं है; यह एक गतिशील, अस्त-व्यस्त खेल का मैदान है जहाँ आपको प्रयास करना होता है, असफल होना होता है, सीखना होता है और फिर से प्रयास करना होता है।

यह शोध पत्र GEM (जनरल एक्सपीरियंस मेकर) पेश करता है, जो एक नया "खेल का मैदान" है जिसे विशेष रूप से बड़े भाषा मॉडलों (LLMs) को केवल पढ़ने के बजाय, करके सीखने में मदद करने के लिए डिज़ाइन किया गया है।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र का विवरण दिया गया है:

1. समस्या: "फ्लैशकार्ड" का जाल

वर्तमान में, अधिकांश AI प्रशिक्षण केवल फ्लैशकार्ड्स का उपयोग करके परीक्षा के लिए अध्ययन करने जैसा है। आप एक प्रश्न देखते हैं, एक उत्तर देते हैं, और आपको एक स्कोर मिलता है। यह एक सिंगल-टर्न (एकल-चरण) इंटरैक्शन है।

  • सीमा: वास्तविक जीवन एक मल्टी-टर्न (बहु-चरण) बातचीत है। यदि आप शतरंज का खेल खेल रहे हैं, तो आप एक चाल चलते हैं, प्रतिद्वंद्वी जवाब देता है, आप सोचते हैं, और फिर एक और चाल चलते हैं। यदि आप कोड को डीबग कर रहे हैं, तो आप एक लाइन लिखते हैं, वह क्रैश हो जाती है, आप उसे ठीक करते हैं, और इसे फिर से चलाते हैं।
  • मुद्दा: वर्तमान में कई AI प्रशिक्षण विधियाँ (जैसे GRPO) फ्लैशकार्ड्स के लिए तो बेहतरीन हैं लेकिन लंबे, जटिल खेलों के लिए बहुत खराब हैं। उन्हें यह समझने में कठिनाई होती है कि घटनाओं की एक लंबी श्रृंखला में कौन सा विशिष्ट कदम "अच्छा" था और कौन सा "बुरा" था।

2. समाधान: GEM (जिम)

लेखकों ने GEM बनाया है, जो AI के लिए वही है जो OpenAI Gym पारंपरिक रोबोटिक्स के लिए था।

  • उपमा: OpenAI Gym को एक मानकीकृत जिम के रूप में सोचें जिसमें ट्रेडमिल, वजन और पंचिंग बैग हैं जो सभी एक जैसे दिखते हैं ताकि आप किसी भी रोबोट का परीक्षण कर सकें। GEM उसी जिम की तरह है, लेकिन "एजेंट" एआई (ऐसे AI जो केवल बात नहीं कर सकते, बल्कि कार्य भी कर सकते हैं) के लिए।
  • इसके अंदर क्या है? GEM में 100 से अधिक अलग-अलग "व्यायाम" पहले से लोड हैं:
    • खेल: जैसे गेस द नंबर या सुडोकू, जहाँ AI को चरण-दर-चरण सोचना पड़ता है।
    • टूल्स (उपकरण): AI कैलकुलेटर (पायथन) का उपयोग कर सकता है, वेब सर्च कर सकता है, या एक नकली कंप्यूटर टर्मिनल में कमांड टाइप कर सकता है।
    • रीज़निंग (तर्क): गणित की समस्याएं और तर्क पहेलियाँ।

3. गुप्त मंत्र: "रिटर्न बैच नॉर्मलाइज़ेशन" (ReBN)

शोध पत्र एक नया तरीका पेश करता है जिससे AI को सिखाया जाता है, जिसे वे REINFORCE with ReBN कहते हैं।

  • उपमा: कल्पना कीजिए कि एक छात्र एक लंबी परीक्षा दे रहा है।
    • पुराना तरीका (GRPO): शिक्षक परीक्षा के अंत तक इंतजार करता है और फिर एक एकल ग्रेड (A, B, या C) देता है। छात्र को यह पता नहीं चलता कि कौन सा विशिष्ट उत्तर गलत था।
    • नया तरीका (ReBN): शिक्षक हर प्रश्न के बाद फीडबैक देता है। लेकिन यहाँ एक ट्रिक है: केवल "सही" या "गलत" कहने के बजाय, शिक्षक पूरे बैच के सभी प्रश्नों पर छात्र के प्रदर्शन को देखता है और कहता है, "आपने इस पर औसत से बेहतर प्रदर्शन किया, लेकिन उस पर औसत से कम।"
  • यह क्यों महत्वपूर्ण है: यह AI को यह समझने में मदद करता है कि तर्क की एक लंबी श्रृंखला में कौन सा विशिष्ट कदम सफलता की कुंजी था। यह AI को पिछले तरीकों की तुलना में बहुत तेज़ी से और अधिक सटीकता से जटिल, बहु-चरणीय कार्यों को सीखने में सक्षम बनाता है।

4. "डिस्काउंट फैक्टर" (धैर्य मीटर)

शोध पत्र दिखाता है कि आप डिस्काउंट फैक्टर (γ\gamma) नामक सेटिंग का उपयोग करके AI को कितना "धैर्यवान" बना सकते हैं।

  • उपमा: कल्पना कीजिए कि आप "गेस द नंबर" खेल रहे हैं।
    • यदि आप AI को अधैर्यवान (लो डिस्काउंट) सेट करते हैं, तो वह पहेली को न्यूनतम चालों में हल करना सीखता है (एक स्मार्ट रणनीति का उपयोग करके जिसे "बाइनरी सर्च" कहा जाता है)। वह महसूस करता है, "मुझे इनाम अभी चाहिए, इसलिए मैं कुशलता से अनुमान लगाऊंगा।"
    • यदि आप AI को धैर्यवान (हाई डिस्काउंट) सेट करते हैं, तो उसे इससे फर्क नहीं पड़ता कि कितने टर्न लगते हैं, जब तक कि वह अंततः जीत जाए। वह बेतरतीब ढंग से अनुमान लगा सकता है और उत्तर पाने में 50 टर्न ले सकता है।
  • खोज: लेखकों ने पाया कि इस "धैर्य मीटर" को समायोजित करके, वे AI को सबसे कुशल रणनीतियाँ सीखने के लिए मजबूर कर सकते हैं, जो पुराने तरीके आसानी से नहीं कर पाते थे।

5. यह एक बड़ी बात क्यों है

  • यह एक यूनिवर्सल एडेप्टर है: GEM पांच अलग-अलग प्रमुख AI प्रशिक्षण फ्रेमवर्क के साथ काम करता है। यह एक यूनिवर्सल पावर प्लग की तरह है जो किसी भी दीवार के सॉकेट में फिट हो जाता है। शोधकर्ताओं को हर बार अपने विचारों का परीक्षण करने के लिए अपने टूल्स को फिर से बनाने की आवश्यकता नहीं है।
  • यह एक बेंचमार्क है: इससे पहले, हर कोई अपने अलग-अलग, कस्टम-मेड खेलों पर अपने AI का परीक्षण कर रहा था, जिससे यह तुलना करना असंभव था कि वास्तव में कौन सा बेहतर है। GEM एक मानक "स्कोरबोर्ड" प्रदान करता है ताकि हम अंततः देख सकें कि कौन से एल्गोरिदम वास्तव में श्रेष्ठ हैं।
  • यह वास्तविक दुनिया के लिए तैयार है: AI को डेटाबेस का उपयोग करने, वेब खोजने और कोड लिखने जैसी चीजों पर परीक्षण करके, GEM AI को उन जटिल, बहु-चरणीय कार्यों के लिए तैयार करता है जिन्हें हम भविष्य में वास्तव में उनसे करवाना चाहते हैं।

सारांश

GEM एक मानकीकृत, ओपन-सोर्स प्लेग्राउंड है जो AI एजेंटों को जटिल, बहु-चरणीय वातावरण के साथ बातचीत करके सीखने की अनुमति देता है। यह एक स्मार्ट शिक्षण पद्धति (ReBN) पेश करता है जो AI को यह समझने में मदद करती है कि लंबी घटनाओं की श्रृंखला में किन विशिष्ट कार्यों ने सफलता दिलाई। शोधकर्ताओं को उनके विचारों का परीक्षण और तुलना करने के लिए एक सामान्य आधार प्रदान करके, GEM का लक्ष्य वास्तव में स्वायत्त, बुद्धिमान एजेंटों के विकास को गति देना है जो मनुष्यों की तरह योजना बना सकते हैं, तर्क कर सकते हैं और उपकरणों का उपयोग कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →