← नवीनतम पेपर
🤖 machine learning

LatentGym: A Testbed For Cross-Task Experiential Learning With Controllable Latent Structure

यह शोध पत्र LatentGym को प्रस्तुत करता है, जो एक नियंत्रणीय टेस्टबेड है जिसमें ग्राउंड-ट्रुथ लेटेंट संरचनाएं (ground-truth latent structures) मौजूद हैं, जो अन्वेषण (exploration) को दोहन (exploitation) से अलग करके एजेंटिक प्रणालियों में क्रॉस-टास्क अनुभवात्मक शिक्षण के मूल्यांकन को सक्षम बनाता है, जिससे इस बात के अध्ययन को सुगम बनाया जाက်ता है कि LLMs क्रमिक कार्यों (sequential tasks) में कैसे और क्यों अनुकूलित होते हैं।

मूल लेखक: Daksh Mittal, Tommaso Castellani, Thomson Yen, Naimeng Ye, Fangyu Wu, Minghui Chen, Tiffany Cai, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daksh Mittal, Tommaso Castellani, Thomson Yen, Naimeng Ye, Fangyu Wu, Minghui Chen, Tiffany Cai, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े कठोर (rigid) रोबोट को कई खेल खेलना सिखा रहे हैं। वास्तविक दुनिया में, हम इंसान "बिंदुओं को जोड़ने" (connecting the dots) में माहिर होते हैं। यदि आप एक ऐसा खेल खेलते हैं जहाँ उत्तर हमेशा तीन में से एक संख्या होती है, और आप इसे दस बार खेलते हैं, तो आप जल्दी ही समझ जाते हैं, "अरे, उत्तर हमेशा इनमें से किसी एक संख्या में से ही होता है!" आप अंदाज़े लगाना बंद कर देते हैं और उन तीन संख्याओं का ही चुनाव करने लगते हैं। आप अनुभव से सीखते हैं।

यह शोध पत्र तर्क देता है कि आज के सबसे उन्नत AI एजेंट (जैसे चैटबॉट्स को चलाने वाले) इस मामले में आश्चर्यजनक रूप से खराब हैं। वे हर एक खेल को ऐसे देखते हैं जैसे कि वह बिल्कुल नया हो, और पिछले नौ खेलों में जो कुछ भी उन्होंने सीखा था, उसे भूल जाते हैं।

इसे साबित करने और इसे ठीक करने का तरीका खोजने के लिए, लेखकों ने LatentGym बनाया।

द प्लेग्राउंड: LatentGym

Latent-Gym को केवल एक एकल खेल के रूप में नहीं, बल्कि खेलों के अनुक्रम (sequences) बनाने वाली एक फैक्ट्री के रूप में सोचें।

  • "लेटेंट" (छिपा हुआ नियम): एक सामान्य खेल में, नियम तय होते हैं। LatentGym में, एक गुप्त "छिपा हुआ नियम" होता है जो अनुक्रम के सभी खेलों पर लागू होता है। उदाहरण के लिए, संख्या-अनुमान लगाने वाले खेल में, छिपा हुआ नियम यह हो सकता है: "संख्या हमेशा 137 या 793 होगी।" AI को शुरुआत में यह पता नहीं होता; उसे खेलते हुए इसे समझना पड़ता है।
  • कंट्रोल नॉब्स (नियंत्रण बटन): शोधकर्ता एक साउंडबोर्ड की तरह इसकी कठिनाई को बदल सकते हैं:
    • प्रॉम्प्ट (Prompt): वे AI को गुप्त नियम के बारे में कितना बताते हैं? (कुछ नहीं? एक धुंधला संकेत? पूरा सच?)
    • फीडबैक (Feedback): एक खेल के बाद, क्या वे केवल "आप जीत गए/हार गए" कहते हैं, या वे वास्तविक उत्तर प्रकट करते हैं ताकि AI सीख सके?
    • होराइजन (Horizon): अनुक्रम में कितने खेल हैं? (5? 10? 20?)

यह सेटअप महत्वपूर्ण है क्योंकि, अधिकांश AI परीक्षणों में, यदि कोई AI विफल होता है, तो आपको पता नहीं चलता कि क्यों। क्या उसने पैटर्न नहीं देखा? क्या उसने पैटर्न देखा लेकिन उसका उपयोग करना भूल गया? LatentGym में, शोधकर्ताओं को गुप्त नियम का पूरी तरह से पता होता है, इसलिए वे सटीक रूप से पहचान सकते हैं कि AI का दिमाग कहाँ शॉर्ट-सर्किट हुआ।

समस्या: AI कैसे विफल होता है

जब शोधकर्ताओं ने शीर्ष-स्तरीय AI मॉडल (जैसे GPT-4o और Claude) का इन सरल अनुक्रमों पर परीक्षण किया, तो उन्होंने पाया कि AI के विफल होने के तीन विशिष्ट तरीके हैं:

  1. अनुकूलन उपेक्षा (Adaptation Neglect - "रीसेट बटन" सिंड्रोम): AI इस तथ्य को अनदेखा करता है कि वह पहले भी खेल चुका है। भले ही उत्तर हमेशा "लाल" हो, वह दूसरे खेल को ऐसे मानता है जैसे कि वह पहली बार खेल रहा हो, और पुराने पैटर्न को जांचने के बजाय एक रैंडम अनुमान से शुरुआत करता है। यह एक ऐसे छात्र की तरह है जो कल गणित की परीक्षा दी थी, फिर भी आज फिर से फॉर्मूला derive करने की कोशिश कर रहा है।
  2. अनुकूलन विफलता (Adaptation Breakdown - "आंखें सिकोड़ने" का सिंड्रोम): AI एक पैटर्न नोटिस करता है ("रुको, संख्याएं छोटी हो रही हैं!"), लेकिन उसे यह नहीं पता होता कि उस जानकारी का उपयोग कैसे किया जाए। वह संकेत देखता है लेकिन पुराने तरीके से ही खेलता रहता है। यह "गीले फर्श" के साइन को देखने के बावजूद सामान्य रूप से चलते रहने जैसा है।
  3. अनुकूलन गलत अंशांकन (Adaptation Miscalibration - "ओवर-थिंकर" सिंड्रोम): जब शोधकर्ताओं ने स्पष्ट रूप से AI को नियम बताया ("उत्तर हमेशा 137 या 793 होगा"), तो AI कभी-कभी भ्रमित हो गया और बिना बताए जाने की तुलना में बदतर प्रदर्शन करने लगा। उसने नियम का पालन करने की इतनी कोशिश की कि उसने खेल के वास्तविक मैकेनिक्स को ही अनदेखा कर दिया। यह "गुलाबी हाथी के बारे में मत सोचो" कहे जाने पर पूरे समय गुलाबी हाथी के बारे में ही सोचने जैसा है, और खेल खेलना भूल जाना।

समाधान: क्रॉस-टास्क RL

शोधकर्ताओं ने AI को बेहतर तरीके से सीखना सिखाने के लिए क्रॉस-टास्क सुदृढीकरण शिक्षण (Cross-Task Reinforcement Learning - RL) नामक पद्धति का उपयोग किया।

  • पुराना तरीका (Single-Task RL): आप AI को गेम 1 पर प्रशिक्षित करते हैं, फिर गेम 2 पर, फिर गेम 3 पर। वह गेम 1 जीतने के लिए सीखता है, फिर गेम 2, लेकिन वह उन्हें आपस में जोड़ना नहीं सीख पाता।
  • नया तरीका (Cross-Task RL): आप AI को एक साथ पूरे अनुक्रम पर प्रशिक्षित करते हैं। आप उसे बताते हैं, "आपका लक्ष्य केवल गेम 1 जीतना नहीं है; आपका लक्ष्य गेम 1 से 9 तक के खेलों से सीखकर गेम 10 जीतना है।"

परिणाम:
जब उन्होंने इस नई प्रशिक्षण पद्धति का उपयोग किया, तो AI ने वास्तव में अनुकूलन करना सीख लिया।

  • उसने जल्दी ही पैटर्न खोजना शुरू कर दिया।
  • उसने बाद के खेलों को तेजी से जीतने के लिए उन पैटर्न्स का उपयोग करना शुरू कर दिया।
  • महत्वपूर्ण बात यह है कि यह सीखना सामान्य (generalize) हो गया। यहाँ तक कि जब उन्होंने AI का परीक्षण खेलों के एक नए सेट पर किया जिसमें एक नया छिपा हुआ नियम था जिसे उसने पहले कभी नहीं देखा था, तब भी वह पुराने तरीके से प्रशिक्षित AI की तुलना में बेहतर प्रदर्शन कर रहा था। उसने सीखने का एक "मेटा-कौशल" (meta-skill) सीख लिया था।

एक आश्चर्यजनक मोड़: कम जानकारी बेहतर है

सबसे दिलचस्प निष्कर्षों में से एक फीडबैक के बारे में था।

  • समृद्ध फीडबैक (Rich Feedback): हर खेल के बाद AI को सटीक उत्तर बताना।
  • विरल फीडबैक (Sparse Feedback): केवल AI को यह बताना कि "आप जीत गए" या "आप हार गए।"

विपरीत रूप से, विरल फीडबैक (कम जानकारी) के साथ प्रशिक्षित AI ने समृद्ध फीडबैक वाले AI की तुलना में नई स्थितियों में बेहतर प्रदर्शन किया। ऐसा लगता है कि जब आप AI को उत्तर बहुत आसानी से दे देते हैं, तो वह आलसी हो जाता है या उस विशिष्ट संकेत पर बहुत अधिक निर्भर हो जाता है। जब उसे केवल "जीत/हार" के संकेत के साथ चीजों को समझना पड़ता है, तो वह एक अधिक मजबूत रणनीति बनाता है जो तब भी काम करती है जब संकेत बदल जाते हैं।

निचोड़ (The Bottom Line)

यह शोध पत्र एक नया "जिम" (LatentGym) पेश करता है ताकि यह परीक्षण किया जा सके कि क्या AI एजेंट कार्यों के एक अनुक्रम से सीख सकते हैं। उन्होंने पाया कि वर्तमान शीर्ष AI इस मामले में खराब हैं, और अक्सर कार्यों के बीच के बिंदुओं को जोड़ने में विफल रहते हैं। हालांकि, उन्हें अलग-थलग कार्यों के बजाय कार्यों के पूर्ण अनुक्रमों (Cross-Task RL) पर प्रशिक्षित करके, वे अनुकूलन करने की एक सामान्य क्षमता सीख सकते हैं। यह ढांचा शोधकर्ताओं को यह देखने की अनुमति देता है कि AI वास्तव में क्यों विफल होता है और इसे कैसे ठीक किया जाए, जो हमें ऐसे एजेंटों के करीब ले जाता है जो वास्तव में अनुभव से सीखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →