← नवीनतम पेपर
💬 NLP

HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

यह शोध पत्र HERO'S JOURNEY को प्रस्तुत करता है, जो लक्ष्य-निर्देशित टेक्स्ट गेम्स में नियम प्रेरण (rule induction) के मूल्यांकन के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि अत्याधुनिक LLMs छिपे हुए नियमों को अनुमान लगाने की कुछ क्षमता प्रदर्शित करते हैं, लेकिन उनका प्रदर्शन सीमित और असमान बना हुआ है, विशेष रूप से प्रक्रियात्मक प्रेरण (procedural induction) और बहु-चरणीय निष्पादन (multi-step execution) के संबंध में।

मूल लेखक: Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li

प्रकाशित 2026-06-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "HERO'S JOURNEY" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

मुख्य चित्र: AI मस्तिष्क के लिए एक वीडियो गेम

कल्पना कीजिए कि आप एक टेक्स्ट-आधारित एडवेंचर गेम खेल रहे हैं (जैसे पुराना Zork या 'चूज़-योर-ओन-एडवेंचर' वाली किताब)। आप एक बंदी को बचाने की कोशिश कर रहे एक योद्धा हैं। जीतने के लिए, आपको एक रक्षक राक्षस (guardian monster) को हराना होगा। लेकिन यहाँ एक पेंच है: कोई आपको यह नहीं बताता कि कौन सा हथियार किस राक्षस को हराएगा।

आपके पास केवल अन्य योद्धाओं की "डायरियाँ" (diaries) हैं जिन्होंने आपसे पहले प्रयास किए और या तो असफल रहे (या सफल हुए)। आपको उनकी कहानियाँ पढ़नी होंगी, छिपे हुए पैटर्न को समझना होगा (जैसे, "ओह, ड्रैगन्स को फायर स्वॉर्ड चाहिए, लेकिन गोब्लिन्स को वॉटर स्वॉर्ड चाहिए"), और फिर उस नियम को एक नए राक्षस पर लागू करना होगा जिसे आपने पहले कभी नहीं देखा।

यह पेपर एक नया टेस्ट सूट पेश करता है जिसे HERO'S JOURNEY कहा जाता है। यह आर्टिफिशियल इंटेलिजेंस (AI) के लिए एक जिम की तरह है ताकि यह परीक्षण किया जा सके कि क्या वह वास्तव में उदाहरणों से नियम सीख सकता है और फिर उन्हें सही ढंग से निष्पादित (execute) कर सकता है, न कि केवल अनुमान लगाने या उत्तरों को रटने के बजाय।


दो मुख्य चुनौतियाँ

शोधकर्ताओं ने पाया कि वर्तमान AI मॉडल (स्मार्ट कंप्यूटर) इस खेल में दो विशिष्ट चीजों में संघर्ष करते हैं:

1. "डिटेक्टिव" की समस्या (Rule Induction)

AI को एक जासूस की तरह काम करना होगा। वह सुरागों (अन्य योद्धाओं की कहानियों) को देखता है और ब्रह्मांड के गुप्त नियम का पता लगाता है।

  • उपमा: कल्पना कीजिए कि आप एक क्लब में तीन लोगों को प्रवेश करते देखते हैं।
    • व्यक्ति A (लाल कपड़े पहने हुए) को VIP पास मिलता है।
    • व्यक्ति B (नीले कपड़े पहने हुए) को रेगुलर पास मिलता है।
    • व्यक्ति C (लाल कपड़े पहने हुए) को VIP पास मिलता है।
    • नियम: "लाल मतलब VIP।"
    • परीक्षण: यदि एक नया व्यक्ति (व्यक्ति D) लाल कपड़े पहनकर आता है, तो क्या AI को पता चलेगा कि उसे VIP पास देना है?
    • पेपर का निष्कर्ष: AI इस सरल जासूसी कार्य में ठीक है, लेकिन जब नियम जटिल हो जाते हैं (जैसे कि यदि "लाल" का मतलब VIP है जब तक कि व्यक्ति ने टोपी भी न पहनी हो), तो वह अक्सर भ्रमित हो जाता है।

2. "बटलर" की समस्या (Procedural Execution)

नियम जानना एक बात है; चरणों को पूरा करना दूसरी बात है। AI से केवल यह नहीं पूछा जाता कि "आपको किस हथियार की आवश्यकता है?" बल्कि उसे वास्तव में खेल खेलना होता है: "दुकान पर जाओ," "तलवार खरीदो," "किले की ओर चलो," "राक्षस से लड़ो।"

  • उपमा: कल्पना कीजिए कि आप केक की रेसिपी जानते हैं (नियम)। लेकिन जब आप केक बनाने की कोशिश करते हैं, तो आप ओवन चालू करना भूल जाते हैं, या आप केक को ओवन में डालने के बाद मैदा मिलाते हैं।
  • पेपर का निष्कर्ष: यहीं पर AI वास्तव में संघर्ष करता है। भले ही AI सही हथियार का पता लगा ले, लेकिन वह अक्सर कार्यों के क्रम (order) में गलती कर देता है। यह एक ऐसे प्रतिभाशाली शेफ की तरह है जो रेसिपी जानता है लेकिन अंडे गिराने के चक्कर में बार-बार गड़बड़ी कर देता है।

कठिनाई के आठ स्तर

शोधकर्ताओं ने विभिन्न प्रकार की सोच का परीक्षण करने के लिए इस खेल में आठ अलग-अलग "स्तर" बनाए हैं:

  1. सरल गणित (Additive): "हथियार का आकार राक्षस की ऊंचाई + उसका वजन है।" (आसान जोड़)।
  2. मिक्स एंड मैच (Compositional): "हथियार का आकार राक्षस की ऊंचाई से आता है, और रंग उसके वजन से आता है।" (दो अलग-अलग नियम एक साथ काम कर रहे हैं)।
  3. "इफ/देन" स्विच (Conditional): "यदि राक्षस एक ड्रैगन है, तो उसका वजन रंग तय करेगा। यदि वह एक गोब्लिन है, तो उसका वजन आकार तय करेगा।" (परिस्थिति के आधार पर नियम बदल जाते हैं)।
  4. "विशेष अपवाद" (Override): "आमतौर पर, राक्षस की ऊंचाई हथियार तय करती है। लेकिन, यदि राक्षस एक 'चिरर्जन' (एक विशेष भूमिका) है, तो उसे हमेशा एक विशाल तलवार की आवश्यकता होती है, चाहे कुछ भी हो।" (एक नियम बाकी सभी नियमों को तोड़ देता है)।

उन्होंने एट्रिब्यूट (Attribute) कार्यों (यह पता लगाना कि कौन सी वस्तु का उपयोग करना है) और प्रोसीजरल (Procedural) कार्यों (यह पता लगाना कि कार्यों का क्रम क्या होना चाहिए) दोनों का परीक्षण किया।


उन्होंने क्या खोजा?

1. इंसान जीतते हैं, AI लड़खड़ाता है

जब इंसानों ने यह खेल खेला, तो वे नियम समझने और चरणों को निष्पादित करने, दोनों में बहुत बेहतर थे।

  • अंतर: औसतन, इंसान खेल को कुशलतापूर्वक पूरा करने में 13% बेहतर थे और नियम को ज़ोर से समझाने में 30% बेहतर थे।
  • "ब्लाइंड स्पॉट": कुछ AI मॉडल खेल को सफलतापूर्वक पूरा कर सकते थे, लेकिन जब उनसे यह बताने को कहा गया कि उन्होंने यह कैसे किया, तो वे नहीं बता सके। यह सुझाव देता है कि वे तर्क को वास्तव में समझने के बजाय केवल पैटर्न को कॉपी करके या अनुमान लगाकर "चीटिंग" कर रहे हो सकते हैं।

2. "एग्जीक्यूशन बॉटलनेक" (Execution Bottleneck)

पेपर ने पाया कि AI के लिए सबसे कठिन हिस्सा हमेशा सोचना नहीं होता; बल्कि करना होता है।

  • रूपक: एक ऐसे GPS की कल्पना करें जो आपके गंतव्य तक पहुँचने का सही रास्ता जानता है (नियम), लेकिन वह आपको बार-बार बाईं ओर मुड़ने के लिए कहता रहता है जबकि आप पहले से ही गैस स्टेशन पर पहुँच चुके होते हैं (एग्जीक्यूशन एरर)।
  • AI अक्सर उत्तर जानता है लेकिन खेल के वातावरण में कार्यों के क्रम को सही ढंग से करने में विफल रहता है।

3. "जादुई शब्द" ज्यादा मदद नहीं करते

शोधकर्ताओं ने AI को असली नामों (जैसे "ड्रैगन" और "स्वॉर्ड") बनाम निरर्थक शब्दों (जैसे "क्रेव" और "ज़ोर्प") का उपयोग करके भ्रमित करने की कोशिश की।

  • परिणाम: इससे ज्यादा फर्क नहीं पड़ा। AI को यह जानकर कोई बढ़ावा नहीं मिला कि एक "ड्रैगन" को आमतौर पर क्या चाहिए। यह साबित करता है कि यह परीक्षण वास्तव में तर्क को माप रहा है, न कि केवल फिल्मों या किताबों की AI की याददाश्त को।

4. वर्तमान "फिक्स" कमजोर हैं

शोधकर्ताओं ने AI की मदद करने के लिए विशेष "प्रॉम्प्टिंग ट्रिक्स" (जैसे कि AI को "चरण-दर-चरण सोचें" या "अपने काम की जाँच करें" कहना) का उपयोग किया।

  • परिणाम: इन ट्रिक्स ने सरल "क्या वस्तु खरीदें" वाले कार्यों में थोड़ी मदद की, लेकिन वे जटिल "कैसे कदम उठाएं" वाले कार्यों में मदद नहीं कर सके। AI और मानव प्रदर्शन के बीच का अंतर बना रहा।

निचोड़ (The Bottom Line)

HERO'S JOURNEY एक नया तरीका है यह परीक्षण करने का कि क्या AI वास्तव में अनुभव से सीख सकता है और उस ज्ञान पर कार्य कर सकता है, न कि केवल उत्तरों को रटने के बजाय।

पेपर निष्कर्ष निकालता है कि हालांकि AI पैटर्न पहचानने में स्मार्ट हो रहा है, लेकिन वह अभी भी जटिल, बहु-चरणीय वास्तविक दुनिया के परिदृश्यों में उन पैटर्न को लागू करने में बुरा है। यह एक ऐसे छात्र की तरह है जो एक परीक्षा में गणित का सवाल तो हल कर सकता है लेकिन यह नहीं समझ पाता कि उस गणित का उपयोग पुल बनाने के लिए कैसे किया जाए। शोधकर्ता उम्मीद करते हैं कि यह खेल डेवलपर्स को ऐसा AI बनाने में मदद करेगा जो केवल बातें नहीं, बल्कि वास्तव में काम कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →