← नवीनतम पेपर
💬 NLP

Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs

यह शोध पत्र "ट्रायैडिक वेयरवोल्फ" (Triadic Werewolf) गेम का परिचय देता है, जो एक मल्टी-हॉप थ्योरी-ऑफ-माइंड बेंचमार्क है जिसमें उलटे प्रोत्साहन वाला एक 'जेस्टर' (Jester) गुट शामिल है जो यह प्रकट करता है कि कैसे वर्तमान लार्ज लैंग्वेज मॉडल्स जटिल तीन-तरफा रणनीतिक तर्क करने में संघर्ष करते हैं, और अक्सर स्व-शिक्षण तंत्रों के बावजूद वास्तविक संदेह और इरादतन धोखे के बीच अंतर करने में विफल रहते हैं।

मूल लेखक: Avni Mittal

प्रकाशित 2026-06-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Avni Mittal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "दो-टीम" की आदत को तोड़ना

कल्पना कीजिए कि आप वेयरवोल्फ (जिसे माफिया भी कहा जाता है) का खेल खेल रहे हैं। आमतौर पर, इसमें दो टीमें होती हैं: विलेजर (अच्छे लोग) और वेयरवोल्फ (बुरे लोग)। विलेजरों का काम वेयरवोल्फ का पता लगाना होता है, और वेयरवोल्फ का काम छिपना होता है।

इस सेटअप में, यदि कोई अजीब या संदिग्ध व्यवहार करता है, तो विलेजर आमतौर पर उसे वोट देकर बाहर निकाल देते हैं। यह एक सरल नियम है: संदिग्ध = बुरा।

इस शोध पत्र के शोधकर्ताओं ने एक सवाल पूछा: क्या AI मॉडल (LLMs) वास्तव में इस बारे में सोच रहे हैं कि अन्य खिलाड़ी क्या सोच रहे हैं, या वे केवल एक सरल नियम का पालन कर रहे हैं?

यह जानने के लिए, उन्होंने खेल में एक तीसरा, चालाक पात्र जोड़ा: द जेस्टर (The Jester)

नया पात्र: द जेस्टर

जेस्टर एक बहुत ही अजीब लक्ष्य वाला पात्र है: जेस्टर तभी जीतता है जब विलेजर उसे वोट देकर बाहर निकाल दें।

जेस्टर को एक संदिग्ध अभिनेता की तरह समझें जो खुद को निकाला जाना चाहता है।

  • विलेजर वेयरवोल्फ को बाहर निकालना चाहते हैं।
  • वेयरवोल्फ छिपना चाहते हैं और विलेजर को बाहर निकालना चाहते हैं।
  • जेस्टर चाहता है कि वह इतना संदिग्ध दिखे कि विलेजर उसे ही बाहर निकाल दें।

यह एक "ट्रायडिक" (तीन-तरफा) समस्या पैदा करता है। अब, जब कोई खिलाड़ी संदिग्ध लगता है, तो विलेजरों को एक बहुत कठिन सवाल पूछना पड़ता है:

"क्या यह व्यक्ति एक वेयरवोल्फ है (जिसे मुझे वोट देकर बाहर करना चाहिए), या यह एक जेस्टर है (जिसे मुझे वोट देकर बाहर नहीं करना चाहिए, क्योंकि उसे बाहर निकालने से मैं हार जाऊँगा)?"

प्रयोग: AI के दिमाग का परीक्षण

शोधकर्ताओं ने तीन अलग-अलग शक्तिशाली AI मॉडलों (GPT-4.1, DeepSeek-V3.1, और Llama-3.3-70B) का उपयोग करके 60 गेम चलाए। उन्होंने इसे एक "स्व-शिक्षण" (self-learning) फीचर के साथ और उसके बिना खेला, जहाँ जेस्टर पिछले खेलों से सीखे गए नोट्स पढ़ सकता था ताकि वह अधिक स्मार्ट बन सके।

यहाँ उन्होंने क्या पाया, जिसे रूपकों के माध्यम से समझाया गया है:

1. "चीट कोड" की समस्या (Cue-Sufficiency)

पुराने दो-टीम वाले खेलों में, AI मॉडल "संदिग्ध" व्यवहार को देखकर जीत सकते थे। यह एक ऐसे छात्र की तरह था जिसने उत्तर कुंजी (answer key) रट ली हो: यदि शिक्षक नाराज है, तो उत्तर गलत है।

  • परिणाम: जब जेस्टर को जोड़ा गया, तो AI मॉडल विफल रहे। वे "संदिग्ध = बुरा" के नियम का पालन करना बंद नहीं कर सके।
  • जेस्टर की जीत: क्योंकि AI मॉडल संदिग्ध जेस्टर को वोट देकर बाहर निकालते रहे, इसलिए जेस्टर 60-70% गेम जीत गया। AI "संदिग्धता" को पहचानने में इतना अच्छा था कि उसने अनजाने में जेस्टर को जीतने में मदद की।

2. वेयरवोल्फ का आत्म-घात (Self-Sabotage)

वेयरवोल्फ (वास्तविक बुरे लोग) को जेस्टर को बाहर किए जाने से बचाना था, क्योंकि यदि जेस्टर चला जाता है, तो वेयरवोल्फ भी हार जाते हैं।

  • परिणाम: AI वेयरवोल्फ इस मामले में बहुत खराब थे। 60-70% गेम में, AI वेयरवोल्फों ने पहले ही दिन जेस्टर को बाहर निकालने के लिए वोट दिया।
  • रूपक: यह एक जासूसी टीम की तरह है जो अपने ही डबल-एजेंट को इसलिए बाहर निकालने के लिए वोट देती है क्योंकि वह एजेंट "बहुत संदिग्ध" व्यवहार कर रहा था, यह समझे बिना कि डबल-एजेंट को बाहर निकालने से वास्तव में दुश्मन की जीत होती है। AI डॉट्स को जोड़ने में विफल रहा: संदिग्ध व्यक्ति + जेस्टर का लक्ष्य = उन्हें वोट देकर बाहर न करें।

3. "स्व-शिक्षण" लूप (Self-Learning Loop)

शोधकर्ताओं ने जेस्टर को पिछले खेलों से सीखे गए सबक का एक "चीट शीट" पढ़ने दिया।

  • DeepSeek-V3.1: यह मॉडल सबसे स्मार्ट था। इसने सीखा कि कैसे "बहुत ज्यादा" संदिग्ध दिखे बिना भी संदिग्ध व्यवहार किया जाए। इसने महसूस किया कि इसे विलेजरों को धोखा देना है लेकिन वेयरवोल्फों से बचना भी है। यह काफी बेहतर तरीके से जीतने लगा।
  • GPT-4.1: यह मॉडल पहले से ही "संदिग्धता" को पहचानने में इतना अच्छा था कि चीट शीट ने इसकी मदद नहीं की। वास्तव में, यह थोड़ा खराब हो गया क्योंकि यह पहले से ही सरल नियमों के "सीलिंग" (सीमा) पर था।
  • Llama-3.3: इसमें थोड़ा सुधार हुआ, लेकिन DeepSeek जितना नहीं।

गहरा विश्लेषण: AI वास्तव में क्या सोच रहा था?

शोधकर्ताओं ने यह देखने के लिए कि AI जेस्टर कैसे सोच रहे थे, उनके द्वारा लिखे गए "नोट्स" का अध्ययन किया। उन्होंने "थ्योरी ऑफ माइंड" (दूसरों के मन को समझने की क्षमता) को तीन स्तरों पर मापा:

  1. स्तर 1: "मुझे अजीब व्यवहार करने की जरूरत है।" (सरल)
  2. स्तर 2: "मुझे अजीब व्यवहार करने की जरूरत है ताकि विलेजर मुझे वेयरवोल्फ समझें।" (बेहतर)
  3. स्तर 3: "मुझे विलेजरों के लिए वेयरवोल्फ की तरह व्यवहार करने की जरूरत है, लेकिन वेयरवोल्फों के लिए वेयरवोल्फ जैसा नहीं, ताकि वे मुझे बचा सकें।" (जटिल)

निष्कर्ष: केवल DeepSeek-V3.1 लगातार स्तर 3 तक पहुँच सका। इसने समझा कि इसे एक साथ दो अलग-अलग भूमिकाएँ निभानी हैं: विलेजरों के लिए एक "बुरा आदमी" और वेयरवोल्फों के लिए एक "सामान्य आदमी"। अन्य मॉडल ज्यादातर स्तर 1 या 2 पर ही रहे।

निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI मॉडल पैटर्न (जैसे "संदिग्ध व्यवहार") को पहचानने में बहुत अच्छे हैं, लेकिन वे मल्टी-हॉप रीजनिंग (multi-hop reasoning) में संघर्ष करते हैं।

  • सरल रूपक: कल्पना कीजिए कि एक कुत्ते को "बैठो" कहने पर बैठने के लिए प्रशिक्षित किया गया है। यदि आप एक ट्रीट (treat) पकड़े हुए "बैठो" कहते हैं, तो कुत्ता बैठ जाता है। लेकिन यदि आप एक दूसरी ट्रीट पकड़े हुए "बैठो" कहते हैं जिसका अर्थ "रुको" है, तो कुत्ता भ्रमित हो जाता है।
  • पेपर का दावा: AI मॉडल उस कुत्ते की तरह हैं। वे "संदिग्ध" देखते हैं और तुरंत "बाहर" का वोट देते हैं। वे यह समझने में विफल रहते हैं कि इस विशिष्ट खेल में, "संदिग्ध" का अर्थ "वोट देकर बाहर करें" (यदि वह वेयरवोल्फ है) या "रखें" (यदि वह जेस्टर है) दोनों हो सकता है।

शोधकर्ता तर्क देते हैं कि यदि हमें यह परीक्षण करना है कि क्या किसी AI में "थ्योरी ऑफ माइंड" है, तो हमें तीन प्रतिस्पर्धी लक्ष्यों (जैसे यह जेस्टर गेम) वाले खेलों की आवश्यकता है, न कि केवल दो के। वर्तमान "दो-टीम" वाले खेल बहुत आसान हैं क्योंकि AI केवल सरल नियमों का पालन करके जीत सकता है, बिना अन्य खिलाड़ियों के छिपे हुए उद्देश्यों को वास्तव में समझे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →