← नवीनतम पेपर
🤖 AI

SOM: Structured Opponent Modeling for LLM-based Agents via Structural Causal Model

यह शोध पत्र स्ट्रक्चर्ड अपोनेंट मॉडलिंग (SOM) का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो स्ट्रक्चरल कॉज़ल मॉडल्स का लाभ उठाते हुए प्रतिद्वंद्वी प्रतिनिधित्व निर्माण को भविष्यवाणी से स्पष्ट रूप से अलग करता है, जिससे गतिशील मल्टी-एजेंट वातावरण में LLM-आधारित एजेंटों की सटीकता और अनुकूलन क्षमता में वृद्धि होती है।

मूल लेखक: Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Xiaotang Chen, Kaiqi Huang

प्रकाशित 2026-05-11
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Xiaotang Chen, Kaiqi Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

द बिग पिक्चर: दूसरा व्यक्ति क्या सोच रहा है, इसका अंदाज़ा लगाना

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट कंप्यूटर प्रतिद्वंद्वी के खिलाफ एक जटिल बोर्ड गेम या वीडियो गेम खेल रहे हैं। जीतने के लिए, आपको यह अंदाज़ा लगाने की ज़रूरत है कि वे अगला कदम क्या उठाएंगे।

वर्तमान AI एजेंट (जो लार्ज लैंग्वेज मॉडल्स, यानी LLMs द्वारा संचालित हैं) इसे केवल "ज़ोर से सोचने" (thinking out loud) के माध्यम से करने की कोशिश करते हैं। वे गेम के इतिहास को देखते हैं और कहते हैं, "हम्म, उन्होंने X किया, इसलिए शायद वे Y करेंगे।" समस्या यह है कि यह अक्सर एक अस्त-व्यस्त, उलझी हुई विचार प्रक्रिया होती है। यह एक नक्शे के बिना भूलभुलैया में चक्कर काटने की तरह है। कभी-कभी AI भ्रमित हो जाता है, मुख्य विवरणों को छोड़ देता है, या मनगढ़ंत बातें (hallucinations) बनाने लगता है क्योंकि उसके पास प्रतिद्वंद्वी के दिमाग को समझने के लिए कोई स्पष्ट योजना नहीं होती।

इस पेपर के लेखक एक नई विधि प्रस्तावित करते हैं जिसे SOM (स्ट्रक्चर्ड अपोनेंट मॉडलिंग) कहा जाता है। केवल अंदाज़ा लगाने के बजाय, SOM AI को एक ब्लूप्रिंट या एक फ्लोचार्ट देता है जिसे उसे पालन करना है। यह "प्रतिद्वंद्वी को समझने" की समस्या को दो अलग-अलग चरणों में तोड़ देता है: नक्शा बनाना (Building the Map) और नक्शे का उपयोग करना (Using the Map)


चरण 1: नक्शा बनाना (निर्माण चरण)

प्रतिद्वंद्वी की निर्णय लेने की प्रक्रिया को एक रहस्य की तरह समझें। आप उनके अंतिम कदम (action) को देखते हैं, लेकिन आप उन विचारों को नहीं देख पाते जो उन्हें उस कदम तक ले गए।

पहले चरण में, SOM एक जासूस की तरह काम करता है।

  1. अवलोकन (The Observation): AI देखता है कि प्रतिद्वंद्वी ने क्या किया।
  2. चिंतन (The Reflection): AI खुद से पूछता है, "उन्होंने ऐसा क्यों किया?" वह उन छिपे हुए विचारों या "मध्यवर्ती चरणों" (middle steps) की कल्पना करने की कोशिश करता है जो प्रतिद्वंद्वी के मन में रहे होंगे। उदाहरण के लिए, एक खेल जहाँ आप एक नंबर का अनुमान लगाते हैं, प्रतिद्वंद्वी ने शायद सोचा होगा: "मैंने देखा कि बाकी सभी ने ऊंचे नंबर चुने, इसलिए मैंने सुरक्षित रहने के लिए अपना नंबर कम करने का फैसला किया।"
  3. ब्लूप्रिंट (SCM): AI इन "मध्यवर्ती विचारों" को लेता है और एक कॉज़ल ग्राफ (causal graph) बनाता है। यह एक ऐसा आरेख है जिसमें तीरों (arrows) के माध्यम से कारण-और-प्रभाव (cause-and-effect) दिखाया जाता है।
    • अवलोकन (Observation) \rightarrow छिपा हुआ विचार (जैसे, "वे आक्रामक हो रहे हैं") \rightarrow कदम (Action)

इस पेपर में इसे स्ट्रक्चरल कॉज़ल मॉडल (SCM) कहा गया है। इसे एक फ्लोचार्ट की तरह समझें जो कहता है: "यदि प्रतिद्वंद्वी यह देखता है, तो संभावना है कि वह वह सोचेगा, जिससे वह यह कदम उठाएगा।" AI इस नक्शे को लगातार बेहतर बनाता रहता है, नए "विचार नोड्स" (thought nodes) जोड़ता है यदि उसे कोई ऐसा पैटर्न दिखता है जो उसने पहले नहीं देखा था, और उन "विचार नोड्स" को हटा देता है जो गलत साबित होते हैं।

चरण 2: नक्शे का उपयोग करना (अनुमान चरण)

एक बार जब नक्शा बन जाता है, तो AI चरण 2: भविष्यवाणी (Prediction) की ओर बढ़ जाता है।

अब, बेतरतीब ढंग से अंदाज़ा लगाने के बजाय, AI फ्लोचार्ट का पालन करता है।

  1. यह वर्तमान गेम की स्थिति (इनपुट) को देखता है।
  2. यह नक्शे पर तीरों का अनुसरण करता है और अगले "विचार नोड" तक पहुँचता है।
  3. यह LLM से पूछता है: "नक्शे और पिछले उदाहरणों के आधार पर, जहाँ इस विशिष्ट विचार ने एक विशिष्ट कदम की ओर ले जाने का काम किया था, प्रतिद्वंद्वी अगला कदम क्या उठाएगा?"

यह एक GPS नेविगेशन सिस्टम की तरह है। बिना किसी दिशा के लक्ष्य खोजने की कोशिश करने के बजाय, AI उस विशिष्ट मार्ग का अनुसरण करता है जिसे उसने पहले मैप किया था। यह भविष्यवाणी को बहुत अधिक स्थिर और सटीक बनाता है।

यह बेहतर क्यों है? ("दो-चरणीय प्रक्रिया" का जादू)

पेपर का तर्क है कि पिछले तरीकों ने "जासूसी कार्य" और "भविष्यवाणी" दोनों को एक साथ एक बड़े, अस्त-व्यस्त दिमाग के मंथन (brain dump) में करने की कोशिश की। इससे अक्सर भ्रम पैदा होता है।

SOM इन्हें अलग करता है:

  • चरण 1 का उद्देश्य संरचना को सीखना है। यह एक शिक्षक की तरह है जो एक छात्र के सोचने के तरीके को समझाने के लिए व्हाइटबोर्ड पर एक आरेख बना रहा है।
  • चरण 2 का उद्देश्य उस आरेख का उपयोग करना है।

इन्हें अलग करके, AI खो नहीं जाता। उसके पास पालन करने के लिए एक स्पष्ट रास्ता होता है।

वास्तविक दुनिया के परीक्षण (प्रयोग)

शोधकर्ताओं ने इसे तीन अलग-अलग "गेम्स" में टेस्ट किया कि क्या यह वास्तव में काम करता है:

  1. "औसत का अनुमान लगाओ" गेम (The "Guess the Average" Game): खिलाड़ी एक नंबर चुनते हैं, और विजेता वह होता है जो समूह के औसत के 80% के सबसे करीब होता है। इसके लिए इस बारे में गहराई से सोचने की आवश्यकता होती है कि दूसरे क्या सोच रहे हैं।
    • परिणाम: SOM अन्य AI तरीकों की तुलना में अधिक बार जीता क्योंकि यह "मैं सोचता हूँ कि आप सोचते हैं कि..." की जटिल श्रृंखला को बेहतर ढंग से मॉडल कर सका।
  2. सर्वाइवल ऑक्शन (The Survival Auction): खिलाड़ी जीवित रहने के लिए पानी के लिए बोली लगाते हैं।
    • परिणाम: SOM अधिक समय तक जीवित रहा। इसने समझा कि प्रतिद्वंद्वी की "तत्परता" (कम स्वास्थ्य) ने उन्हें आक्रामक रूप से बोली लगाने के लिए प्रेरित किया, और इसने उस "मध्यवर्ती विचार" का उपयोग उनकी बोलियों की भविष्यवाणी करने के लिए किया।
  3. "अंडरकवर" गेम (The "Undercover" Game): यह एक सोशल डिटेक्शन गेम है जहाँ खिलाड़ी अनुमान लगाने की कोशिश करते हैं कि कौन झूठ बोल रहा है।
    • परिणाम: SOM झूठ बोलने वालों को पकड़ने में बेहतर था क्योंकि इसने यह मैप किया कि कैसे एक झूठे व्यक्ति के शब्द उनके छिपे हुए रोल (role) पर निर्भर करते हैं, न कि केवल शब्दों पर प्रतिक्रिया देते हैं।

"ट्रांसफर" का कमाल (The "Transfer" Trick)

इस पेपर का एक दिलचस्प निष्कर्ष नॉलेज ट्रांसफर (Knowledge Transfer) है।

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट AI (जैसे GPT-4) का उपयोग करके एक विशिष्ट प्रतिद्वंद्वी के सोचने के तरीके का एक परफेक्ट नक्शा बनाया है। पेपर दिखाता है कि आप उस नक्शे को ले सकते हैं और उसे एक छोटे, कम स्मार्ट AI (जैसे एक मानक ओपन-सोर्स मॉडल) को दे सकते हैं। भले ही छोटा AI उतना स्मार्ट नहीं है, लेकिन "नक्शा" होने से उसे उस विशिष्ट प्रतिद्वंद्वी के खिलाफ बहुत बेहतर खेलने में मदद मिलती है। यह एक नौसिखिया ड्राइवर को एक विस्तृत GPS रूट देने जैसा है; वे शायद रेसिंग चैंपियन न हों, लेकिन वे रास्ता नहीं भटकेंगे।

सारांश

यह पेपर SOM को पेश करता है, जो AI एजेंटों को यह अनुमान लगाने में बेहतर बनाने का एक तरीका है कि उनके प्रतिद्वंद्वी क्या करेंगे।

  • समस्या: वर्तमान AI बहुत अव्यवस्थित तरीके से अंदाज़ा लगाते हैं।
  • समाधान: इसे दो चरणों में तोड़ें: प्रतिद्वंद्वी की सोच का एक कॉज़ल मैप बनाएँ, फिर अगले कदम की भविष्यवाणी करने के लिए उस मैप का पालन करें
  • परिणाम: AI अधिक गेम जीतता है, अधिक समय तक जीवित रहता है, और कम गलतियाँ करता है क्योंकि उसके पास अपने प्रतिद्वंद्वियों को समझने के लिए एक संरचित, तार्किक तरीका है, न कि केवल अंदाज़ा लगाने का तरीका।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →