← नवीनतम पेपर
🤖 AI

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

यह शोध पत्र ALMANAC प्रस्तुत करता है, जो मैप टास्क (Map Task) पर मानव द्वैत सहयोग (human dyadic collaboration) से प्राप्त 2,987 एक्शन-लेवल मेंटल मॉडल एनोटेशन का एक डेटासेट है, जिसे एलएलएम (LLM) एजेंटों की संरेखित मेंटल मॉडल बनाए रखने और मानव सहयोगात्मक व्यवहारों को सिम्युलेट करने की क्षमता को प्रशिक्षित करने और मूल्यांकन करने के अंतराल को पाटने के लिए डिज़ाइन किया गया है।

मूल लेखक: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त के साथ मिलकर एक खजाने के नक्शे का चित्र बनाने की कोशिश कर रहे हैं, लेकिन आप दोनों अलग-अलग कमरों में हैं। आप केवल एक टेक्स्ट चैट के माध्यम से एक-दूसरे से बात कर सकते हैं। एक व्यक्ति (गाइड/मार्गदर्शक) के पास मूल नक्शा है जिसमें सही रास्ता बना हुआ है। दूसरा व्यक्ति (फॉलोअर/अनुगामी) के पास एक खाली नक्शा है जिसमें केवल लैंडमार्क (जैसे कि कोई पहाड़ या पुल) बने हुए हैं, लेकिन कोई रास्ता नहीं है।

सफल होने के लिए, उन्हें मिलकर काम करना होगा: गाइड रास्ते का वर्णन करेगा, और फॉलोअर उसे बनाने की कोशिश करेगा।

यह ALMANAC नामक एक नए शोध प्रोजेक्ट का मूल आधार है। यहाँ शोधकर्ताओं ने क्या किया और यह क्यों महत्वपूर्ण है, इसका सरल विवरण दिया गया है, जिसे रोजमर्रा के उदाहरणों का उपयोग करके समझाया गया है।

1. समस्या: रोबोट "करने" में अच्छे हैं, लेकिन "साथ मिलकर सोचने" में बुरे हैं

वर्तमान में, AI एजेंट (जैसे उन्नत चैटबॉट्स) आदेशों का पालन करने में बहुत अच्छे हैं। यदि आप कहते हैं, "एक फ्लाइट बुक करें," तो वे इसे कर देते हैं। लेकिन वास्तविक मानवीय सहयोग केवल आदेशों का पालन करने के बारे में नहीं है; यह मानसिक तालमेल (mental alignment) के बारे में है।

एक मानव टीम को एक जैज़ बैंड (jazz band) की तरह समझें। वे केवल शीट म्यूजिक नहीं पढ़ रहे होते; वे लगातार एक-दूसरे को सुन रहे होते हैं, अनुमान लगा रहे होते हैं कि उनका साथी संगीतकार अगला नोट क्या बजाने वाला है, और वास्तविक समय में अपनी लय को समायोजित कर रहे होते हैं। उनके पास एक "साझा मानसिक मॉडल" (shared mental model) होता है।

  • स्व-तर्क (Self-reasoning): "मैं यह नोट क्यों बजा रहा हूँ?"
  • साथी का इरादा (Partner intent): "मेरा साथी क्या करने की कोशिश कर रहा है?"
  • टीम का लक्ष्य (Team goal): "क्या हम अभी भी एक जैज़ धुन बजाने की कोशिश कर रहे हैं, या हम रॉक संगीत की ओर मुड़ गए हैं?"

पेपर का तर्क है कि वर्तमान AI एक ऐसे रोबोट की तरह है जो केवल अपना वाद्य यंत्र पूरी तरह से बजाना जानता है लेकिन उसे यह पता नहीं है कि बाकी बैंड क्या सोच रहा है। मौजूदा डेटासेट केवल यह रिकॉर्ड करते हैं कि लोगों ने क्या कहा और उन्होंने क्या किया, लेकिन वे उनके दिमाग के अंदर के क्यों को छोड़ देते हैं।

2. समाधान: ALMANAC (एक "मन पढ़ने वाला" डेटासेट)

शोधकर्ताओं ने इसे ठीक करने के लिए ALMANAC नामक एक नया डेटासेट बनाया। उन्होंने ऊपर बताए गए "मैप टास्क" को लिया और इसमें अवलोकन (observation) की एक विशेष परत जोड़ दी।

उन्होंने डेटा कैसे एकत्र किया:

  1. खेल: 50 लोगों ने जोड़ियों में "मैप टास्क" खेला (कुल 25 जोड़ियाँ)।
  2. चेकपॉइंट्स: हर बार जब जोड़ी कार्य के 25%, 50% और 75% तक पहुँचती थी, तो खेल थोड़ी देर के लिए रुक जाता था। खिलाड़ियों को जल्दी से माइक्रोफ़ोन में बोलना पड़ता था और उत्तर देना पड़ता था: "आपको क्या लगता है कि अभी हमारा लक्ष्य क्या है?" "आपको क्या लगता है कि आपका साथी क्या करने की कोशिश कर रहा है?" और "आपने अभी जो किया वह आपने क्यों किया?"
  3. रीप्ले: खेल के बाद, खिलाड़ियों ने अपने ही कार्यों का रीप्ले देखा। उनके द्वारा किए गए प्रत्येक कदम (एक रेखा खींचना, गलती मिटाना, संदेश भेजना) के लिए, उन्हें फिर से अपनी मानसिक स्थिति को लेबल करना पड़ा।

परिणाम:
उनके पास 2,987 विशिष्ट क्रियाएं थीं, और प्रत्येक क्रिया के लिए, उनके पास निम्नलिखित का रिकॉर्ड है:

  • की गई क्रिया (जैसे, "एक रेखा खींची")।
  • टीम का लक्ष्य (जैसे, "हम पुल को पहाड़ से जोड़ने की कोशिश कर रहे हैं")।
  • साथी का इरादा (जैसे, "मुझे लगता है कि मेरा साथी दिशा को लेकर भ्रमित है")।
  • स्व-तर्क (जैसे, "मैंने यह रेखा इसलिए खींची क्योंकि मुझे लगा कि पहाड़ बाईं ओर है")।
  • तर्क (Rationale) (उनकी विचार प्रक्रिया की एक मुक्त-रूप व्याख्या)।

3. प्रयोग: क्या AI "मन पढ़" सकता है?

शोधकर्ताओं ने छह अलग-अलग AI मॉडलों (GPT-5.5 और Claude जैसे बड़े मॉडलों सहित) का परीक्षण किया ताकि यह देखा जा सके कि क्या वे इस नए डेटासेट का उपयोग करके एक मानव सहयोगी की तरह कार्य कर सकते हैं। उन्होंने AI को दो काम दिए:

  1. अगली चाल का अनुमान लगाना: "अब तक जो हुआ है, उसके आधार पर, इंसान आगे क्या करेगा?"
  2. मानसिक स्थिति का अनुमान लगाना: "अब तक जो हुआ है, उसके आधार पर, इंसान इस समय क्या सोच रहा है?"

निष्कर्ष:

  • "क्या" आसान है, "क्यों" कठिन है: AI मॉडल अगले एक्शन (जैसे, "इंसान शायद एक रेखा खींचेगा") की भविष्यवाणी करने में काफी अच्छे थे।
  • "मन" पेचीदा है: मॉडल आंतरिक विचारों (मानसिक मॉडलों) की भविष्यवाणी करने में संघर्ष करते थे। वे साझा लक्ष्य (जैसे, "हम एक पुल बना रहे हैं") का अनुमान लगाने में काफी हद तक सक्षम थे, लेकिन वे इंसान के निजी, व्यक्तिगत तर्क (जैसे, "मैं यह इसलिए बना रहा हूँ क्योंकि मैं घबराया हुआ हूँ") का अनुमान लगाने में बहुत खराब थे।
  • भूमिका मायने रखती है:
    • गाइड्स (जो निर्देश देते हैं) को मानसिक रूप से अनुमान लगाना कठिन था क्योंकि उनके विचारों में जटिल स्थानिक योजना (spatial planning) शामिल होती है जो हमेशा बोलकर नहीं बताई जाती।
    • फॉलोअर्स (जो चित्र बनाते हैं) को मानसिक रूप से अनुमान लगाना आसान था क्योंकि उनके विचार गाइड के स्पष्ट निर्देशों से सीधे आकार लेते हैं।
  • प्रशिक्षण मदद करता है: जब उन्होंने इस विशिष्ट डेटासेट का उपयोग करके एक छोटे AI मॉडल को "सिखाया" (fine-tuned), तो वह मानव व्यवहार का अनुकरण करने में बेहतर हो गया, और लगभग बड़े, महंगे मॉडलों के करीब पहुँच गया।

4. मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि AI को वास्तविक सहयोगी बनाने के लिए, हमें केवल उन्हें कार्य पूरा करने के लिए प्रशिक्षित नहीं करना चाहिए। हमें उन्हें इस पर प्रशिक्षित करने की आवश्यकता है कि लोग मिलकर काम करते समय कैसे सोचते हैं

ALMANAC पहला ऐसा डेटासेट है जो मानव क्रियाओं को इन "एक्शन-लेवल मेंटल मॉडल्स" के साथ जोड़ता है। यह दिखाता है कि जबकि AI मानव व्यवहार का अनुकरण करने में बेहतर हो रहा है, वह अभी भी उस अदृश्य, आंतरिक तर्क को समझने के लिए संघर्ष करता है जो मानव टीम वर्क को सफल बनाता है। यह डेटासेट उन "ट्रेनिंग व्हील्स" (सहायक पहियों) को प्रदान करता है जिनकी आवश्यकता AI को यह सिखाने के लिए है कि कैसे अपने मानसिक मॉडल को एक इंसान के मॉडल के साथ संरेखित किया जाए, न कि केवल अंधे होकर आदेशों का पालन किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →