Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration
यह शोध पत्र ALMANAC प्रस्तुत करता है, जो मैप टास्क (Map Task) पर मानव द्वैत सहयोग (human dyadic collaboration) से प्राप्त 2,987 एक्शन-लेवल मेंटल मॉडल एनोटेशन का एक डेटासेट है, जिसे एलएलएम (LLM) एजेंटों की संरेखित मेंटल मॉडल बनाए रखने और मानव सहयोगात्मक व्यवहारों को सिम्युलेट करने की क्षमता को प्रशिक्षित करने और मूल्यांकन करने के अंतराल को पाटने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने एक दोस्त के साथ मिलकर एक खजाने के नक्शे का चित्र बनाने की कोशिश कर रहे हैं, लेकिन आप दोनों अलग-अलग कमरों में हैं। आप केवल एक टेक्स्ट चैट के माध्यम से एक-दूसरे से बात कर सकते हैं। एक व्यक्ति (गाइड/मार्गदर्शक) के पास मूल नक्शा है जिसमें सही रास्ता बना हुआ है। दूसरा व्यक्ति (फॉलोअर/अनुगामी) के पास एक खाली नक्शा है जिसमें केवल लैंडमार्क (जैसे कि कोई पहाड़ या पुल) बने हुए हैं, लेकिन कोई रास्ता नहीं है।
सफल होने के लिए, उन्हें मिलकर काम करना होगा: गाइड रास्ते का वर्णन करेगा, और फॉलोअर उसे बनाने की कोशिश करेगा।
यह ALMANAC नामक एक नए शोध प्रोजेक्ट का मूल आधार है। यहाँ शोधकर्ताओं ने क्या किया और यह क्यों महत्वपूर्ण है, इसका सरल विवरण दिया गया है, जिसे रोजमर्रा के उदाहरणों का उपयोग करके समझाया गया है।
1. समस्या: रोबोट "करने" में अच्छे हैं, लेकिन "साथ मिलकर सोचने" में बुरे हैं
वर्तमान में, AI एजेंट (जैसे उन्नत चैटबॉट्स) आदेशों का पालन करने में बहुत अच्छे हैं। यदि आप कहते हैं, "एक फ्लाइट बुक करें," तो वे इसे कर देते हैं। लेकिन वास्तविक मानवीय सहयोग केवल आदेशों का पालन करने के बारे में नहीं है; यह मानसिक तालमेल (mental alignment) के बारे में है।
एक मानव टीम को एक जैज़ बैंड (jazz band) की तरह समझें। वे केवल शीट म्यूजिक नहीं पढ़ रहे होते; वे लगातार एक-दूसरे को सुन रहे होते हैं, अनुमान लगा रहे होते हैं कि उनका साथी संगीतकार अगला नोट क्या बजाने वाला है, और वास्तविक समय में अपनी लय को समायोजित कर रहे होते हैं। उनके पास एक "साझा मानसिक मॉडल" (shared mental model) होता है।
- स्व-तर्क (Self-reasoning): "मैं यह नोट क्यों बजा रहा हूँ?"
- साथी का इरादा (Partner intent): "मेरा साथी क्या करने की कोशिश कर रहा है?"
- टीम का लक्ष्य (Team goal): "क्या हम अभी भी एक जैज़ धुन बजाने की कोशिश कर रहे हैं, या हम रॉक संगीत की ओर मुड़ गए हैं?"
पेपर का तर्क है कि वर्तमान AI एक ऐसे रोबोट की तरह है जो केवल अपना वाद्य यंत्र पूरी तरह से बजाना जानता है लेकिन उसे यह पता नहीं है कि बाकी बैंड क्या सोच रहा है। मौजूदा डेटासेट केवल यह रिकॉर्ड करते हैं कि लोगों ने क्या कहा और उन्होंने क्या किया, लेकिन वे उनके दिमाग के अंदर के क्यों को छोड़ देते हैं।
2. समाधान: ALMANAC (एक "मन पढ़ने वाला" डेटासेट)
शोधकर्ताओं ने इसे ठीक करने के लिए ALMANAC नामक एक नया डेटासेट बनाया। उन्होंने ऊपर बताए गए "मैप टास्क" को लिया और इसमें अवलोकन (observation) की एक विशेष परत जोड़ दी।
उन्होंने डेटा कैसे एकत्र किया:
- खेल: 50 लोगों ने जोड़ियों में "मैप टास्क" खेला (कुल 25 जोड़ियाँ)।
- चेकपॉइंट्स: हर बार जब जोड़ी कार्य के 25%, 50% और 75% तक पहुँचती थी, तो खेल थोड़ी देर के लिए रुक जाता था। खिलाड़ियों को जल्दी से माइक्रोफ़ोन में बोलना पड़ता था और उत्तर देना पड़ता था: "आपको क्या लगता है कि अभी हमारा लक्ष्य क्या है?" "आपको क्या लगता है कि आपका साथी क्या करने की कोशिश कर रहा है?" और "आपने अभी जो किया वह आपने क्यों किया?"
- रीप्ले: खेल के बाद, खिलाड़ियों ने अपने ही कार्यों का रीप्ले देखा। उनके द्वारा किए गए प्रत्येक कदम (एक रेखा खींचना, गलती मिटाना, संदेश भेजना) के लिए, उन्हें फिर से अपनी मानसिक स्थिति को लेबल करना पड़ा।
परिणाम:
उनके पास 2,987 विशिष्ट क्रियाएं थीं, और प्रत्येक क्रिया के लिए, उनके पास निम्नलिखित का रिकॉर्ड है:
- की गई क्रिया (जैसे, "एक रेखा खींची")।
- टीम का लक्ष्य (जैसे, "हम पुल को पहाड़ से जोड़ने की कोशिश कर रहे हैं")।
- साथी का इरादा (जैसे, "मुझे लगता है कि मेरा साथी दिशा को लेकर भ्रमित है")।
- स्व-तर्क (जैसे, "मैंने यह रेखा इसलिए खींची क्योंकि मुझे लगा कि पहाड़ बाईं ओर है")।
- तर्क (Rationale) (उनकी विचार प्रक्रिया की एक मुक्त-रूप व्याख्या)।
3. प्रयोग: क्या AI "मन पढ़" सकता है?
शोधकर्ताओं ने छह अलग-अलग AI मॉडलों (GPT-5.5 और Claude जैसे बड़े मॉडलों सहित) का परीक्षण किया ताकि यह देखा जा सके कि क्या वे इस नए डेटासेट का उपयोग करके एक मानव सहयोगी की तरह कार्य कर सकते हैं। उन्होंने AI को दो काम दिए:
- अगली चाल का अनुमान लगाना: "अब तक जो हुआ है, उसके आधार पर, इंसान आगे क्या करेगा?"
- मानसिक स्थिति का अनुमान लगाना: "अब तक जो हुआ है, उसके आधार पर, इंसान इस समय क्या सोच रहा है?"
निष्कर्ष:
- "क्या" आसान है, "क्यों" कठिन है: AI मॉडल अगले एक्शन (जैसे, "इंसान शायद एक रेखा खींचेगा") की भविष्यवाणी करने में काफी अच्छे थे।
- "मन" पेचीदा है: मॉडल आंतरिक विचारों (मानसिक मॉडलों) की भविष्यवाणी करने में संघर्ष करते थे। वे साझा लक्ष्य (जैसे, "हम एक पुल बना रहे हैं") का अनुमान लगाने में काफी हद तक सक्षम थे, लेकिन वे इंसान के निजी, व्यक्तिगत तर्क (जैसे, "मैं यह इसलिए बना रहा हूँ क्योंकि मैं घबराया हुआ हूँ") का अनुमान लगाने में बहुत खराब थे।
- भूमिका मायने रखती है:
- गाइड्स (जो निर्देश देते हैं) को मानसिक रूप से अनुमान लगाना कठिन था क्योंकि उनके विचारों में जटिल स्थानिक योजना (spatial planning) शामिल होती है जो हमेशा बोलकर नहीं बताई जाती।
- फॉलोअर्स (जो चित्र बनाते हैं) को मानसिक रूप से अनुमान लगाना आसान था क्योंकि उनके विचार गाइड के स्पष्ट निर्देशों से सीधे आकार लेते हैं।
- प्रशिक्षण मदद करता है: जब उन्होंने इस विशिष्ट डेटासेट का उपयोग करके एक छोटे AI मॉडल को "सिखाया" (fine-tuned), तो वह मानव व्यवहार का अनुकरण करने में बेहतर हो गया, और लगभग बड़े, महंगे मॉडलों के करीब पहुँच गया।
4. मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि AI को वास्तविक सहयोगी बनाने के लिए, हमें केवल उन्हें कार्य पूरा करने के लिए प्रशिक्षित नहीं करना चाहिए। हमें उन्हें इस पर प्रशिक्षित करने की आवश्यकता है कि लोग मिलकर काम करते समय कैसे सोचते हैं।
ALMANAC पहला ऐसा डेटासेट है जो मानव क्रियाओं को इन "एक्शन-लेवल मेंटल मॉडल्स" के साथ जोड़ता है। यह दिखाता है कि जबकि AI मानव व्यवहार का अनुकरण करने में बेहतर हो रहा है, वह अभी भी उस अदृश्य, आंतरिक तर्क को समझने के लिए संघर्ष करता है जो मानव टीम वर्क को सफल बनाता है। यह डेटासेट उन "ट्रेनिंग व्हील्स" (सहायक पहियों) को प्रदान करता है जिनकी आवश्यकता AI को यह सिखाने के लिए है कि कैसे अपने मानसिक मॉडल को एक इंसान के मॉडल के साथ संरेखित किया जाए, न कि केवल अंधे होकर आदेशों का पालन किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।