Do we carry the false belief that LLMs have a theory of mind?
بينما تحقق النماذج اللغوية الكبيرة غالبًا درجات عالية في تقييمات نظرية العقل، تكشف هذه الدراسة أنها تعتمد على استدلالات منخفضة التكلفة بدلاً من تتبع الحالات الذهنية بشكل حقيقي، مما يشير إلى افتقارها إلى قدرات قوية في نظرية العقل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
يمتلك البشر قدرة إدراكية خارقة وفريدة تسمح لهم بالتنقل في العالم الاجتماعي: وهي القدرة على فهم أن الآخرين لديهم عقول خاصة بهم، مليئة بالأفكار والمعتقدات والرغبات التي قد تختلف عن معتقداتنا. يطلق علماء النفس على هذه القدرة اسم "نظرية العقل". إنها الآلية الذهنية التي تجعلنا ندرك أن صديقاً قد يبحث عن شيء ما في مكان ما لأنه رآه فيه لآخر مرة، حتى لو كنا نعلم أن الشيء قد نُقل منذ ذلك الحين إلى مكان مختلف. لا تقتصر هذه المهارة على كونها ذكاءً فحسب؛ بل هي أساس التعاطف والتواصل والتعاون. لعقود من الزمن، استخدم الباحثون قصة بسيطة، تتضمن غالباً شخصيتين باسم سالي وآني، لاختبار ما إذا كان الأطفال قد طوروا هذه القدرة. في القصة، تخبئ سالي لعبة في سلة وتغادر الغرفة. وأثناء غيابها، تنقل آني اللعبة إلى صندوق. عندما تعود سالي، يكون السؤال بسيطاً: أين ستبحث عن لعبتها؟ الطفل الذي طور نظرية العقل يعرف أن سالي ستبحث في السلة، لأن هذا هو المكان الذي تعتقد أن اللعبة موجودة فيه، رغم أن الواقع هو أنها أصبحت الآن في الصندوق.
مؤخراً، ظهر نوع جديد من الذكاء في حياتنا اليومية: نماذج اللغات الكبيرة. هذه برامج حاسوبية مدربة على كميات هائلة من النصوص يمكنها الكتابة، والدردشة، وحل المشكلات بطلاقة تحاكي المحادثة البشرية. ولأن هذه النماذج يمكنها مناقشة مواضيع معقدة وتبدو وكأنها تفهم السياق، بدأ العديد من الباحثين والمراقبين يتساءلون عما إذا كانت تمتلك هي أيضاً نظرية عقل. فإذا كان بإمكان الآلة التنبؤ بشكل صحيح بما يعتقده شخصية خيالية، فهل تفهم حقاً مفهوم الاعتقاد، أم أنها مجرد تخمين بناءً على الأنماط التي رأتها من قبل؟ لقد أصبح هذا السؤال ملحاً مع دمج هذه الأدوات في حياتنا الاجتماعية والمهنية، مما أدى إلى حاجة ماسة لتحديد ما إذا كانت شريكة اجتماعية حقيقية أم مجرد محاكٍ متطور للغاية.
سعت دراسة حديثة للإجابة على هذا السؤال من خلال وضع خمسة من أكثر نماذج اللغة تقدماً للاختبار باستخدام سيناريو "سالي-آني" الكلاسيكي وعدة تنويعات عليه. لم يكتفِ الباحثون، بقيادة نيكولاس غريفين من جامعة باريس سيتي، بسؤال النماذج السؤال القياسي، بل صمموا سلسلة من التحديات لمعرفة ما إذا كانت النماذج قادرة على التعامل مع التفاصيل الدقيقة للقصة التي تتطلب تفكيراً حقيقياً بدلاً من مجرد الحفظ. لقد اختبروا نماذج من شركات كبرى، بما في ذلك GPT-5.5 Luna، وClaude Sonnet 5، وGemini 3.1 Pro، وGrok 4.5، وMistral Medium 3.5. ولضمان عدالة النتائج، أنشأ الباحثون نسخاً جديدة وفريدة من القصة لكل اختبار، مع تغيير الأسماء والأشياء والتفاصيل المحددة حتى لا تتمكن النماذج من مجرد استرجاع إجابة سابقة من بيانات تدريبها. كما أدخلوا تحولات مخادعة، مثل جعل الحاويات شفافة بحيث يمكن للشخصيات رؤية اللعبة، أو تغيير الكلمات المستخدمة لوصف مكان وضع اللعبة، لمعرفة ما إذا كان بإمكان النماذج تعديل تفكيرها بناءً على معلومات بصرية أو لغوية جديدة.
رسمت النتائج صورة لنظام يتمتع بقدرة عالية في بعض المجالات ولكنه محدود بشكل جوهري في مجالات أخرى. فعندما أُعطيت النماذج النسخة القياسية من القصة، كان أداؤها ممتازاً، حيث أجابت معظمها بشكل صحيح في كل مرة تقريباً. في الواقع، عند حساب المتوسط عبر جميع أنواع الأسئلة المختلفة، سجلت النماذج درجات أعلى بكثير مما هو متوقع بالصدفة العشوائية. وكان المتصدر، Gemini 3.1 Pro، قد حصل على الإجابة الصحيحة بنسبة 84 بالمائة إجمالاً. يشير هذا النجاح إلى أن هذه النماذج قد تعلمت النمط العام لمهمة "الاعتقاد الخاطئ" من الكم الهائل من النصوص التي قرأتها. يمكنها التعرف على هيكل القصة وتقديم الإجابة التي سيقدمها الإنسان في سيناريو نموذجي.
ومع ذلك، كشفت الدراسة أن هذا النجاح هش. فعندما أدخل الباحثون تنويعات تتطلب من النماذج استخدام المنطق السليم أو دمج المعلومات البصرية، انخفض الأداء بشكل كبير. في أحد التنويعات، وصفت القصة الحاويات بأنها شفافة، مما يعني أن الشخصية التي عادت إلى الغرفة استطاعت رؤية اللعبة في موقعها الجديد. في موقف واقعي، سيفهم الشخص أنه بما أن الشخصية يمكنها رؤية اللعبة، فإنها لم تعد تحمل اعتقاداً خاطئاً؛ فهي تعرف الحقيقة. ومع ذلك، فشلت النماذج إلى حد كبير في إجراء هذا الربط. تمكن نموذج واحد فقط، وهو Gemini 3.1 Pro، من الحصول على أكثر من نصف هذه الإجابات بشكل صحيح. أما النماذج الأخرى فقد استمرت في الإصرار على أن الشخصية ستبحث في الموقع القديم الفارغ، متجاهلة حقيقة أن الشخصية يمكنها رؤية اللعبة.
أصبح الصعوبة أكثر وضوحاً عندما غير الباحثون حروف الجر المستخدمة لوصف موقع اللعبة. في القصة القياسية، توضع اللعبة "في" صندوق. وفي الاختبار، وصف الباحثون اللعبة بأنها وُضعت "على" صندوق أو "تحت" دلو. وعندما لمحت القصة أن اللعبة كانت مرئية لأنها كانت موضوعة فوق حاوية بدلاً من كونها مختبئة داخلها، فشلت جميع النماذج تماماً، وسجلت صفر بالمائة في هذه الأسئلة. لم تستطع النماذج استنتاج أن رؤية الشيء قد غيرت الحالة الذهنية للشخصية. وبالمثل، عندما تضمنت القصة إخبار شخصية صراحةً بمكان انتقال اللعبة، أو عندما سأل السؤال عما تعتقده شخصية ما بشأن ما ستفعله شخصية أخرى، تعثرت النماذج. غالباً ما عادت إلى أنماط بسيطة وجامدة بدلاً من تتبع الحالات الذهنية للشخصيات ديناميكياً مع تطور القصة.
كما نظر الباحثون في كيفية تعامل النماذج مع جنس الشخصيات. ووجدوا أن النماذج كان أداؤها أفضل قليلاً عندما تشاركتا نفس الجنس، وأسوأ قليلاً عندما كان لهما جنسان مختلفان. يشير هذا إلى أن النماذج قد تستخدم الجنس كطريق مختصر لتتبع من هو مَن، بدلاً من الفهم الحقيقي لأدوار وأفعال كل فرد. وعندما تمت إزالة هذا الاختصار باستخدام شخصيتين من نفس الجنس، بدا أن النماذج تعتمد أكثر على تسلسل الأحداث، وهو ما ساعدها للمفارقة في الحصول على الإجابة بشكل صحيح في كثير من الأحيان. وهذا يشير إلى أن تفكيرها ليس قوياً مثل التفكير البشري، الذي لا يعتمد على مثل هذه الإشارات السطحية لفهم الموقف.
النتيجة الجوهرية للدراسة هي أنه بينما يمكن لهذه النماذج اللغوية محاكاة الإجابات الصحيحة لاختبارات نظرية العقل، إلا أنها لا تبدو وكأنها تمتلك القدرة الكامنة على فهم الحالات الذهنية بالطريقة التي يفعلها البشر. فهي تواجه صعوبة في ربط النقاط بين ما يمكن للشخصية رؤيته، وما تعرفه، وما تعتقده. تبدو النماذج وكأنها تستخدم "الاستدلالات"، أو الاختصارات الذهنية، لتخمين الإجابة بناءً على الأنماط الأكثر شيوعاً في بيانات تدريبها. وعندما انحرفت القصة عن النمط القياسي بإضافة تفاصيل بصرية أو تغيير العلاقات المكانية، فشلت تلك الاختصارات. ويرى الباحثون أن هذا يرجع إلى أن النماذج مدربة على النصوص فقط؛ فهي لم ترَ قط لعبة تُنقل، ولم تختبر أبداً شعور البحث عن شيء ما، ولم تضطر أبداً إلى الاعتماد على عينيها لتحديث معرفتها بالعالم. وبدون هذه التجربة المتجسدة، لا يمكنها استيعاب مفهوم الاعتقاد الذي يختلف عن الواقع.
في النهاية، تعمل الدراسة كتحذير من افتراض أنه لمجرد أن الآلة يمكنها التحدث مثل البشر، فإنها تفكر مثلهم. يمكن للنماذج إنتاج إجابات تبدو وكأن لديها نظرية عقل، ولكن عند اختبارها بسيناريوهات تتطلب فهماً حقيقياً للإدراك والاعتقاد، فإنها تكشف عن حدودها. إنها ممتازة في تكرار ما قرأته، لكنها ليست قادرة بعد على التفكير المرن القائم على المنطق السليم الذي يسمح للبشر بالتنقل في العالم الاجتماعي المعقد. ومع ازدياد استخدام هذه الأدوات، من المهم تذكر أن ذكاءها الظاهري هو انعكاس للبيانات التي استهلكتها، وليس علامة على أنها طورت عقلاً خاصاً بها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.