← أحدث الأبحاث
💬 NLP

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

تقدم الورقة البحثية "سلسلة التفكير المعرفي" (CoCoT)، وهي إطار عمل استدلالي مهيكل يعمل على تفكيك المهام الاجتماعية متعددة الوسائط إلى مراحل الإدراك، والموقف، والمعيار، مما يُظهر تحسينات مستمرة في الأداء والقدرة على استيعاب أنماط الاستدلال المهيكلة من خلال الضبط الدقيق الخاضع للإشراف.

المؤلفون الأصليون: Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

نُشر 2026-04-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول فهم نكتة مضحكة ولكنها مربكة أخبرك بها صديق في حفلة. أنت ترى وجهه، وتسمع نبرة صوته، وترى الغرفة الفوضوية من حوله. لكي تفهم النكتة، لا يمكنك فقط النظر إلى الحقائق؛ بل يجب عليك اكتشاف لماذا يقولها وماذا تعني اجتماعياً.

نماذج الذكاء الاصطيائي الحالية (مثل روبوتات الدردشة الذكية التي قد تعرفها) بارعة في الرياضيات أو كتابة الأكواد البرمجية، ولكن عندما يتعلق الأمر بهذه المواقف الاجتماعية المعقدة، فإنها غالباً ما تضل الطريق. قد تنظر إلى صورة وتقول: "هذا الشخص يمسك كوباً"، ولكنها تقفز مباشرة إلى استنتاج مثل: "إنه غاضب"، دون شرح كيف وصلت إلى ذلك. الأمر يشبه تخمين نهاية فيلم بعد رؤية الإطار الأول فقط.

تقدم هذه الورقة طريقة جديدة لتعليم الذكاء الاصطناعي كيفية "التفكير" في المشاهد الاجتماعية، تسمى COCOT (سلسلة التفكير المعرفي).

المشكلة: الذكاء الاصطناعي الذي "يقفز إلى الاستنتاجات"

فكر في الذكاء الاصطناعي القياسي كطالب يحاول حل مسألة رياضية عن طريق تخمين الإجابة فوراً. إذا كانت المسألة بسيطة، فقد يحالفه الحظ. ولكن إذا كانت المسألة معقدة (مثل فهم موقف اجتماعي محرج)، فغالباً ما يؤلف قصة تبدو منطقية ولكنها خاطئة لأنه تخطى الخطوات.

في العالم الحقيقي، نحن لا نفعل ذلك. نحن لا نرى صورة ونعرف المعنى الاجتماعي فوراً. نحن نمر بعملية ذهنية:

  1. ماذا أرى؟ (الحقائق)
  2. ماذا يحدث؟ (القصة)
  3. ماذا يعني هذا؟ (القاعدة الاجتماعية)

الحل: "المحقق ذو الثلاث خطوات" (COCOT)

ابتكر المؤلفون إطار عمل يجبر الذكاء الاصطناعي على التصرف كمحقق دقيق، حيث يقسم عملية التفكير إلى ثلاث مراحل متميزة. هم يسمونها COCOT.

إليك كيف يعمل ذلك، باستخدام تشبيه بسيط: "ناقد المطعم".

تخيل أن ذكاءً اصطناعياً يحاول تحديد ما إذا كان المطعم جيداً بناءً على صورة لطاولة.

المرحلة 1: الإدراك (الكاميرا)

  • القاعدة: "صف فقط ما تراه عيناك. لا تخمن بعد."
  • التشبيه: تخيل كاميرا مراقبة تسجل المشهد. إنها ترى كأساً من النبيذ مسكوباً، ونادلاً يبدو متوتراً، وزبوناً بملامح عابسة.
  • ما يفعله الذكاء الاصطناعي: يسرد الحقائق: "هناك سائل أحمر على المفرش الأبيض. النادل يمسك بمنديل. حاجب الزبون مقطب".
  • لماذا يساعد هذا: إنه يمنع الذكاء الاصطناعي من الهلوسة (اختلاق أشياء) مثل "الزبون غاضب" قبل أن ينظر حتى إلى الأدلة.

المرحلة 2: الموقف (الراوي)

  • القاعدة: "الآن، اربط النقاط ببعضها. ما هي القصة التي ترويها هذه الحقائق؟"
  • التشبيه: الآن، يعمل الذكاء الاصطناعي كمحقق يربط بين الأدلة. "النبيذ مسكوب، والنادل يهرع للتنظيف، والزبون يبدو منزعجاً. هذا ليس مجرد فوضى؛ إنه حادث وقع للتو".
  • ما يفعله الذكاء الاصطناعي: يبني سياقاً: "من المرجح أن النادل قد أسقط الكأس، والزبون يشعر بالإحباط لأن عشاءه قد انقطع".
  • لماذا يساعد هذا: إنه يسد الفجوة بين الحقائق الخام والمعنى البشري.

المرحلة 3: المعيار (القاضي)

  • القاعدة: "بناءً على القصة، ما هو الشيء الصحيح اجتماعياً للقيام به أو قوله؟"
  • التشبيه: الآن، يعمل الذكاء الاصطناعي كقاضٍ يطبق القواعد الاجتماعية. "في مجتمعنا، عندما يرتكب النادل خطأً، فإن الشيء المهذب هو الاعتذار، وليس تجاهل الأمر. عبوس الزبون هو إشارة إلى أنه يتوقع اعتذاراً".
  • ما يفعله الذكاء الاصطناعي: يستنتج: "أفضل استجابة هي أن يعتذر النادل ويعرض مشروباً جديداً".
  • لماذا يساعد هذا: يضمن أن الإجابة النهائية للذكاء الاصطناعي تتوافق مع كيفية تصرف البشر فعلياً.

لماذا يهم هذا؟

اختبرت الورقة طريقة "المحقق ذو الثلاث خطوات" هذه في مهام عديدة مختلفة:

  • فهم المعاني الخفية: مثل فهم متى يكون الشخص ساخراً.
  • قراءة العقول (نظرية العقل): تخمين ما يفكر فيه شخص ما في فيديو بناءً على لغة جسده.
  • السلامة: تحديد ما إذا كان الطلب خطيراً (مثلاً: "كيف أصنع قنبلة؟" مقابل "كيف أصنع كعكة؟").

النتائج:
عندما استخدم الذكاء الاصطناعي هذه الطريقة المنظمة، أصبح أفضل بشكل ملحوظ في هذه المهام.

  • الدقة: حصل على إجابات صحيحة أكثر بنسبة 5-6% في المتوسط.
  • السلامة: كان أفضل بكثير في رفض الطلبات الخطيرة لأنه "رأى" بالفعل الخطر في الصورة قبل الإجابة.
  • التعلم: حتى عندما توقف الباحثون عن إعطاء تعليمات "الخطوات الثلاث" للذكاء الاصطناعي وطلبوا منه الإجابة بشكل طبيعي، ظل أداؤه أفضل. هذا يعني أن الذكاء الاصطناعي تعلم حقاً كيف يفكر بهذه الطريقة، وليس فقط كيف يتبع التعليمات.

الصورة الكبيرة

فكر في استدلال الذكاء الاصطناعي القياسي كـ سباق سريع: يحاول الركض بأسرع ما يمكن للوصول إلى الإجابة، وغالباً ما يتعثر في قدميه.
أما COCOT فهو مثل خطة تدريب للماراثون: يجبر الذكاء الاصطناعي على التوقف، والتحقق من ثبات قدميه (الإدراك)، والنظر إلى الخريطة (الموقف)، ثم الركض بهدف واضح (المعيار).

من خلال تعليم الذكاء الاصطناعي التمهل وهيكلة أفكاره كما يفعل البشر، نحصل على آلات ليست فقط أكثر ذكاءً، بل أيضاً أكثر أماناً وسهولة في الفهم. إنها تتوقف عن تأليف القصص وتبدأ في قول الحقيقة عما تراه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →