← أحدث الأبحاث
🤖 AI

Representation Without Control: Testing the Realization Effect in Language Models

تُظهر هذه الورقة أنه في حين تُبدي النماذج اللغوية الكبيرة تحولات سلوكية حساسة للمطالبات وتمتلك تمثيلات داخلية قابلة للفك الخطي لـ "أثر التحقق"، فإن العجز عن توجيه هذه التمثيلات سببيًا لتغيير قرارات اتخاذ المخاطر يكشف أن القراءات الكامنة لا تشير بالضرورة إلى الاعتماد الحقيقي على تلك التمثيلات في عملية اتخاذ القرار اللاحقة.

المؤلفون الأصليون: Ciarán Walsh, Emilio Barkett

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ciarán Walsh, Emilio Barkett

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا ذكيًا جدًا، وثرثارًا جدًا، يمكنه التظاهر بأنه بشر. تسأله أسئلة عن المال، والقمار، والمخاطرة، آملًا أن يتصرف كإنسان يتخذ خيارات حقيقية في الحياة. لكن السؤال الكبير هو: هل "يفكر" الروبوت حقًا مثل البشر، أم أنه بارع فقط في تخمين الكلمات التي يجب قولها بناءً على كيفية طرحك للسؤال؟

هذه الورقة البحثية تضع هذا الروبوت تحت الاختبار باستخدام خدعة نفسية شهيرة تسمى "تأثير الإدراك" (Realization Effect).

الإعداد: المحفظة "المفتوحة مقابل المغلقة"

في الحياة الواقعية، يتصرف البشر بشكل مختلف اعتمادًا على ما إذا كان الربح أو الخسارة "مفتوحًا" (ورقيًا) أو "مغلقًا" (مُحقَّقًا).

  • الورقي (المفتوح): تخيل أنك ربحت 50 دولارًا من تذكرة كشط ولكنك لم تصرفها بعد. قد تشعر وكأنك لا تزال "داخل اللعبة" وقد تأخذ مخاطرات أكبر لمضاعفة أموالك.
  • المُحقَّق (المغلق): تخيل أنك صرفت تلك الـ 50 دولارًا، ووضعتها في جيبك، ثم خسرتها. قد تشعر أن تلك الأموال قد ضاعت بالفعل وتصبح أكثر حذرًا.

سأل الباحثون: هل يعرف الذكاء الاصطناعي الفرق بين المحفظة "المفتوحة" والمحفظة "المغلقة"، وهل يغير سلوكه فعليًا بسبب ذلك؟

اختبروا الذكاء الاصطناعي بثلاث طرق، مثل فحص مشتبه به عند ثلاثة مستويات مختلفة من التحقيق الشرطي.

المستوى 1: اختبار "التمثيل" (السلوك)

أولاً، اكتفوا بسؤال الذكاء الاصطناً الإجابة على الأسئلة.

  • النتيجة: غيّر الذكاء الاصطناعي إجاباته بناءً على ما إذا كانت القصة تقول إن المال "مفتوح" أو "مغلق". لقد كان حساسًا للكلمات.
  • الفخ: لكنه لم يتصرف مثل إنسان حقيقي. عندما يخسر البشر المال في حساب "مفتوح"، يصبحون متهورين. وعندما خسر الذكاء الاصطناعي المال في حساب "مفتوح"، لم يصبح متهورًا بنفس الطريقة. لقد كان مجرد محاكٍ لـ شكل الإجابة، وليس لـ المنطق الكامن وراءها.

المستوى 2: اختبار "الأشعة السينية" (قراءة الدماغ)

بعد ذلك، نظر الباحثون داخل "دماغ" الذكاء الاصطناعي (طبقاته الرياضية الداخلية) ليروا ما إذا كان لديه مفهوم "المفتوح مقابل المغلق" مخزنًا هناك بالفعل.

  • النتيجة: وجدوا ذلك! في طبقة معينة (الطبقة 18) من الذكاء الاصطناعي، كانت هناك إشارة واضحة وقابلة للقراءة. إذا نظرت إلى الرياضيات، يمكنك معرفة أي المطالبات كانت "مفتوحة" وأيها كانت "مغلقة".
  • الاستعارة: الأمر يشبه العثور على مفتاح ضوء في منزل ومكتوب عليه بوضوح "ضوء المطبخ". يمكنك رؤية المفتاح، وتعرف أنه متصل بالمطبخ.

المستوى 3: اختبار "جهاز التحكم عن بعد" (التحكم السببي)

هذا هو الجزء الأهم. إذا كان الذكاء الاصطناعي "يفهم" المفهوم حقًا، فيجب أن نكون قادرين على قلب ذلك المفتاح الداخلي وإجباره على تغيير رأيه.

  • التجربة: استخدم الباحثون "جهاز تحكم عن بعد" (توجيه التنشيط) لقلب مفتاح "المفتوح مقابل المغلق" يدويًا داخل دماغ الذكاء الاصطناعي أثناء إجابته على الأسئلة. حاولوا إجباره على التصرف كما لو كان لديه محفظة "مفتوحة" أو محفظة "مغلقة".
  • النتيجة: لم يحدث شيء. على الرغم من أنهم استطاعوا رؤية المفتاح وقلبه، إلا أن قرارات الذكاء الاصطناعي النهائية بشأن القمار والمخاطرة لم تتغير.
  • الاستعارة: الأمر يشبه العث Undfinding مفتاح ضوء مكتوب عليه "ضوء المطبخ"، وقلبه تشغيلًا وإيقافًا، ثم إدراك أن ضوء المطبخ لا يعمل. المفتاح موجود، لكنه ليس متصلًا بالمصباح في الواقع. إنه مجرد زينة.

الاستنتاج الكبير

خلصت الورقة البحثية إلى أن مجرد قدرة الذكاء الاصطناعي على قول الكلمات الصحيحة (المستوى 1) وامتلاكه "مفتاحًا" قابلًا للقراءة داخل دماغه (المستوى 2)، لا يعني أن هذا المفتاح يتحكم فعليًا في أفعاله (المستوى 3).

  • "تأثير الإدراك" لدى البشر هو آلية سببية عميقة: الطريقة التي نشعر بها تجاه المال تغير طريقة مقامرتنا.
  • "تأثير الإدراك" في هذا الذكاء الاصطناعي كان مجرد نمط سطحي. لاحظ الذكاء الاصطناعي كلمات "مفتوح" و"مغلق" وعدّل مفرداته، لكنه لم يستخدم ذلك المفهوم فعليًا لاتخاذ قراره النهائي.

الخلاصة:
لا تفترض أن الذكاء الاصطناعي "يفكر" مثل البشر لمجرد أنه يعطي إجابات تشبه إجابات البشر. قد يكون مجرد ممثل بارع جدًا. لإثبات أنه "يفكر" حقًا، عليك أن تثبت أنه يمكنك الوصول إلى الداخل، وقلب مفتاح، وجعله يفعل شيئًا مختلفًا. في هذه الحالة، حاول الباحثون قلب المفتاح، ولم يتزحزح الذكاء الاصطناعي.

باخت-اختصار: لدى الذكاء الاصطناعي الكلمات للمفهوم، ولديه الإشارة الداخلية للمفهوم، لكن ليس لديه السيطرة على سلوكه. الإشارة موجودة، لكنها لا تقوم بأي عمل حقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →