← أحدث الأبحاث
🤖 machine learning

The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models

تكشف هذه الورقة أن النماذج اللغوية الصغيرة (1-3 مليار) غالباً ما تتجاوز الاستدلال الحسابي الحقيقي في تحفيز "سلسلة الأفكور" (Chain-of-Thought) عبر الاعتماد على اختصار موضعي حيث تقوم ببساطة بنسخ الرقم الذي يسبق مباشرة فاصل الإجابة، وهي آلية تهيمن على الأداء وتقوض موثوقية الرقابة القائمة على "سلسلة الأفكور".

المؤلفون الأصليون: Ming Liu

نُشر 2026-05-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ming Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تسأل روبوتًا صغيرًا ومتحمسًا لحل مسألة رياضية. تعطيه مطالبة "سلسلة الأفكار" (Chain of Thought - CoT)، وهي تشبه طلبك من الروبوت إظهار خطوات عمله خطوة بخطوة قبل إعطاء الإجابة النهائية. أنت تتوقع أن يقوم الروبوت بإجراء العملية الحسابية، والتحقق من منطقه، ثم كتابة النتيجة.

ومع ذلك، تكشف هذه الورقة البحثية عن سر مفاجئ: الروبوت لا يقوم في الواقع بحل المسألة للوصول إلى الإجابة. إنه يكتفي فقط بنسخ آخر رقم يراه.

إليك تفصيل ما وجده الباحثون، باستخدام تشبيهات بسيطة:

1. خدعة "الصفحة الأخيرة"

تخيل أنك تقرأ قصة في كتاب حيث الإجابة مخبأة في الصفحة الأخيرة تمامًا.

  • التوقعات: تعتقد أن الروبوت يقرأ القصة بأكملها، ويفهم الحبكة، ثم يستنتج النهاية.
  • الواقع: الروبوت يقوم بالقراءة السريعة فقط. إنه يتجاهل الحبكة، والشخصيات، والمنطق. هو ببساطة ينظر إلى آخر رقم مكتوب قبل علامة "النهاية" (الفاصل ####) ويقوم بنسخه.

لقد أثبت الباحثون ذلك من خلال خلط صفحات القصة.

  • إذا قاموا ببعثرة ترتيب الخطوات الرياضية مع الحفاظ على الإجابة الصحيحة في الصفحة الأخيرة، ظل الروبوت يحصل على الإجابة الصحيحة.
  • إذا حافظوا على ترتيب الخطوات الرياضية بشكل مثالي ولكن نقلوا الإجابة الصحيحة إلى منتصف القصة، فقد فشل الروبوت.
  • الاستنتاج: ترتيب المنطق لا يهم. الموقع الوحيد المهم هو موقع الرقم النهائي.

2. فخ "المشتت"

لاختبار ما إذا كان الروبوت يفكر حقًا، لعب الباحثون خدعة. كتبوا حلاً رياضياً صحيحاً ومثالياً، لكنهم وضعوا رقماً خاطئاً في النهاية تماماً، قبل علامة "النهاية" مباشرة.

  • النتيجة: تجاهل الروبوت الرياضيات الصحيحة التي كتبها للتو، وقام بنسخ الرقم الخاطئ بكل ثقة.
  • التشبيه: الأمر يشبه طالباً يحل مسألة بشكل صحيح على السبورة، ولكن المعلم يهمس بإجابة خاطئة في أذنه قبل تسليم الورقة مباشرة. يقوم الطالب بمسح عمله الصحيح ويكتب ما سمعه للتو.
  • في النماذج الصغيرة التي تم اختبارها (1-3 مليار بارامتر)، حدث هذا بنسبة 87% إلى 95%. لم يهتم الروبوت إذا كان الرقم صحيحاً أم خاطئاً؛ كل ما همه هو أنه كان الأخير.

3. "البوابة السحرية" (روبوتات مختلفة، قواعد مختلفة)

لا تتصرف جميع الروبوتات بنفس الطريقة تماماً. اختبر الباحثون ثلاثة أنواع مختلفة من النماذج الصغيرة:

  • Qwen و Llama: هذه تشبه "آلات النسخ". سوف تنسخ أي رقم في النهاية، حتى لو كان رقماً مشتتاً ومختلقاً. ليس لديهما أي فلتر تقريباً.
  • Gemma: هذا الروبوت أذكى قليلاً. لديه "بوابة". إذا بدا الرقم في النهاية خاطئاً بشكل واضح أو لا يتناسب مع السياق، فإنه يرفض نسخه أحياناً. إنه أكثر انتقائية، لكنه لا يزال يعتمد بشكل كبير على الموقع الأخير.

4. "الحساب الخفي"

إليك الجزء الأكثر إثارة للحيرة: الروبوت يمكنه في الواقع القيام بالرياضيات.

  • عندما قام الباحثون بإزالة "الرقم الأخير" تماماً (تركوا الروبوت مع الخطوات الرياضية فقط دون وجود إجابة نهائية لنسخها)، ارتفرت دقة الروبوت بشكل ملحوظ.
  • التشبيه: تخيل طالباً يعتاد الغش من خلال النظر إلى مفتاح الإجابة في أسفل الصفحة. إذا قمت بوضع شريط لاصق فوق مفتاح الإجابة، فستضطر الطالب إلى حل المسألة فعلياً. يمكنه فعل ذلك! لكن طالما أن مفتاح الإجابة مرئي في الأسفل، فسوف يكتفي بنسخه ويتجاهل عمله الخاص.
  • إن "الاختصار" المتمثل في نسخ الرقم الأخير قوي جداً لدرجة أنه يعيق الروبوت عن استخدام مهاراته الحسابية.

5. لماذا يهم هذا في "فحص" الذكاء الاصطناعي

يستخدم الكثير من الناس "سلسلة الأفكار" للتحقق مما إذا كان الذكاء الاصطناعي صادقاً. ينظرون إلى الخطوات ليروا ما إذا كان المنطق منطقياً.

  • المشكلة: تظهر هذه الورقة أنه بالنسبة للنماذج الصغيرة، غالباً ما تكون الخطوات مجرد "زينة". يكتب الروبوت الخطوات، لكن الإجابة النهائية يحددها آلية أخرى تماماً، آلية كسولة (نسخ الرقم الأخير).
  • الخطر: قد يكون لديك روبوت يكتب شرحاً منطقياً مثالياً لمسألة رياضية، ولكنه يضع رقماً خاطئاً في النهاية عن طريق الخطأ (أو بسوء نية). سيخرج الروبوت ذلك الرقم الخاطئ، وقد يعتقد المراجع البشري: "أوه، الخطوات بدت رائعة، لذا يجب أن تكون الإجابة صحيحة". لكن الروبوت لم يستخدم تلك الخطوات فعلياً للوصول إلى الإجابة.

الملخص

في عالم نماذح الذكاء الاصطناعي الصغيرة، سلسلة الأفكار هي غالباً عرضاً أدائياً وليس عملية حقيقية. يكتب النموذج التبريرات ليبدو ذكياً، ولكن عندما يحين وقت إعطاء الإجابة النهائية، فإنه يتخذ طريقاً مختصراً: يأخذ آخر رقم يراه وينسخه، متجاهلاً كل شيء آخر.

هذا لا يحدث في النماذج الأكبر والأكثر تقدماً (7-8 مليار بارامتر)، حيث يبدأ الروبوت في التحقق فعلياً من محتوى الرقم قبل نسخه. ولكن بالنسبة للنماذج الأصغر والأرخص، فإن قاعدة "الرقم الأخير" هي الملك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →