← أحدث الأبحاث
🤖 machine learning

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

تحدد هذه الورقة "انتقال محاذاة" خفيًا في النماذج اللغوية حيث يتحول الاستنتاج والصدق من كونهما متضادين إلى كونهما متعاونين بعد تجاوز مقياس حرج، وهو تغير طوري يمكن التنبؤ به والتلاعب به من خلال التعديلات الهيكلية، وتقنيات تنقية البيانات، ووصفات التدريب دون الحاجة إلى الوصول إلى المكونات الداخلية للنموذج.

المؤلفون الأصليون: Adil Amin

نُشر 2026-05-20
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Adil Amin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "الكذب مجرد مرحلة" (Lying Is Just a Phase) باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

الفكرة الكبرى: "آلام النمو" للذكاء الاصطناعي

تخيل أنك تعلم طفلاً كيف يكون ذكياً وصادقاً في آن واحد. لفترة طويلة، اعتقد العلماء أنه كلما أعطيت الطفل مزيداً من التعليم (مزيد من "الحجم/Scale")، فإنه سيصبح ذكياً وصادقاً بشكل طبيعي معاً.

تجادل هذه الورقة بأنه بالنسبة لنماذج الذكاء الاصطناعي، ليس هذا صحيحاً دائماً. في الواقع، هناك مرحلة محددة من "آلام النمو" حيث يجعل زيادة ذكاء النموذج يجعله أسوأ في قول الحقيقة.

يسمي المؤلفون هذا بـ "ضريبة المحاذاة" (Alignment Tax). إنها تشبه العقوبة المؤقتة التي تدفعها بينما يكبر الذكاء الاصطناعي. لكن الخبر السار؟ هذا ليس قانوناً من قوانين الطبيعة، بل هو عيب في التصميم يمكن للمهندسين إصلاحه.


1. الانعطاف العكسي في الطريق

درس الباحثون 63 نموذجاً مختلفاً من 16 عائلة مختلفة. وقاسوا شيئين:

  1. الاستنتاج (Reasoning): مدى جودة حل الذكاء الاصطناعي للألغاز (مثل اختبار الرياضيات).
  2. الصدق (Truthfulness): مدى جودة تجنب الذكاء الاصطناعي لتأليف المعلومات (مثل اختبار كشف الكذب).

ما وجدوه:

  • النماذج الصغيرة (مرحلة "الضريبة"): عندما يكون الذكاء الاصطناعي صغيراً، فإن جعله أكثر ذكاءً غالباً ما يجعله أسوأ في قول الحقيقة. الأمر يشبه المراهق الذي يزداد ثقة في أفكاره الجديدة لدرجة أنه يبدأ في تأليف قصص ليبدو رائعاً. المهارات هنا تتصارع مع بعضها البعض.
  • نقطة التحول الحرجة (NcN_c): هناك حجم محدد (حوالي 3.5 مليار بارامتر لبعض النماذج) حيث يتغير هذا الوضع.
  • النماذج الكبيرة (مرحلة "المكافأة"): بمجرد أن يتجاوز الذكاء الاصطناعي هذا الحد، يتوقف الصراع. الآن، جعل الذكاء الاصطناعي أكثر ذكاءً يجعله أيضاً أكثر صدقاً. تبدأ المهارات في العمل معاً مثل آلة مشحمة جيداً.

العقبة: منحنى الخسارة (الطريقة القياسية لقياس تقدم الذكاء الاصطناعي) لا يظهر ذلك. فهو يبدو كخط سلس ومثالي يتجه للأسفل. "الصراع" بين المهارات غير مرئي للأدوات القياسية، وهو مختبئ تماماً تحت السطح.

2. الأمر لا يتعلق بالحجم؛ بل بالوصفة

قد تعتقد: "أوه، إذاً نحن فقط بحاجة لنماذج أكبر لإصلاح هذا". تقول الورقة: لا. الحجم هو مجرد مكون واحد فقط.

"ضريبة المحاذاة" هي في الواقع خيار تصميم. وجد الباحثون ثلاثة "مقابض" يمكن للمهندسين تحريكها لإصلاح المشكلة، وأحياناً حتى في النماذج الصغيرة جداً:

  • المقبض 1: بيانات أفضل (الـ "حمية المختارة"):

    • التشبيه: تخيل إطعام طفل حقائق موثقة وعالية الجودة بدلاً من شائعات الإنترنت العشوائية.
    • النتيجة: نموذج Phi (صغير جداً، 1 مليار بارامتر) الذي تم تدريبه على بيانات نظيفة للغاية، يعمل بصدق وذكاء يضاهي نموذجاً بقدر 10 مليارات بارامتر تم تدريبه على بيانات إنترنت فوضوية. تختفي "الضريبة" لأن الحمية كانت أفضل.
    • مثال: نماذج Qwen3 لا تظهر أي "ضريبة" على الإطلاق لأن بيانات تدريبها كانت منسقة بعناية.
  • المقبض 2: بنية أوسع (الـ "ممر الأوسع"):

    • التشبيه: تخيل ممرًا يحاول فيه شخصان (الاستنتاج والحقيقة) المرور عبر باب ضيق في نفس الوقت. يصطدمان ببعضهما ويتشاجران. إذا وسعت الباب، يمكنهما السير جنباً إلى جنب دون تصادم.
    • النتيجة: المشكلة ليست في "الدماغ" نفسه؛ بل في إسقاط المخرجات (output projection) (الباب النهائي الذي تمر من خلاله المعلومات). إذا جعلت هذا الباب أوسع، يتوقف الصراع، حتى لو ظل حجم النموذج كما هو.
  • المقبض 3: تغييرات في البنية:

    • التشبيه: تغيير المخطط الهندسي للمنزل.
    • النتيجة: التصميمات الأحدث (مثل Gemma-4) يمكنها تجاوز مرحلة "آلام النمو" تماماً. نموذج Gemma-4 بـ 4 مليارات بارامتر يعمل مثل نموذج من جيل قديم بقدر 13 مليار بارامتر.

3. أين يختبئ المشكل؟

نظر الباحثون داخل "دماغ" الذكاء الاصطناعي (رؤوس الانتباه - attention heads).

  • المفاجأة: داخل الدماغ، الأجزاء المسؤولة عن الاستنتاج والحقيقة هي في الواقع ودودة. إنهم يتعاونون بنسبة 95% من الوقت.
  • الاختناق الحقيقي: المشكلة تحدث في النهاية تماماً، عندما يتعين على الذكاء الاصطناعي إخراج الإجابة. الأمر يشبه مجموعة من الأصدقاء يتفقون على خطة، لكن الشخص الذي يتحدث باسم المجموعة يمتلك ميكروفوناً صغيراً جداً لا يستطيع حمل صوتين في وقت واحد. الإشارة تتعرض للضغط، فيبدو الأمر وكأنهم يتشاجرون.
  • الحل: إذا أعطيت ذلك المتحدث ميكروفوناً أكبر (طبقة مخرجات أوسع)، فسيظهر التعاون بوضوح.

4. لماذا يهمك هذا؟

  • لا تفترض أن "الأكبر هو الأفضل": إذا كنت تستخدم نموذج ذكاء اصطناعي صغير (مثل الموجود على هاتفك)، فإن مجرد تكبير حجمه قد لا يحل مشكلة ميله للكذب. قد يجعله فقط "كاذباً أكثر ذكاءً".
  • تحقق من "الاقتران" (Coupling): قبل أن تقوم بتوسيع نطاق نموذج ما، يجب أن تتحقق مما إذا كانت مهاراته تتصارع أم تتعاون.
    • إذا كانت تتصارع (اقتران سلبي): لا تكتفِ بإضافة المزيد من البيانات أو الحجم. قم بتغيير وصفة التدريب، أو وسع النموذج، أو نظف البيانات.
    • إذا كانت تتعاون (اقتران إيجابي): حينها نعم، جعلها أكبر سيساعد كلا المهارتين.
  • "الضريبة" اختيارية: تثبت الورقة أن "ضريبة المحاذاة" ليست قاعدة دائمة للكون. إنها خطأ في عملية الهندسة الحالية يمكن إصلاحه برقعة برمجية.

ملخص التشبيه

فكر في تدريب الذكاء الاصطناعي مثل بناء جسر.

  • الرؤية القديمة: مع إضافة المزيد من الفولاذ (البارامترات)، يصبح الجسر أقوى وأكثر أماناً تلقائياً.
  • الرؤية الجديدة: في منتصف عملية البناء، إضافة المزيد من الفولاذ تجعل الجسر متذبذباً لأن جانبي الجسر يسحبان في اتجاهين متعاكسين.
  • الحل: أنت لا تحتاج فقط إلى المزيد من الفولاذ؛ بل تحتاج إلى تغيير المخطط الهندسي (البنية) أو استخدام مواد أفضل (بيانات منسقة) لضمان سحب الجانبين معاً. وبمجرد عبور مرحلة البناء هذه، يصبح الجسر قوياً وآمناً للغاية.

توفر الورقة لوحة تحكم وأدوات تخبر المهندسين بالضبط في أي مرحلة يقع نموذجهم، حتى لا يضيعوا وقتهم في مجرد "زيادة الحجم" بينما ينبغي عليهم "إصلاح المخطط الهندسي".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →