← أحدث الأبحاث
💻 computer science

Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions

تقترح الورقة البحثية **Align-TI**، وهو إطار عمل جديد لتقطير المعرفة يعمل على تحسين ضغط النماذج اللغوية الكبيرة متعددة الوسائط من خلال تجاوز محاذاة الرمز التالي الثابت لالتقاط التفاعلات الديناميكية بين الرموز، وتحديداً من خلال محاذاة التعليمات البصرية (IVA) ومحاذاة احتمالية الانتقال من رمز إلى آخر (TPA).

المؤلفون الأصليون: Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang

نُشر 2026-02-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طفل صغير موهوب كيف يرسم مثل فنان عالمي مشهور.

يحاول معظم الناس تعليم الطفل ببساطة عبر عرض اللوحة النهائية عليهم وقول: "انسخ هذه الصورة تماماً". وهذا ما يسميه باحثو الذكاء الاصطناعي حالياً بـ "محاذاة الرمز التالي" (Next-Token Alignment). هذا الأسلوب يعمل بشكل جيد نوعاً ما، لكن الطفل غالباً ما يفتقد "روح" اللوحة. قد ينجح في ضبط الألوان، لكنه لا يفهم لماذا اختار الفنان ضربة فرشاة معينة أو أين كان ينظر الفنان عندما رسم تفصيلاً صغيراً في الزاوية.

تقدم هذه الورقة البحثية، "Align-TI"، طريقة أذكى بكثير للتعليم. فبدلاً من مجرد النظر إلى النتيجة النهائية، يُظهر "المعلم" (الذكاء الاصطناعي) لـ "الطالب" (الذكاء الاصطناعي) مكونين سريين: أين ينظر و كيف يفكر.

إليك كيف يعمل ذلك باستخدام تشبيهين بسيطين:

1. طريقة "تسليط الضوء" (محاذاة الرؤية المدركة للتعليمات)

تخيل أن الفنان المبدع يرسم مشهداً لشارع مزدحم. إذا سألته: "أين المظلة الحمراء؟"، ستتجه عيناه فوراً إلى تلك البقعة تحديداً. هو لا يضيع وقته في التحديق في الرصيف أو السماء.

نماذج الذكاء الاصطناعي الصغيرة الحالية "مشتتة" بعض الشيء. فعندما تحاول الإجابة على سؤال، فإنها تحدق في الصورة بأكملها بالتساوي، مما يهدر "قدرتها الذهنية" في أجزاء غير مفيدة مثل السحب في الخلفية بينما يجب أن تنظر إلى المظلة الحمراء.

تمنح Align-TI الطالب تسليط ضوء. فهي تخبر الطالب: "عندما تسأل التعليمات عن المظلة، ركز طاقتك بالضبط حيث كانت عينا الفنان تركزان". يساعد هذا النموذج الصغير على التوقف عن التشتت بـ "الضجيج البصري" والبدء في رؤية ما يهم حقاً.

2. طريقة "تدفق الأفكار" (محاذاة احتمالية الانتقال)

تخيل أنك تتعلم عزف بيانو الجاز. يمكنك دراسة ورقة الموسيقى (الإجابة النهائية)، لكن هذا لا يعلمك كيفية الارتجال. لكي تتعلم حقاً، تحتاج إلى فهم منطق الانتقال: "إذا عزفت هذه النوتة، فما هي النوتة التالية الأكثر طبيعية التي يجب أن تتبعها للحفاظ على تدفق الإيقاع؟"

تدريب الذكاء الاصطناعي القياسي يعلم فقط "النوتات النهائية". إذا ارتكب الطالب خطأً صغيراً واحداً في البداية، فإنه يضل الطريق وتنهار "الأغنية" (الجملة) بأكملها. يُسمى هذا "انحياز التعرض" (exposure bias)؛ فالطالب معتاد على اتباع نص مثالي، لكنه في العالم الحقيقي، عليه أن يتبع نوتاته الخاصة.

تعلم Align-TI إيقاع المنطق. فهي لا تقول فقط: "الكلمة التالية هي 'تفاحة'". بل تقول: "بالنظر إلى أنك قلت للتو 'أكلتُ...'، فإن التدفق المنطقي للفكر يجب أن يقودك إلى 'تفاحة' بدلاً من 'دراجة' ". ومن خلال تعليم الترابط بين الكلمات، يصبح الطالب أفضل بكثير في "التفكير بسرعة" والبقاء على المسار الصحيح، حتى لو تعثر قليلاً.

النتيجة: عملاق صغير

باستخدام هاتين الطريقتين — تسليط الضوء و تدفق الأفكار — ابتكر الباحثون نموذجاً "طالباً" صغيراً (يحتوي على 2 مليار معلمة فقط) ولكنه ذكي للغاية.

في الواقع، هو كفء لدرجة أنه يتفوق على نماذج أكبر منه بثلاث مرات! الأمر يشبه تعليم طالب في المرحلة المتوسطة لعب الشطرنج ببراعة تجعله يهزم طالباً في المرحلة الثانوية، وذلك ببساطة عبر تعليمه كيف يرى اللوحة و كيف يخطط لتحركاته، بدلاً من مجرد حفظ قائمة من الألعاب الفائزة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →