← أحدث الأبحاث
🤖 machine learning

Multi-Perspective Transformers in ARC-AGI-2 Challenge

تقدم هذه الورقة نهجاً قائماً على TinyLM معززاً بتقنيات الضبط الدقيق وقت الاختبار مثل التدريب وقت الاختبار (Test-Time-Training) وحاصل ضرب الخبراء (Products of Experts) لحل ألغاز ARC-AGI-2 البصرية، محققةً دقة بنسبة 21.7% على مجموعة التقييم.

المؤلفون الأصليون: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

نُشر 2026-05-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تسلمت سلسلة من الألغاز البصرية. كل لغز يعرض لك بضعة صور "قبل" و"بعد" لشبكات ملونة، ومهمتك هي تخمين القاعدة التي تحول الـ "قبل" إلى الـ "بعد". ثم عليك تطبيق تلك القاعدة على صورة جديدة لم ترها من قبل. هذا هو تحدي ARC-AGI-2، وهو اختبار صُمم ليرى ما إذا كان بإمكان الكمبيوتر أن يفكر مثل البشر: يتعلم من أمثلة قليلة جداً ويتكيف مع المواقف الجديدة فوراً.

إليك كيف اتبع الفريق (كالب، سون، ويون، فاريها، فيدانت، وشينيو) هذا النهج، مشروحاً ببساة.

استراتيجية الفريق: نهج "العيون المتعددة"

بدلاً من مجرد النظر إلى اللغز مرة واحدة، بنى الفريق نظاماً ينظر إلى اللغم من زوايا مختلفة. فكر في الأمر كأنك تحاول حل لغز من خلال طلب خمسة أشخاص مختلفين لوصف مسرح جريمة واحد، ولكن كل شخص ينظر إليه من نافذة مختلفة، أو يرفع مرآة أمامه.

  1. المترجم (الترميز - Tokenization): أولاً، يقوم الكمبيوتر بترجمة الشبكة الملونة إلى سلسلة نصية بسيطة، مثل وصفة طعام. يقول أشياء مثل "ابدأ من هنا، العرض هو 5، الارتفاع هو 5، واللون هو الأحمر".
  2. مغيرو الأشكال (تعزيز البيانات - Data Augmentation): يأخذ النظام ذلك اللغز ويصنع عشرات "المشاهد" منه. يقوم بتدوير الشبكة، وقلبها مثل الفطيرة، وتبديل الألوان (مثل تحويل كل الألوان الحمراء إلى زرقاء)، وتغيير ترتيب الصفوف والأعمدة (transpose). الهدف هو العثور على نسخة من اللغز تكون فيها القاعدة الخفية واضحة للكمبيوتر.
  3. الدماغ الصغير (TinyLM): استخدموا نموذج ذكاء اصطنا-عي صغير وفعال يسمى TinyLM. فكر في هذا كطالب ذكي ولكن مدمج، لم يحفظ كل ألغاز العالم، ولكنه بارع جداً في رصد الأنماط بسرعة.
  4. "نتاج الخبراء" (PoE): هذا هو نظام التصويت الخاص بهم. ينظر النموذج إلى كل تلك "المشاهد" المختلفة للغز. إذا كان النموذج واثقاً من إجابته عبر جميع تلك المشاهد المختلفة (المُدوّرة، والمقلوبة، والمبدلة الألوان)، فإن تلك الإجابة تحصل على درجة عالية. إنه يشبه هيئة محلفين حيث لا يُقبل الحكم إلا إذا اتفق جميع المحلفين على ذلك.
  5. الدراسة السريعة (التدريب وقت الاختبار - Test-Time Training): قبل حل لغز معين، يحصل النموذج على "دورة مكثفة" سريعة للغاية باستخدام الأمثلة القليلة المقدمة في ذلك اللغز تحديداً. إنه مثل طباخ يتذوق الصلصة قبل تقديمها مباشرة ويضيف رشة ملح لتناسب الطبق المحدد، بدلاً من الاعتماد على وصفة عامة.

النتائج: حكاية مجموعتين

اختبر الفريق نظامهم على مجموعتين من الألغاز:

  • مجموعة التدريب (Practice Set): وهي الألغاز التي رآها النموذج أثناء "دورته المكثفة".
  • الامتحان النهائي (Evaluation): وهي ألغاز جديدة تماماً لم يرها النموذج من قبل.

بطاقة النتائج:

  • على مجموعة التدريب: كان النموذج نجماً خارقاً، حيث حقق نسبة 96.1% صحيحة. لقد أتقن القواعد التي عُرضت عليه.
  • على الامتحان النهائي: انخفضت النتيجة إلى 21.7%.

ما الذي حدث خطأ؟ (مشكلة "الفرط في التخصيص" - Overfitting)

يشرح البحث أن طريقة "الدراسة السريعة" (التدريب وقت الاختبار) جعلت الأمور أسوأ في الامتحان النهائي.

تخيل أنك تذاكر لاختبار رياضيات عن طريق حفظ الأرقام المحددة في واجباتك المنزلية. عندما يأتي الاختبار، تكون الأرقات مختلفة، لكن المنطق هو نفسه. ولأن النموذج درس بجد على أرقام الواجبات المنزلية المحددة، فقد ارتبك عندما تغيرت أرقام الاختبار. لقد وقع في فخ "الفرط في التخصيص"؛ حيث حفظ أمثلة التدريب بشكل مثالي للغاية ولم يستطع التكيف مع الأمثلة الجديدة.

وبالمثل، لم تنجح استراتيجية "العيون المتعددة" (PoE) كما كان مأمولاً لأن النموذج تم تدريبه أساساً على قراءة الألغاز بترتيب محدد (صفاً بصف). وعندما حاول النظام النظر إلى الألغاز من زوايا مختلفة (مثل عموداً بعمود)، لم يفهم النموذج المنظور الجديد، مما جعل تلك المشاهد الإضافية عديمة الفائدة.

الخلاصة

بنى الفريق نظاماً ذكياً يستخدم منظورات متعددة والتعلم السريع لحل الألغاز البصرية. وقد أثبت قدرته على تعلم قواعد الألغاز التي تدرب عليها بشكل شبه مثالي. ومع ذلك، فقد عانى في تطبيق تلك القواعد على ألغاز جديدة تماماً لم يسبق له رؤيتها.

يخلص البحث إلى أنه بينما تعتبر حيل "الدراسة السريعة" و"العيون المتعددة" مثيرة للاهتمام، إلا أن النموذج يحتاج إلى أن يكون أكبر، وأن يتم تدريبه على أمثلة أكثر تنوعاً، وأن يُعلّم كيفية تعلم المنطق الخاص بالألغاز بدلاً من مجرد حفظ أمثلة التدريب المحددة. إنهم لم يحلوا الجزء الأصعب من التحدي بعد، لكنهم بنوا أساساً متيناً لفهم كيف يمكن لنماذج الذكاء الاصطناعي الصغيرة أن تحاول التفكير والاستنتاج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →