Extremely coarse learning objectives induce human-aligned representations in AI vision models
تُظهر هذه الدراسة أن تدريب نماذج الرؤية الاصطناعية باستخدام أهداف تعلم خشنة للغاية، مثل التمييز بين ثماني فئات عريضة فقط، يُنتج تمثيلات داخلية تتوافق مع الاستجابات العصبية والأحكام الإدراكية البشرية بشكل وثيق أكثر من النماذج المدربة على مهام دقيقة أو مهام التعلم الذاتي.
على مدى عقود، حاول العلماء فهم كيفية تحويل الدماغ البشري لفيض من الضوء إلى صورة واضحة للعالم. لقد اشتبهوا طويلاً في أن الإجابة تكمن في الطريقة التي ينظم بها نظامنا البصري المعلومات، حيث يصنف فوضى الطبيعة إلى فئات مرتبة مثل "حيوان"، أو "أداة"، أو "مركبة". ولاختبار هذه الأفكار، بنى الباحثون أنظمة ذكاء اصطناعي تحاكي بنية الدماغ، ودربوها على التعرف على آلاف الأشياء المحددة. وقد أصبحت هذه الأدمغة الرقمية أدوات قوية، لكن ظل هناك سؤال عالق: هل يحتاج الدماغ حقاً إلى تعلم هذا العدد الهائل من التسميات المحددة لبناء فهم يشبه الفهم البشري للرؤية؟ ربما لا يكمن السر في الرؤية كالبشر في حفظ موسوعة ضخمة من الأشياء، بل في تعلم طريقة أبسط وأشمل لتصنيف العالم.
لقد شرع فريق من الباحثين في جامعة جونز هوبكنز في اختبار هذا الاحتمال عبر تجريد التدريب القياسي للذكاء الاصطناعي من التعقيد. فبدلاً من تعليم شبكاتهم الاصطناعية التمييز بين ألف فئة مختلفة من الصور، كما هو متبع في الممارسة الشائعة، علموها فرز نفس الصور في عدد قليل جداً من المجموعات الواسعة للغاية. ولم يستخدموا تسميات بشرية لهذه المجموعات؛ بل تركوا الكمبيوتر يجد تقسيماته الطبيعية الخاصة داخل البيانات، مما خلق فئات قد تفصل بين "الكائنات الحية" و"الآلات" أو "المشاهد الداخلية" و"المشاهد الخارجية". ثم قاموا بتدريب مئات من هذه الشبكات، مع تغيير عدد المجموعات من اثنتين فقط وصولاً إلى أربع وستين مجموعة، وقارنوا مدى جودة مطابقة هذه الأدمغة الرقمية للنشاط الفعلي للدماغ البشري وسلوك المراقبين البشر.
كانت النتائج مفاجئة. فقد وجد الباحثون أن الشبكات التي تدربت على هذه الفئات الخشنة والبسيطة للغاية طورت خرائط داخلية للعالم المرئي كانت بجودة مماثلة، بل وأفضل في كثير من الأحيان، من الشبكات المدربة على الألف فئة كاملة في مطابقتها لنشاط الدماغ البشري. وعندما قاسوا مدى توافق هذه الأدمغة الاصطناعية مع عمليات مسح القشرة البصرية البشرية وتسجيلات من أدمغة قرود المكاك، وجدت النماذج التي تدربت على ثماني مجموعات واسعة فقط أنها تضاهي أكثر النماذج تعقيداً. والأكثر إثارة للدهشة هو أن هذه الشبكات البسيطة طابقت أحكام البشر حول تشابه الأشياء ببعضها البعض بشكل أفضل من أي نموذج آخر تم اختباره، بما في ذلك أكثر أنظمة الذكاء الاصطناعي تقدماً المتاحة اليوم.
يتحدى هذا الاكتشاف الفكرة السائدة القائلة بأنه لبناء آلة ترى كالبشر، يجب تدريبها على قائمة ضخمة ومفصلة من أسماء الأشياء المحددة. وتشير الدراسة إلى أن النظام البصري البشري قد لا يتطلب مهمة تصنيف دقيقة تتضمن ألف فئة لتطوير فهمه المتطور للعالم. بدلاً من ذلك، يبدو أن القدرة على تجميع الصور في مجموعات واسعة وذات مغزى كافية لتوليد تمثيل للرؤية يحاكي رؤيتنا. وقد أثبت الباحثون أن هذا التأثير يظل قائماً عبر أنواع مختلفة من بنيات الشبكات العصبية، من التصاميم القديمة والأبسط إلى الأنظمة الحديثة والمعقدة، كما أنه يعمل حتى عندما تكون بيانات التدريب محدودة.
استكشف الفريق أيضاً ما إذا كانت الطريقة المحددة التي أنشأوا بها هذه الفئات الواسعة ذات أهمية. ووجدوا أن النتائج ظلت ثابتة سواء كانت الفئات مشتقة من الأنماط الإحصائية للصور نفسها أو محددة بمفاهيم واضحة ومفهومة بشرياً مثل "طبيعي مقابل اصطناعي" أو "صغير مقابل كبير". وهذا يشير إلى أن العامل الرئيسي هو خشونة هدف التعلم نفسه، وليس التسميات المستخدمة. كما أظهرت الدراسة أن هذه الشبكات المدربة تدريباً خشناً لم تتعلم ببساطة نسخة مبسطة مما تتعلمه الشبكة المعقدة؛ بل طورت طريقة مختلفة جوهرياً لتنظيم المعلومات المرئية، وهي طريقة صادفت أنها تتوافق بشكل وثيق مع الإدراك البشري.
من خلال إظهار أن هدفاً تعليمياً بسيطاً بشكل مدهش يمكن أن ينتج رؤية متوافقة مع البشر، تعيد هذه الدراسة صياغة فهمنا لما هو ضروري لكي ترى الآلة. إنها تشير إلى أن الطريق نحو ذكاء اصطناعي يحاكي الإدراك البشري حقاً قد لا يكمن في تغذيته بمزيد من البيانات أو المهام الأكثر تعقيداً، بل في تعليمه رؤية العالم بمصطلحات أوسع وأكثر جوهرية. وتفتح هذه النتائج مساراً جديداً لبناء أنظمة ذكاء اصطناعي ليست قوية فحسب، بل متوافقة حقاً مع الطريقة التي يدرك بها البشر تجربتهم البصرية وينظمونها.
ملخص تقني: أهداف التعلم شديدة الخشونة تحفز التمثيلات المتوافقة مع البشر في نماذج الرؤية الاصطناعية
بيان المشكلة بينما أظهرت الشبكات العصبية العميقة المدربة على مهام بصرية دقيقة التفاصيل (مثل تصنيف 1,000 فئة في ImageNet) أنها تطور تمثيلات داخلية تشبه المجرى البصري البطني لدى الرئيسيات، يظل هناك سؤال جوهري لم يُفحص بعد: ما مدى تعقيد هدف التحسين اللازم لإنتاج تمثيلات تشبه الدماغ؟ لقد تبنت الأبحاث السابقة بشكل تدريجي إشارات تعلم أكثر دقة، بدءاً من تصنيف الأشياء وصولاً إلى أهداف التباين ذاتية الإشراف التي تميز بين الصور الفردية. ومع ذلك، لا يوجد دليل كافٍ على أن النظام البصري البيولوجي يعتمد على إشراف دقيق مماثل أثناء النمو؛ إذ غالباً ما يسير التصنيف المبكر وفق تميزات خشنة (مثل: كائن حي مقابل جماد) قبل الانتقال إلى تحديد المستويات الفرعية. تتقصى هذه الدراسة ما إذا كان التدريب على تميزات فئوية خشنة للغاية كافياً لتحفيز تمثيلات تتوافق مع الرؤية البشرية، أم أن الإشراف دقيق التفاصيل ضروري بشكل صارم.
المنهجية طوّر المؤلفون إطار عمل يعتمد على البيانات، وهو محايد للنماذج (modality-agnostic)، لتغيير درجة دقة إشارة التعلم بشكل منهجي مع التحكم في جميع متغيرات التدريب الأخرى.
توليد الملصقات الخشنة: بدلاً من استخدام التوصيفات اليدوية أو التسلسلات الهرمية الدلالية المحددة مسبقاً (مثل WordNet)، استمد المؤلفون ملصقات الفئات الخشنة مباشرة من البنية الإحصائية للمدخلات البصرية باستخدام شبكات عصبية مدربة مسبقاً. قاموا باستخراج تمثيلات الميزات لصور ImageNet من النماذج المصدرية (مثل CLIP، وAlexNet، وViT، وDINOv3) وحسبوا المكونات الرئيسية (PCs) لفضاءات التمثيل هذه.
تم توليد الملصقات عن طريق تقسيم مجموعة الصور عبر تقسيمات الوسيط (median splits) على طول أول n من المكونات الرئيسية.
ينتج عن ذلك تسلسل هرمي متداخل من الفئات: فئتان (PC1)، 4 فئات (PC1+PC2)، 8 فئات، وصولاً إلى 64 فئة.
يضمن هذا النهج أن تكون الفئات مشتقة من المحاور المهيمنة للتباين في إحصاءات الصور الطبيعية دون تدخل يدوي.
نظام التدريب: تم تدريب مئات الشبكات العصبية من الصفر على مجموعة بيانات ImageNet. وقد قام الباحثون بتغيير عدد فئات التدريب فقط (K∈{2,4,8,16,32,64}) مع تثبيت البنى (أنماط AlexNet، وResNet-50، وConvNeXt، وViT)، والمعلمات الفائقة، وتعزيزات البيانات، والبذور العشوائية (random seeds) ثابتة. كما تم تضمين نموذج مرجعي مكون من 1,000 فئة (ImageNet القياسي) وضوابط غير مدربة للمقارنة.
مقاييس التقييم: تم قياس التوافق التمثيلي باستخدام تحليل التشابه التمثيلي (RSA). قارن المؤلفون مصفوفات عدم التشابه التمثيلي (RDMs) لطبقات الشبكة مقابل ثلاثة معايير بيولوجية وسلوكية:
رنين المغناطيسي الوظيفي البشري (fMRI): مجموعة بيانات المشاهد الطبيعية (NSD)، مع التركيز على المجرى البسي الظهراني.
الكهرباء العصبية لدى المكاك (Macaque): مجموعة بيانات (TVSD) للنبضات العصبية في المجرى البطني، والتي تغطي مناطق V1 وV4 والقشرة الظهرانية الصدغية (IT).
السلوك البشري: مجموعة بيانات THINGS، التي تستخدم 4.7 مليون حكم تشابه من نوع "الاستبعاد" (odd-one-out) من حوالي 12,000 مشارك لإنشاء تضمين سلوكي مكون من 66 بُعداً.
ملاحظة: تم اختيار الطبقات بناءً على قسم مستقل من المحفزات لتجنب الإفراط في التخصيص (overfitting)، وتم الإبلاغ عن النتائج بناءً على قسم تقرير محجوز.
المساهمات والنتائج الرئيسية
الإشراف الخشن يطابق أو يتجاوز التوافق العصبي دقيق التفاصيل:
طورت الشبكات المدربة على ثماني فئات عريضة فقط تمثيلات تضاهي أو تتجاوز التوافق العصبي للنماذج المدربة على 1,000 فئة.
صمدت هذه النتيجة في كل من fMRI البشري (المجرى البطني) والكهرباء العصبية للمكاك (قشرة IT).
في القشرة البصرية المبكرة (V1 في المكاك، والمجرى البصري المبكر في البشر)، كان التوافق مستقلاً إلى حد كبير عن دقة التدريب، حيث أدت الشبكات غير المدربة أداءً يماثل الشبكات المدربة، وهو ما يتوافق مع وجود بديهيات بنيوية قوية في الرؤية المبكرة.
التوافق السلوكي المتفوق:
بشكل مثير للاهتمام، حققت الشبكات المدربة خشناً (تحديداً تلك المدربة على 8 فئات مشتقة من تضمينات CLIP) توافقاً أعلى مع أحكام التشابه الإدراكي البشري من جميع النماذج الأخرى التي تم تقييمها.
شمل ذلك التفوق على النماذج الرائدة واسعة النطاق (مثل CLIP وDINOv3) والشبكات المدربة بإشراف أو تعلم ذاتي دقيق التفاصيل.
كان هذا التفوق قوياً عبر مختلف البنى (CNNs وTransformers) والبذور العشوائية للتدريب.
الهندسة التمثيلية المتميزة:
كشفت عملية تصور الفضاء التمثيلي أن الشبكات المدربة خشناً تتعلم هندسة مختلفة نوعياً عن شبكاتها المصدرية. فبينما كانت الفئات الخشنة في الشبكة المصدرية تتداخل في فضاء تمثيلها الخاص، تعلمت الشبكة المدربة خشناً سحب هذه الفئات بعيداً عن بعضها لتصبح مناطق متميزة.
أكدت تجارب تقليل الأبعاد أن التوافق العالي للشبكات الخشنة ليس مجرد نتيجة لإسقاط تمثيل دقيق التفاصيل في فضاء فرعي منخفض الأبعاد؛ بل إن الهندسة المدربة خشناً متميزة ولا يمكن استعادتها بمجرد قطع المكونات الرئيسية لنموذج مكون من 1,000 فئة.
كفاءة البيانات:
أثبت الإشراف الخشن كفاءة عالية في البيانات. فقد حققت الشبكات المدربة على 1% فقط من مجموعة بيانات ImageNet (10,000 صورة) باستخدام 8 فئات خشنة توافقاً سلوكياً أعلى من الشبكات المكونة من 1,000 فئة والمدربة على كامل مجموعة البيانات (~ مليون صورة).
القدرة على التعميم:
استمر التأثير عبر مختلف الشبكات المصدرية المستخدمة لتوليد الملصقات (AlexNet، وCLIP، وViT، وDINOv3)، وحتى عند استخدام ملصقات دلالية مصاغة يدوياً بناءً على أبعاد قابلة للتفسير (طبيعي مقابل اصطناعي، حجم، داخلي مقابل خارجي)، رغم أن الملصقات المشتقة من البيانات ظلت أكثر فعالية قليلاً.
لوحظت الفائدة في البنى الحديثة بما في ذلك ResNet-50 وConvNeXt وVision Transformers.
الأهمية والادعاءات يزعم البحث أن التمثيلات المتوافقة مع البشر يمكن أن تنبثق من أهداف تحسين بسيطة للغاية، مما يتحدى الافتراض السائد بأن التمييز الدقيق على مستوى الحالة (instance-level) أو مهام التعلم الذاتي المعقدة ضرورية للوصمة مع الدماغ.
إعادة صياغة إشارات التعلم: تشير النتائج إلى أن أهداف التحسين المطلوبة لتعلم تمثيلات متوافقة مع الدماغ قد تكون أكثر بساطة مما كان يُعتقد. إن التعلم لتجميع الصور الطبيعية في فئات خشنة للغاية (ثماني نطاقات فقط) كافٍ لتطوير تمثيلات داخلية تحاكي الرؤية البشرية.
ميزة الخشونة: في سياق التوافق السلوكي، فإن الإشراف الخشن ليس كافياً فحسب، بل هو ميزة. فهو يلتقط البنية عالية المستوى للإدراك الموضوعي البشري بشكل أكثر فعالية من التدريب دقيق التفاصيل، مما يشير إلى أن التمييزات الفئوية "العريضة" الموجودة في مرحلة التطور المبكر تعد حاسمة في تشكيل الهندسة التمثيلية للنظام البصري.
المسار نحو ذكاء اصطناعي متوافق مع البشر: يقترح المؤلفون أن تقليل دقة الإشارة الإشرافية يوفر مساراً قابلاً للتوسع لبناء أنظمة ذكاء اصطناضي أكثر توافقاً مع الإدراك البشري، حيث لا يتطلب ذلك توصيفاً يدوياً ويمكن تطبيقه على أي نموذج أو نمط (modality) مدرب مسبقاً.
الاتجاهات المستقبلية: تقترح الورقة استكشاف المناهج التعليمية الهرمية حيث يبني الإشراف الخشن هيكلاً تمثيلياً للتعلم اللاحق دقيق التفاصيل، والتحقيق في الآليات البيولوجية (مثل مسارات التغذية الراجعة من القشرة الجبهية أو المهاد) التي قد تقدم مثل هذه الإشارات الإشرافية الخشنة أثناء نمو الدماغ.
تخلص الدراسة إلى أن على المجال النظر إلى ما وراء التحسين دقيق التفاصيل لفهم العوامل الأساسية التي تحكم التوافق بين الرؤية البيولوجية والاصطناعية، مفترضة أن أبسط أشكال التحسين قد تكفي للتقارب نحو تمثيلات تشبه البشر.