← أحدث الأبحاث
🧬 biology

Extremely coarse learning objectives induce human-aligned representations in AI vision models

تُظهر هذه الدراسة أن تدريب نماذج الرؤية الاصطناعية باستخدام أهداف تعلم خشنة للغاية، مثل التمييز بين ثماني فئات عريضة فقط، يُنتج تمثيلات داخلية تتوافق مع الاستجابات العصبية والأحكام الإدراكية البشرية بشكل وثيق أكثر من النماذج المدربة على مهام دقيقة أو مهام التعلم الذاتي.

المؤلفون الأصليون: Yash Mehta, Michael Bonner

نُشر 2026-09-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yash Mehta, Michael Bonner

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل

على مدى عقود، حاول العلماء فهم كيفية تحويل الدماغ البشري لفيض من الضوء إلى صورة واضحة للعالم. لقد اشتبهوا طويلاً في أن الإجابة تكمن في الطريقة التي ينظم بها نظامنا البصري المعلومات، حيث يصنف فوضى الطبيعة إلى فئات مرتبة مثل "حيوان"، أو "أداة"، أو "مركبة". ولاختبار هذه الأفكار، بنى الباحثون أنظمة ذكاء اصطناعي تحاكي بنية الدماغ، ودربوها على التعرف على آلاف الأشياء المحددة. وقد أصبحت هذه الأدمغة الرقمية أدوات قوية، لكن ظل هناك سؤال عالق: هل يحتاج الدماغ حقاً إلى تعلم هذا العدد الهائل من التسميات المحددة لبناء فهم يشبه الفهم البشري للرؤية؟ ربما لا يكمن السر في الرؤية كالبشر في حفظ موسوعة ضخمة من الأشياء، بل في تعلم طريقة أبسط وأشمل لتصنيف العالم.

لقد شرع فريق من الباحثين في جامعة جونز هوبكنز في اختبار هذا الاحتمال عبر تجريد التدريب القياسي للذكاء الاصطناعي من التعقيد. فبدلاً من تعليم شبكاتهم الاصطناعية التمييز بين ألف فئة مختلفة من الصور، كما هو متبع في الممارسة الشائعة، علموها فرز نفس الصور في عدد قليل جداً من المجموعات الواسعة للغاية. ولم يستخدموا تسميات بشرية لهذه المجموعات؛ بل تركوا الكمبيوتر يجد تقسيماته الطبيعية الخاصة داخل البيانات، مما خلق فئات قد تفصل بين "الكائنات الحية" و"الآلات" أو "المشاهد الداخلية" و"المشاهد الخارجية". ثم قاموا بتدريب مئات من هذه الشبكات، مع تغيير عدد المجموعات من اثنتين فقط وصولاً إلى أربع وستين مجموعة، وقارنوا مدى جودة مطابقة هذه الأدمغة الرقمية للنشاط الفعلي للدماغ البشري وسلوك المراقبين البشر.

كانت النتائج مفاجئة. فقد وجد الباحثون أن الشبكات التي تدربت على هذه الفئات الخشنة والبسيطة للغاية طورت خرائط داخلية للعالم المرئي كانت بجودة مماثلة، بل وأفضل في كثير من الأحيان، من الشبكات المدربة على الألف فئة كاملة في مطابقتها لنشاط الدماغ البشري. وعندما قاسوا مدى توافق هذه الأدمغة الاصطناعية مع عمليات مسح القشرة البصرية البشرية وتسجيلات من أدمغة قرود المكاك، وجدت النماذج التي تدربت على ثماني مجموعات واسعة فقط أنها تضاهي أكثر النماذج تعقيداً. والأكثر إثارة للدهشة هو أن هذه الشبكات البسيطة طابقت أحكام البشر حول تشابه الأشياء ببعضها البعض بشكل أفضل من أي نموذج آخر تم اختباره، بما في ذلك أكثر أنظمة الذكاء الاصطناعي تقدماً المتاحة اليوم.

يتحدى هذا الاكتشاف الفكرة السائدة القائلة بأنه لبناء آلة ترى كالبشر، يجب تدريبها على قائمة ضخمة ومفصلة من أسماء الأشياء المحددة. وتشير الدراسة إلى أن النظام البصري البشري قد لا يتطلب مهمة تصنيف دقيقة تتضمن ألف فئة لتطوير فهمه المتطور للعالم. بدلاً من ذلك، يبدو أن القدرة على تجميع الصور في مجموعات واسعة وذات مغزى كافية لتوليد تمثيل للرؤية يحاكي رؤيتنا. وقد أثبت الباحثون أن هذا التأثير يظل قائماً عبر أنواع مختلفة من بنيات الشبكات العصبية، من التصاميم القديمة والأبسط إلى الأنظمة الحديثة والمعقدة، كما أنه يعمل حتى عندما تكون بيانات التدريب محدودة.

استكشف الفريق أيضاً ما إذا كانت الطريقة المحددة التي أنشأوا بها هذه الفئات الواسعة ذات أهمية. ووجدوا أن النتائج ظلت ثابتة سواء كانت الفئات مشتقة من الأنماط الإحصائية للصور نفسها أو محددة بمفاهيم واضحة ومفهومة بشرياً مثل "طبيعي مقابل اصطناعي" أو "صغير مقابل كبير". وهذا يشير إلى أن العامل الرئيسي هو خشونة هدف التعلم نفسه، وليس التسميات المستخدمة. كما أظهرت الدراسة أن هذه الشبكات المدربة تدريباً خشناً لم تتعلم ببساطة نسخة مبسطة مما تتعلمه الشبكة المعقدة؛ بل طورت طريقة مختلفة جوهرياً لتنظيم المعلومات المرئية، وهي طريقة صادفت أنها تتوافق بشكل وثيق مع الإدراك البشري.

من خلال إظهار أن هدفاً تعليمياً بسيطاً بشكل مدهش يمكن أن ينتج رؤية متوافقة مع البشر، تعيد هذه الدراسة صياغة فهمنا لما هو ضروري لكي ترى الآلة. إنها تشير إلى أن الطريق نحو ذكاء اصطناعي يحاكي الإدراك البشري حقاً قد لا يكمن في تغذيته بمزيد من البيانات أو المهام الأكثر تعقيداً، بل في تعليمه رؤية العالم بمصطلحات أوسع وأكثر جوهرية. وتفتح هذه النتائج مساراً جديداً لبناء أنظمة ذكاء اصطناعي ليست قوية فحسب، بل متوافقة حقاً مع الطريقة التي يدرك بها البشر تجربتهم البصرية وينظمونها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →