Sapiens2
تعد Sapiens2 عائلة من نماذج المحولات الرؤيوية عالية الدقة المتمحورة حول الإنسان، والتي تتراوح أحجامها بين 0.4 إلى 5 مليارات معلمة، وتحقق أداءً جديداً هو الأفضل في فئته عبر مهام متنوعة مثل تقدير الوضعية والتقسيم من خلال هدف تدريب مسبق موحد، ومجموعة بيانات منسقة تضم مليار صورة بشرية، وتحسينات معمارية تدعم دقة تصل إلى 4K.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً فائق الذكاء، قضى حياته بأكملها في دراسة البشر. مهمته هي النظر إلى صورة إنسان وفهم كل شيء عنه: أين تقع أكواعهم، ما لون قميصهم، كيف يسقط الضوء على بشرتهم، وحتى التفاصيل الدقيقة مثل شامة أو خصلة شعر.
الورقة البحثية التي شاركتها تقدم Sapiens2، النسخة الأحدث والأكثر تقدماً من هذا المساعد. إنه عقل حاسوبي ضخم (نموذج ذكاء اصطناعي) مصمم خصيصاً لفهم البشر في الصور بشكل أفضل من أي نسخة سابقة.
إليك شرح لكيفية عمله، باستخدام بعض التشبيهات من الحياة اليومية:
1. "الطالب" و"المعلم" (كيف يتعلم)
في الأيام الخوالي، كانت نماذج الذكاء الاصطناعي تتعلم من خلال محاولة ملء الأجزاء المفقودة من لغز (مثل لعبة "نمذجة الصور المقنعة"). كانوا ينظرون إلى صورة بها مربع أسود كبير فوق الوجه ويحاولون تخمين ما يوجد تحته. هذا جيد لتعلم الأشكال، لكنه سيئ في تعلم "المعنى".
Sapiens2 يستخدم استراتيجية أذكى. تخيل طالباً ومعلماً يعملان معاً:
- مهمة إعادة البناء: يحاول الطالب إعادة بناء صورة مشوشة ومكسرة لشخص ما. هذا يعلم الذكاء الاصطناعي رؤية التفاصيل الدقيقة (مثل ملمس الجلد أو نسيج السترة).
- المهمة التباينية: يعرض المعلم للطالب صورتين مختلفتين لنفس الشخص (ربما واحدة مبتسمة وأخرى عابسة) ويقول: "هذا هو نفس الشخص!". ثم يعرض المعلم صورة لشخص مختلف ويقول: "هذا ليس نفس الشخص". هذا يعلم الذكاء الاصطنا_ي المعنى وهُوية الشخص، بغض النظر عن الوضعية أو الإضاءة.
من خلال القيام بكليهما في وقت واحد، يتعلم Sapiens2 رؤية كل من التفاصيل الدقيقة (البكسلات) والصورة الكبيرة (مفهوم "الإنسان").
2. مكتبة تضم مليار كتاب (البيانات)
لكي تصبح خبيراً، تحتاج إلى قراءة الكثير من الكتب. لم يقرأ Sapiens2 بضعة كتب فحسب؛ بل قرأ مليار صورة عالية الجودة للبشر.
- لم يقم الباحثون بجلب صور عشوائية فحسب، بل قاموا بتصفية مليارات الصور على الإنترنت للعثستخراج الأفضل منها.
- تأكدوا من أن المكتبة تتضمن أشخاصاً من جميع الأعمار، والأعراق، والخلفيات، وفي جميع أنواع الطقس والإضاءة.
- القاعدة: كان لزاماً أن تحتوي كل صورة واحدة على الأقل على شخص بارز. لا مناظر طبيعية، لا سيارات، فقط بشر.
3. العدسة عالية الدقة (الدقة)
كانت النماذج السابقة تشبه النظر إلى شخص من خلال نافذة ضبابية قليلاً (دقة 1K). كان بإمكانهم رؤية أنك شخص، لكنهم قد يفقدون تفصيلاً مثل قرط معين أو تجعيدة في جبهتك.
Sapiens2 يشبه ارتداء نظارات 4K عالية الدقة.
- يمكنه معالجة الصور بدقة هائلة (4K).
- ولأن لديه قدرة على رؤية الكثير من التفاصيل، يمكنه التمييز بين الأشياء التي تبدو متشابهة جداً. على سبيل المثال، يمكنه التمييز بين أسنانك ولثتك، أو رصد سلسلة عنق صغيرة مقابل قميص داكن، دون ارتباك.
- يمكنه أيضاً التنبؤ بأشياء لا يمكنك رؤيتها مباشرة، مثل الشكل ثلاثي الأبعاد لوجهك (العمق) أو كيفية ارتداد الضوء عن بشرتك (الإنعكاس/Albedo).
4. السكين السويسري (تعدد الاستخدامات)
كانت نماذج الذكاء الاصطناعي القديمة غالباً ما تكون مثل أداة متخصصة: واحدة للعثور على العظام، وأخرى لقص الشعر، وأخرى لقياس الجلد. إذا كنت تريد القيام بشيئين، فأنت بحاجة إلى أداتين مختلفتين.
Sapiens2 هو سكين سويسري. نظرًا لأنه تعلم فهماً عميقاً للبشر، يمكنك استخدامه لأي شيء تقريباً:
- تقدير الوضعية (Pose Estimation): رسم هيكل عظمي فوق الشخص لرؤية مكان مفاصله بالضبط (حتى لو كان يقوم بوضعية يوغا).
- التقطيع (Segmentation): تلوين كل جزء من أجزاء الشخص (الشفاه، اللسان، الأذنين، الأحذية) بدقة متناهية.
- النمذجة ثلاثية الأبعاد: تحويل صورة ثنائية الأبعاد مسطحة إلى خريطة ثلاثية الأبعاد لسطح الشخص.
- الإضاءة: معرفة كيفية سقوط الضوء على الشخص تماماً بحيث يمكنك تغيير الإضاءة رقمياً لاحقاً (مثل الأفلام).
5. لماذا يعد هذا أمراً هاماً؟
تدعي الورقة البحثية أن Sapiens2 هو "حالة الفن" (State-of-the-Art) الجديدة. فكر في الأمر كترقية من تلفزيون أبيض وأسود إلى شاشة 4K HDR.
- إنه أكثر دقة: يرتكب أخطاء أقل في المهام الصعبة.
- إنه أكثر تفصيلاً: يلتقط "روح" الصورة، وليس مجرد الخطوط العريضة.
- إنه فعال: على الرغم من ضخامته (يصل إلى 5 مليارات "عصبون" أو معامل)، فقد بناه الباحثون ليعمل بكفاءة على الحواسيب الحديثة.
باختختصار: Sapiens2 هو ذكاء اصطناعي فائق القدرة درس مليار صورة للبشر. إنه يجمع بين "النظر عن كثب" و"الفهم العميق" لخلق نموذج يمكنه رؤية، وقياس، وفهم البشر في الصور بشكل أفضل مما فعل أي كمبيوتر من قبل. إنه الأساس لتقنيات المستقبل مثل الصور الرمزية (Avatars) الواقعية، والتصوير الطبي الأفضل، والواقع المعزز المتقدم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.