← أحدث الأبحاث
💻 computer science

MeFEm: Medical Face Embedding model

تقدم الورقة البحثية MeFEm، وهو نموذج رؤية معدل يعتمد على تقنية JEPA، يستفيد من قناع الأشرطة المحورية، وتوزين الخسارة الدائري، وإعادة تعيين رمز CLS الاحتمالي لتحقيق أداء رائد في القياسات الحيوية للوجه الطبية وتقدير مؤشر كتلة الجسم باستخدام بيانات تدريب أقل بكثير من النماذج المرجعية الحالية.

المؤلفون الأصليون: Yury Borets, Stepan Botman

نُشر 2026-02-17
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yury Borets, Stepan Botman

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً فائق الذكاء، لم يسبق له رؤية كتاب طبي، ولم يأخذ حصة بيولوجيا واحدة، ولم يزر طبيباً من قبل. ومع ذلك، فقد قضى هذا الطالب سنوات في التحديق في ملايين الصور لوجوه البشر من الإنترنت.

الآن، تخيل أنك سألت هذا الطالب: "بناءً على هذا الوجه، هل يمكنك تخمين عمر الشخص، أو جنسه، أو حتى مؤشر كتلة الجسم (BMI) الخاص به؟"

من المثير للدهشة أن هذا الطالب يصيب في إجاباته أكثر من الخبراء الذين درسوا الطب بالفعل. هذه هي قصة MeFEm (نموذج تضمين الوجه الطبي)، وهي أداة ذكاء اصطناعي جديدة وُصفت في الورقة البحثية التي شاركتها.

إليك تفصيل لكيفية عملها، باستخدام تشبيهات بسيية.

1. المشكلة: "نقص البيانات الطبية"

في عالم الذكاء الاصطناعي، لكي تُعلم الكمبيوتر القيام بشيء ما، فأنت تحتاج عادةً إلى مكتبة ضخمة من الأمثلة.

  • المشكلة: بالنسبة للمهام العامة (مثل التعرف على قطة أو سيارة)، لدينا مليارات الصور على الإنترنت. ولكن بالنسبة للمهام الطبية (مثل التنبؤ بأمراض القلب من خلال الوجه)، ليس لدينا بيانات تقريباً. لماذا؟ لأن سجلات المرضى خاصة، وتصنيفها يتطلب أطباء مكلفين.
  • الطريقة القديمة: حاولت نماذج الذكاء الاصطناعي السابقة التعلم عن طريق قراءة الأوصاف النصية (مثل "شخص مريض") المرفقة بالصور. لكن الإنترنت مليء بالأوصاف الغامضة مثل "وجه سعيد"، وليس "ضغط دم مرتفع قليلاً". هذا جعل الذكاء الاصطناعي مرتبكاً.

2. الحل: "المراقب الصامت"

قرر مبتكرو MeFEm تجاوز النص تماماً. لقد بنوا نموذجاً يتعلم فقط من خلال النظر إلى الوجوه، دون أي كلمات مرفقة.

فكر في الأمر كالتالي: إذا شاهدت آلاف الساعات من الناس وهم يتحدثون، فستتعلم في النهاية قراءة الشفاه ولغة الجسد دون أن يخبرك أحد بما يقولونه. MeFem يفعل هذا مع الوجوه. إنه يتعلم "هندسة" الوجه — المسافة بين العينين، شكل الفك، ملمس الجلد — ويكتشف أن هذه التفاصيل الصغيرة هي أدلة على صحة الشخص.

3. السر الخلطة: ثلاث حيل خاصة

توضح الورقة البحثية أنهم لم يستخدموا مجرد نموذج ذكاء اصطناعي قياسي؛ بل منحوه ثلاث "قوى خارقة" محددة لجعله أفضل في قراءة الوجوه:

أ. قناع "تسليط الضوء" (Axial Stripe Masking)

  • المشكلة: نماذج الذكاء الاصطناعي القياسية غالباً ما تتشتت بالخلفية. إذا عرضت على النموذج وجهاً في حديقة، فقد يحاول تعلم أشياء عن الأشجار أو السماء بدلاً من الأنف.
  • الحل: تخيل أنك تذاكر لاختبار، لكن المعلم يضع ورقة فوق النصف السفلي من الصفحة، مما يجبرك على التركيز فقط على النصف العلوي. ثم يحرك الورقة إلى اليسار، ثم إلى اليمين.
  • حيلة MeFEm: يستخدمون قناع "شريطي" يغطي أجزاء من الصورة بطريقة محددة. هذا يجبر الذكاء الاصطناعي على التركيز على مركز الصورة (حيث يوجد الوجه) وتجاهل الحواف (حيث توجد الخلفية). الأمر يشبه وضع تسليط ضوء على الوجه وإخبار الذكاء الاصطناعي: "انظر هنا فقط".

ب. "الدرجة الموزونة" (Circular Loss)

  • المشكلة: حتى مع تسليط الضوء، لا يزال الذكاء الاصطناعي يرى حواف الصورة. إذا أخطأ الذكاء الاصطناعي في سؤال حول الخلفية، فلا ينبغي معاقبته بنفس شدة الخطأ في سؤال حول العينين.
  • الحل: تخيل معلماً يصحح اختباراً. إذا أخطأت في السؤال الرئيسي، تخسر 10 نقاط. إذا أخطأت في رسمة صغيرة غير ذات صلة في الزاوية، تخسر نقطة واحدة فقط.
  • حيلة MeFEm: أعطوا الذكاء الاصطناعي "وزناً دائرياً". مركز الوجه (الأنف، العينين، الفم) يمثل 100% من الدرجة. الحواف تمثل القليل جداً. هذا يعلم الذكاء الاصطناعي الاهتمام بعمق بالوجه وتجاهل ضجيج الخلفية.

ج. "المذكرة الملخصة" (Probabilistic CLS Token)

  • المشكلة: تقوم نماذج الذكاء الاصطناعي عادةً بتقسيم الصورة إلى قطع صغيرة (patches). إنها بارعة في رؤية التفاصيل، لكنها أحياناً تنسى "الصورة الكبيرة".
  • الحل: تخيل طالباً يدون ملاحظات. هو يكتب كل تفصيل (القطع)، ولكنه يكتب أيضاً ملخصاً من جملة واحدة في الأعلى (الـ CLS token).
  • حيلة MeFEm: جعلوا الذكاء الاصطناعي يتدرب على كتابة تلك "المذكرة الملخصة" بشكل عشوائي. أحياناً يكون الملخص مبنياً على الجانب الأيسر من الوجه، وأحياناً على الجانب الأيمن. هذا يجبر الذكاء الاصطناعي على إنشاء ملخص مثالي وشامل للوجه بأكه، وهو أمر بالغ الأهمية لإجراء التخمينات الطبية السريعة لاحقاً.

4. النتائج: أكثر ذكاءً ببيانات أقل

اختبرت الورقة البحثية MeFEm مقابل نماذج شهيرة أخرى (مثل FaRL و Franca).

  • المفاجأة: استخدم MeFEm بيانات أقل بكثير من النماذج الأخرى (حوالي 6 ملايين صورة مقابل 15 مليون أو أكثر)، ومع ذلك كان أداؤه أفضل.
  • الاختبار الطبي: طلبوا من MeFEm تخمين مؤشر كتلة الجسم (BMI) لشخص ما من مجرد صورة. لقد قام بعمل أفضل من الخبراء.
  • الحدود: حاولوا أيضاً تخمين ضغط الدم والكوليسترول. حقق الذكاء الاصطناعي نتائج "جيدة" في بعض الأشياء، لكنه فشل في أخرى. يعترف المؤلفون: "لا يمكنك رؤية ضغط الدم في صورة بشكل مثالي". لكن حقيقة أنه وجد أي صلة بين الوجه وكيمياء الدم هي خطوة كبيرة للأمام.

الخلاصة الكبرى

MeFEm يشبه المحقق الذي تعلم حل الجرائم من خلال دراسة ملايين صور المجرمين، بدلاً من قراءة التقارير الشرطية. من خلال التركيز بدلاً من ذلك على التفاصيل البصرية للوجه وتجاهل "الضجيج" الناتج عن الخلفية أو النص، تعلم رصد علامات صحية دقيقة فاتت النماذج الأخرى.

لماذا يهم هذا؟
هذا يعني أنه قد تتوفر لدينا قريباً أدوات ذكاء اصطناعي يمكنها فحص المشكلات الصحية بمجرد النظر إلى صورة، حتى في الأماكن التي لا تتوفر فيها أطباء أو اختبارات معملية باهظة الثمن. إنه يحول مجرد صورة شخصية (selfie) إلى فحص صحي محتمل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →