← أحدث الأبحاث
🤖 machine learning

Learning from a single labeled face and a stream of unlabeled data

تتناول هذه الورقة تحدي التعرف على الوجه من فئة واحدة باستخدام صورة واحدة مصنفة، وذلك عبر اقتراح خوارزمية غير معلمية تستفيد من تدفق بيانات وفيرة غير مصنفة لتحقيق استدعاء أعلى بكثير مع حالات إيجابية كاذبة تقترب من الصفر مقارنة بالنماذج المرجعية الحالية.

المؤلفون الأصليون: Branislav Kveton, Michal Valko

نُشر 2026-05-01
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Branislav Kveton, Michal Valko

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم حارس أمن التعرف على شخص محدد (لنسمه "بوب") حتى يتمكن من فتح باب. ولكن هناك عقبة: ليس لديك سوى صورة واحدة فقط لبوب لتريه للحارس.

عادةً، لكي يتعلم الحارس كيف يبدو بوب، ستحتاج إلى مئات الصور: بوب وهو يبتسم، بوب وهو عابس، بوب وهو يرتدي قبعة، بوب تحت المطر. وبدون هذه الصور، قد يخطئ الحارس في التعرف على شخص غريب يشبه بوب قليلاً ويعتبره هو، أو قد يفشل في التعرف على بوب في يوم ذي تسريحة شعر سيئة.

تقدم هذه الورقة البحثية حلاً ذكياً لهذه المشكلة. الأمر يشبه إعطاء الحارس بث فيديو مباشر لشارع مزدحم حيث يمر بوب من هناك بين الحين والآخر، مختلطاً بآلاف الغرباء العشوائيين. الحارس لا يعرف من هم الغرباء، لكنه يعرف من هو بوب.

إليك كيف يعمل أسلوب هذه الورقة، المسمى "تتبع المتشعب عبر الإنترنت" (Online Manifold Tracking - OMT)، مقسماً إلى مفاهيم بسيطة:

١. المشكلة: معضلة "الصورة الواحدة"

معظم أنظمة التعرف على الوجوه تشبه الطلاب الذين يحتاجون إلى دراسة كتاب كامل لاجتياز الاختبار. إذا أعطيتهم صفحة واحدة فقط (صورة واحدة)، فسوف يفشلون. لا يمكنهم تخمين كيف يتغير وجه بوب عندما يبتسم أو يلتفت برأسه لأنهم لم يروا تلك التغييرات من قبل.

٢. الحل: التعلم من الحشود (بدون تسميات)

أدرك المؤلفون أنه بينما لدينا صورة واحدة فقط لبوب، لدينا بث فيديو يظهر العديد من الأشخاص.

  • الصورة الموسومة: هي "بطاقة الهوية" الخاصة ببوب.
  • البث غير الموسوم: هو حشد من الناس يسيرون في المكان. نحن لا نعرف من هم، لكننا نعرف أنهم ليسوا بوب (في الغالب).

يستخدم النظام هذا الحشد لتعلم "شكل" وجه بوب. فكر في الأمر كالتالي:
تخيل أن وجه بوب موجود في مساحة ثلاثية الأبعاد. الصورة الوحيدة هي مجرد نقطة واحدة في تلك المساحة. بث الفيديو يظهر لنا سحابة من النقاط. بعض النقاط هي بوب (تشبه الصورة)، وبعضها غرباء (مختلفة تماماً).

مهمة الخوارزمية هي رسم فقاعة حول الصورة الوحيدة لبوب.

  • إذا وقع وجه جديد من الفيديو داخل الفقاعة، فمن المرجح أن يكون بوب.
  • إذا وقع خارجها، فمن المرجح أن يكون غريباً.

٣. "الفقاعة الذكية" (تتبع المتشعب عبر الإنترنت)

الفقاعة ليست ثابتة؛ إنها حية وتتنفس. بينما يعمل الفيديو، يقوم النظام بشيئين:
١. التصفية: ينتبه فقط للوجوه التي تبدو تشبه الصورة الأصلية لبوب. إنه يتجاهل الغرباء الواضحين فوراً.
٢. رسم الخرائط: بالنسبة للوجوه التي تشبه بوب، فإنه ينشئ "خريطة" لكيفية تغير وجه بوب. إذا ابتسم بوب في الفيديو، تتوسع الخريطة لتشمل تلك الابتسامة. إذا أدار رأسه، تتمدد الخريطة لتشمل تلك الزاوية.

تسمي الورقة هذا "تتبع المتشعب عبر الإنترنت" (Online Manifold Tracking).

  • "المتشعب" (Manifold): هو مصطلح رياضي معقد يعني "الشكل" أو "السطح" لجميع الطرق الممكنة التي يمكن أن يبدو بها وجه بوب.
  • "التتبع" (Tracking): يعني أن النظام يحدث هذا الشكل في الوقت الفعلي مع وصول إطارات الفيديو الجديدة.

٤. "المصرف" (التعامل مع الأخطاء)

هناك جزء معقد في هذا الأمر: ماذا لو بدا شخص غريب مشابهاً جداً لبوب؟ يحتاج النظام إلى طريقة لقول: "هذا يبدو مثل بوب، لكنه بعيد جداً ليكون هو".

أضاف المؤلفون "مصرفاً" (مثل الثقب الأسود) إلى نموذجهم الرياضي.

  • تخيل مساراً عشوائياً. إذا بدأت من وجه يشبه بوب، فإنك تأخذ خطوات نحو الوجوه المشابهة.
  • إذا كنت قريباً من بوب، فستتم عملية "الامتصاص" في النهاية بواسطة بوب (وتقول: "نعم، هذا هو!").
  • إذا كنت بعيداً (غريب)، فإن "المصرف" سيمسك بك قبل أن تصل إلى بوب. هذا يمنع النظام من الارتباك بسبب أشخاص قد يشبهون بوب قليلاً بالصدفة.

٥. النتائج: ما مدى نجاح الأمر؟

اختبر الباحثون هذا على ٤٣ شخصاً مختلفاً باستخدام تسجيلات فيديو.

  • الإعداد: أعطوا النظام صورة واحدة لكل شخص وبث فيديو لذلك الشخص مختلطاً بالغرباء.
  • النتيجة: حدد النظام الشخص الصحيح بدقة ٩٠٪ من المرات مع ارتكاب صفر أخطاء تقريباً (إنذارات كاذبة).
  • المقارنة: كان هذا أفضل بنسبة ١٥٪ من طريقة "Fisherfaces" القياسية (وهي تقنية شائعة للتعرف على الوجوه) عندما تم إعطاؤهما نفس الصورة الوحيدة.

٦. لماذا هذا مهم (وفقاً للورقة البحثية)

  • لا يحتاج لتدريب ثقيل: على عكس الأنظمة الأخرى التي تحتاج إلى قواعد بيانات ضخمة ليتم تدريبها في المختبر أولاً، يتعلم هذا النظام أثناء العمل. إنه يشبه تعلم ركوب الدراجة أثناء ركوبها بالفعل، بدلاً من قراءة دليل التعليمات أولاً.
  • سريع: يمكنه معالجة الوجه في حوالي ٠.٠٥ ثانية، وهو سريع بما يكفي للاستخدام في الوقت الفعلي (مثل فتح الهاتف).
  • مرن: لا يفترض النظام أن بوب سيبدو دائماً بنفس الشكل. فهو يتكيف مع التقدم في السن، أو اللحية، أو التعبيرات، لأنه يتعلم من بث الفيديو نفسه.

ملخص التشبيه

فكر في الطريقة القديمة للتعرف على الوجوه كمحاولة لحفظ لقطة واحدة لصديق للتعرف عليه وسط حشد. من المحتمل أن تفشل إذا ارتد قبعة أو غير تسريحة شعره.

طريقة هذه الورقة تشبه إعطاء صديقك مغناطيساً. تسقط المغناطيس (الصورة الوحيدة) في نهر من الماء (بث الفيديو). المغناطيس يجذب كل برادة الحديد (الوجوه التي تشبه صديقك) ويخلق تجمعاً. حتى لو كانت البرادة مبعثرة أو متحركة، فإن المغناطيس يعرف أي منها ينتمي إلى التجمع وأيها مجرد غبار (غرباء). إنه يبني نموذجاً ديناميكياً وحياً لصديقك بمجرد مراقبة حركته عبر الحشد، دون الحاجة إلى مكتبة من الصور للبدء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →