← أحدث الأبحاث
💻 computer science

QGF-Net: Fine-Grained Image Classification via Self-Supervised Vision Transformer and Quantum Measurement Attention

تقترح هذه الورقة البحثية شبكة QGF-Net، وهي إطار عمل هجين يجمع بين الكم والتقليدي يدمج نماذج المحولات الرؤيوية ذات التعلم الذاتي مع وحدة دمج محلية متسقة الإضاءة، وآلية اقتراح مناطق تمييزية، وآلية انتباه للقياس الكمي لتحقيق أداء وحصانة من طراز الحالة الراهنة في التصنيف الدقيق للصور.

المؤلفون الأصليون: xueliang Song, Yumin Dong, Shuang Wu, Bo Wang

نُشر 2026-08-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: xueliang Song, Yumin Dong, Shuang Wu, Bo Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول التمييز بين طائرين يبدوان متطابقين تماماً للعين غير المدربة. قد يمتلك أحدهما نمطاً مختلفاً قليلاً على جناحه، أو اختلافاً طفيفاً في شكل منقاره. لكي يتمكن الكمبيوتر من فعل ذلك، لا يمكنه ببساطة النظر إلى الطائر ككل والتخمين؛ بل يجب عليه العثور على تلك التفاصيل الصغيرة والمحددة مع تجاهل الخلفية المشتتة، أو الظلال، أو الطريقة التي يسقط بها الضوء على الريش. هذا هو تحدي التصنيف الدقيق للصور، وهي مهمة تدفع الذكاء الاصطناعي ليرى العالم بدقة عالم الطبيعة. وبينما أصبحت الحواسيب الحديثة جيدة جداً في التعرف على الفئات العامة مثل "كلب" أو "سيارة"، فإن التمييز بين الأنواع الفرعية وثيقة الصلة لا يزال صعباً لأن الاختلافات صغيرة جداً والتباينات داخل النوع الواحد كبيرة جداً.

ولحل هذه المشكلة، لجأ الباحثون إلى أنظمة قوية تتعلم من خلال النظر في ملايين الصور غير المصنفة، حيث تعلم نفسها فهم الهيكل العام للعالم دون الحاجة إلى معلمين بشريين لتصنيف كل صورة. ومع ذلك، حتى هذه الأنظمة المتقدمة غالباً ما تعاني عندما تتغير الإضاءة أو عندما تكون التفاصيل الأكثر أهمية مخفية في زاوية صغيرة من الصورة. تقدم دراسة جديدة طريقة تسمى QGF-Net، والتي تجمع بين هذه الأنظمة التعليمية القوية ونهج مبتكر مستوحى من الفيزياء الكمومية لرصد ووزن تلك التفاصيل الصغيرة والحاسمة بشكل أفضل.

بدأ الباحثون، الذين يعملون في جامعة تشونغتشينغ العادية وجامعة شمال الصين، بأساس قوي: نظام رؤية حاسوبية مدرب مسبقاً تعلم بالفعل التعرف على الأشكال والأشياء العامة. كانوا يعلمون أن هذا النظام جيد في رؤية الصورة الكبيرة، لكنه غالداً ما يفوت القرائن الطفيفة اللازمة للتمييز بين الأنواع المتشابهة. ولإصلاح ذلك، بنوا مساراً جديداً يعمل بمثابة محرر دقيق لرؤية الكمبيوتر. أولاً، أضافوا خطوة لتثبيت سمات الصورة ضد التغيرات في الضوء. تماماً كما قد يغمض الإنسان عينيه أو يعدل وضعيته ليرى تفصيلاً بوضوح في الشمس مقابل الظل، يقوم هذا النظام بتنعيم الضجيج البصري الناتج عن الظلال والسطوع، مما يضمن أن يرى الكمبيوتر جزء الطائر نفسه باستمرار بغض النظر عن حالة الطقس.

بمجرد استقرار سمات الصورة، كان على النظام أن يقرر أي أجزاء من الصورة تهم فعلياً. وبدلاً من محاولة تحليل كل بكسل، صمم الباحثون آلية لاختيار الأجزاء الأكثر إفادة، مثل الرأس أو الذيل، وتجاهل الباقي. هذا يشبه كيف يركز مراقب الطيور انتباهه على علامات ميدانية محددة بدلاً من المشهد الطبيعي بأكمله. يختار النظام مجموعة صغيرة من هذه المناطق الرئيسية، مما يقلص تركيزه بفعالية إلى القرائن الأكثر واعدة.

الجزء الأكثر تميزاً في عملهم يتعلق بكيفية ربط النظام لهذه القرائن المختارة. عادة ما تقارن البرامج الحاسوبية التقليدية هذه الأجزاء باستخدام التشابه الرياضي القياسي، والذي قد يفتقر أحياناً إلى العلاقات المعقدة. قدم الباحثون وحدة تستخدم نسخة مبسطة من القياس الكمومي لوزن هذه الروابط. في هذا السياق، لا يستخدم النظام حاسوباً كمومياً كامل النطاق، بل أداة رياضية تحاكي كيفية معالجة الأنظمة الكمومية للمعلومات. تسمح هذه الأداة للكمبيوتر بنمذجة العلاقات بين أجزاء الطائر المختلفة بطريقة أكثر مرونة، مما يلتقط الأنماط الدقيقة التي قد تغفل عنها الطرق القياسية. إنها تعمل كمرشح متطور يقرر مقدار الأهمية التي يجب إعطاؤها لكل تفصيل مختار بناءً على علاقته بالآخرين.

أخيراً، يجمع النظام بين فهمه للطائر ككل وتحليله التفصيلي للأجزاء المحددة لاتخاذ قرار نهائي. اختبر الباحثون هذا النهج الجديد على ثلاث مجموعات بيانات صعبة تحتوي على صور للطيور والسيارات والطائرات. وأظهرت النتائج أن طريقتهم تفوقت باستمرار على النماذج الموجودة. ففي مجموعة بيانات الطيور، حققت دقة بلغت 92.0 بالمائة؛ وفي مجموعة بيانات السيارات، 94.2 بالمائة؛ وفي مجموعة بيانات الطائرات، 89.5 بالمائة. تمثل هذه الأرقام تحسناً واضحاً عن الطرق السابقة، بما في ذلك تلك التي استخدمت أنظمة رؤية حاسوبية قوية دون هذا التركيز المحدد على التفاصيل المحلية.

وبعيداً عن مجرد الحصول على الإجابة الصحيحة بشكل أكثر تكراراً، أثبت النظام الجديد أنه أكثر موثوقية عندما تكون الظروف صعبة. فعندما اختبر الباحثون النماذج تحت ضوء ساطع محاكى، أو ظلال عميقة، أو حجب جزئي للرؤية، صمدت الطريقة الجديدة بشكل أفضل من غيرها. فقد عانت من انخفاض أقل في الأداء، مما يشير إلى أن الخطوات المتخذة لتثبيت الصورة واختيار المناطق المهمة بعناية جعلت النظام أكثر قوة ضد العيوب الواقعية. كما أكدت الدراسة أن كل جزء من تصميمهم الجديد ساهم في النجاح؛ إذ أدى إزالة أي من الخطوات، مثل مرشح تثبيت الضوء أو الوزن المستوحى من الكم، إلى انخفاض الدقة.

يؤكد الباحثون أن عملهم لا يتعلق باستبدال التكنولوجيا الحالية بشيء غير مثبت تماماً، بل بإضافة تحسين محدد ومستهدف إلى الأنظمة القوية الموجودة. لقد وجدوا أنه حتى مع وجود نموذج أساسي قوي جداً، فإن القدرة على تثبيت التفاصيل المحلية ونمذجة علاقاتها المعقدة كانت المفتاح لفتح آفاق أداء أعلى. وبينما يعد المكون المستوحى من الكم إضافة خفيفة الوزن بدلاً من كونه حاسوباً كمومياً كاملاً، إلا أنه وفر ميزة ملموسة في كيفية فهم النظام للروابط الدقيقة بين أجزاء مختلفة من الصورة. ويقدم هذا النهج مساراً واعداً للمهام التي يكون فيها رؤية الاختلافات الصغيرة أمراً جوهرياً، من تحديد الأنواع النادرة إلى رصد العيوب في التصنيع الصناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →