A Two-Stage Detection-Tracking Framework for Stable Apple Quality Inspection in Dense Conveyor-Belt Environments
تقدم هذه الورقة إطار عمل للكشف والتتبع يتكون من مرحلتين يجمع بين تحديد المواقع باستخدام YOLOv8، والحفاظ على الهوية عبر ByteTrack، وتصنيف العيوب باستخدام ResNet18 مع التجميع على مستوى المسار لتحقيق فحص مستقر ومتسق زمنياً لجودة التفاح في بيئات أحزمة النقل المزدحمة، متفوقة بذلك على طرق الاستدلال التقليدية القائمة على الإطارات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل مصنع تفاح مزدحمًا حيث تندفع آلاف التفاحات على حزام ناقل، تصطدم ببعضها البعض، وتدور، وأحيانًا تغطيها الظلال أو تصبح ضبابية بسبب السرعة. يحتاج المصنع لفرزها: التفاح الجيد يذهب إلى حاوية "الدرجة الممتازة"، والتفاح السيئ (المخدوش، أو المتعفن، أو المصاب بالقشور) يذهب إلى حاوية "السماد".
المشكلة؟ إذا التقطت مجرد لقطة سريعة لتفاحة وهي تمر بسرعة، فقد ترتبك عيناك (أو كاميرا الكمبيوتر). في ثانية، قد يبدو الكدم وجوده كأنه ظل؛ وفي الثانية التالية، تدور التفاحة وتبدو مثالية. إذا اتخذ الكمبيوتر قرارًا بناءً على لقطة واحدة فقط، فقد يتذبذب بين القرارات: "جيدة! سيئة! جيدة! سيئة!" مما يؤدي إلى الفوضى وهدر الثمار.
تقترح هذه الورقة طريقة أذكى لفرز التفاح، تعمل كـ فريق تحقيق مكون من خطوتين لا يكتفي بمجرد النظر إلى صورة واحدة، بل يتابع رحلة التفاحة بأكملها.
فريق الخطوتين
الخطوة 1: الراصد (YOLOv8)
تخيل هذا كحارس أمن مدرب تدريبًا عاليًا قضى سنوات في مراقبة التفاح في بستان مشمس. على الرغم من أن حزام المصنع يبدو مختلفًا (أضواء صناعية، تفاح متزاحم)، إلا أن هذا الحارس بارع جدًا في رصد التفاح لدرجة أنه يمكنه العثور عليها فورًا في فيديو المصنع الفوضوي. يقوم برسم مربع حول كل تفاحة يراها.
الخطوة 2: المتتبع (ByteTrack)
هذه هي الخدعة السحرية. في النظام العادي، قد يفقد الكمبيوتر تتبع تفاحة لجزء من الثانية ويعتقد أنها تفاحة جديدة. يستخدم هذا النظام "متتبعًا" يعمل مثل بطاقة الاسم.
- عندما يرى الراصد تفاحة، يمنحها المتتبع معرفًا فريدًا (مثل "التفاحة رقم 42").
- حتى لو اختفت التفاحة رقم 42 جزئيًا خلف تفاحة أخرى أو أصبحت ضبابية بسبب الحركة، فإن المتتبع يتذكر: "لا تزال هذه هي التفاحة رقم 42"، ويتبعها طوال طريقها.
مفتش الجودة (ResNet18)
بمجرد أن يتبع المتتبع التفاحة لبضع ثوانٍ، ينظر مفتش جودة متخصص (عقل ذكاء اصطناعي ذكي) إلى قشرة التفاحة.
- الطريقة القديمة: كان المفتش يصرخ بالحكم في كل مرة تمر فيها التفاحة أمام الكاميرا: "سيئة!" ثم "جيدة!" ثم "سيئة!" بناءً على إطار واحد مهتز.
- الطريقة الجديدة: نظرًا لأن المتتبع يتابع التفاحة رقم 42 منذ فترة، فإن المفتش يتمكن من رؤية التفاحة من زوايا مختلفة وتحت أضواء مختلفة. وبدلاً من الصراخ فورًا، ينتظر المفتش ويجمع الآراء.
"تصويت الأغلبية" (التجميع)
هذا هو الجزء الأهم. تخيل أن التفاحة رقم 42 تمر أمام الكاميرا 20 مرة.
- 18 مرة، يقول الذكاء الاصطناعي: "هذه التفاحة جيدة".
- مرتان، يرتبك الذكاء الاصطناعي بسبب ظل ما ويقول: "هذه التفاحة سيئة".
إذا نظرت فقط إلى هاتين اللحظتين من الارتباك، فسترمي تفاحة جيدة. لكن هذا النظام يستخدم تصويت الأغلبية. فهو ينظر إلى الـ 20 رأيًا ويقول: "حسنًا، 18 من أصل 20 يقولون إنها جيدة. الحكم النهائي هو جيدة".
هذا يمنع النظام من الذعر بسبب إطار واحد ضبابي. إنه يثبت القرار، تمامًا كما لا تقرر أن فيلمًا ما سيء بسبب مشهد واحد سيء؛ بل تنتظر حتى النهاية لتحكم على القصة بأكملها.
لماذا هذا مهم؟
اختبر الباحثون هذا على فيديوهات مصانع حقيقية. ووجدوا أن:
- ارتباك أقل: توقف النظام عن التذبذب بين "جيد" و"سيئ" لنفس التفاحة.
- فرز أفضل: من خلال انتظار رؤية "قصة" حركة التفاحة بالكامل، تمكنوا من عد التفاح السيئ الموجود فعليًا على الحزام بدقة، بدلاً من الحصول على عد غير متسق وفوضوي.
باخت-صار: بدلاً من الحكم على الكتاب من غلافه (أو على التفاحة من صورة واحدة ضبابية)، يقرأ هذا النظام الفصل بأكمله. إنه يتبع التفاحة، ويجمع أدلة كافية، ويتخذ قرارًا هادئًا ومستقرًا، مما يضمن التخلص من التفاح السيئ حقًا فقط.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.