← أحدث الأبحاث
🤖 AI

A Deterministic Evidence Layer for Vision-Language Autism Screening from Naturalistic Home Video

تقترح هذه الورقة طبقة أدلة حتمية تعمل على تثبيت مخرجات نماذج الرؤية واللغة من أجل فحص التوحد، وذلك عبر تحويل مقاطع الفيديو المنزلية الطبيعية إلى جداول أحداث مصنفة وموسومة زمنياً يتم تقييمها من خلال آلية شفافة لوزن الأدلة، مما يحقق أداءً تشخيصياً قوياً وقابلاً للتفسير لدى أطفال مرحلة ما قبل المدرسة.

المؤلفون الأصليون: Wenqi Li, Mindi Ruan, Chuanbo Hu, Shuo Wang, Xin Li

نُشر 2026-10-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wenqi Li, Mindi Ruan, Chuanbo Hu, Shuo Wang, Xin Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

غالباً ما يبدأ تشخيص اضطراب طيف التوحد بمراقبة أخصائي لطفل أثناء اللعب، حيث يبحث عن علامات دقيقة في كيفية تفاعله مع الآخرين أو تكراره لحركات معينة. هذه العملية فعالة للغاية ولكنها تعتمد على مورد نادر: الخبراء المدربون. ونظراً لعدم وجود عدد كافٍ من المتخصصين لرؤية كل طفل قد يحتاج إلى المساعدة، تواجه العائلات غالباً فترات انتظار طويلة لإجراء التقييم، مما يؤدي إلى تأخير التدخل المبكر. وفي السنوات الأخيرة، اتجه العلماء إلى مقاطع الفيديو المنزلية -التي يسجلها الآباء بهواتفهم أثناء اللعب العادي- كوسيلة لسد هذه الفجوة. والأمل يكمن في أن تتمكن الذكاء الاصطناعي من مشاهدة هذه الفيديوهات ورصد نفس الأنماط التي يلاحظها الخبير البشري، مما يوفر خطوة أولى سريعة ومتاحة لتحديد الأطفال الذين يحتاجون إلى اهتمام عاجل. ومع ذلك، ظهرت عقبة رئيسية: حتى أكثر نماذج الذكاء الاصطناعي تقدماً، عندما تُطلب منها إصدار الحكم نفسه مرتين، يمكن أن تعطي إجابات مختلفة. هذا التضارب يجعلها غير موثوقة للفحص الطبي، حيث يجب أن يكون القرار هو نفسه في كل مرة ليكون جديراً بالثقة.

لقد تصدى فريق من الباحثين لهذه المشكلة من خلال بناء نوع جديد من أنظمة الفحص يفصل بين ما يراه الكمبيوتر وكيفية اتخاذه للقرار. فبدلاً من مطالبة نموذج ذكاء اصطناعي واحد بمشاهدة فيديو وقول "توحد" أو "لا توحد" فوراً، ابتكروا عملية مكونة من خطوتين تعمل أشبه بمراقب بشري دقيق يليه محاسب صارم. أولاً، يشاهد نموذج رؤية قوي الفيديو ويكتب قائمة مفصلة بالأحداث، مسجلاً بالضبط ما فعله الطفل، ومتى حدث ذلك، وماذا فعل الوالد أو مقدم الرعاية قبله مباشرة. ومن الأهمية بمكان أن يُجبر هذا النموذج على الالتزام فقط بما هو مرئي في الفيديو، متجنباً التخمينات حول أفكار الطفل الداخلية. كما يجب عليه أيضاً سرد أمثلة على السلوك الطبيعي، وليس فقط السلوكيات غير العادية، لتقديم صورة كاملة. ثم تُمرر هذه القائمة إلى نموذج ثانٍ يعتمد على النصوص فقط، يقوم بتعديل أهمية كل حدث بناءً على عمر الطفل، مدركاً أن بعض السلوكيات قد تكون طبيعية لطفل في مرحلة الحبو (تودلر) ولكنها مثيرة للقلق لطفل في مرحلة ما قبل المدرسة. وأخيراً، يقوم برنامج حاسوبي حتمي، يتبع قواعد رياضية ثابتة دون أي تخمين، بجمع الأدلة من هذه القائمة لإنتاج درجة مخاطر نهائية.

اختبر الباحثون هذا النظام على 43 مقطع فيديو منزلياً لأطفال في سن ما قبل المدرسة، تم تسجيلها من قبل عائلاتهم دون تعليمات خاصة أو سيناريوهات محددة. تضمنت الفيديوهات أطفالاً تم تشخيصهم بالتوحد من قبل متخصصين وأطفالاً ينمون بشكل طبيعي. وعندما شاهد النظام هذه الفيديوهات، حقق دقة عالية، حيث حدد مستوى المخاطر بشكل صحيح في حوالي 86 بالمائة من الحالات. والأهم من ذلك، كان النظام مستقراً بشكل ملحوظ؛ فعندما قام الباحثون بتشغيل نفس الفيديوهات عبر النظام ثلاث مرات، ظل القرار النهائي كما هو في ما يقرب من ثلاثة أرباع المقاطع في كل مرة. وفي المقابل، فإن نموذج الذكاء الاصطناعي القياسي بدون هذه البنية الخاصة كان يغير رأيه في ما يقرب من ثلث المقاطع بين التشغيلات. وكان النظام الجديد جيداً بشكل خاص في تجنب الإنذارات الكاذبة؛ إذ لم يقم أبداً بتصنيف طفل ينمو بشكل طبيعي على أنه عالي المخاطر في كل تشغيل، بينما صنف النموذج القياسي تسعة من أصل واحد وثلاثين طفلاً على أنهم عالي المخاطر في كل تشغيل.

كان المفتاح وراء هذا النجاح ليس جعل الذكاء الاصطناعي أكثر ذكاءً، بل تغيير كيفية استخدامه. فقد وجد الباحثون أن عدم الاستقرار في النماذج القياسية يأتي من الطريقة التي تولد بها الإجابات، والتي يمكن أن تختلف قليلاً حتى عندما تكون الإعدادات متطابقة. ومن خلال نقل القرار النهائي بعيداً عن الذكاء الاصطناعي وإلى نظام تسجيل ثابت يقوم ببساطة بجمع الأدلة التي جمعها الذكاء الاصطناعي، أزالوا هذا المصدر للخطأ. كما قدم النظام قواعد صارمة للذكاء الاصطناعي، تتطلب منه تسمية اللحظة المحددة التي فشل فيها الطفل في الاستجابة لنداء الوالد أو إيماءته، بدلاً من مجرد التخمين بأن الطفل غير مستجيب. هذا النهج "المتجذر" يعني أن الذكاء الاصطناعي يمكنه فقط الإبلاغ عما رآه بالفعل، وأن الدرجة النهائية بُنيت على سجل شفاف لتلك الملاحظات.

ورغم أن النتائج واعدة، إلا أن الباحثين حذرون في الإشارة إلى حدود عملهم. فقد تم اختبار النظام على مجموعة صغيرة نسبياً من الأطفال من موقع واحد، وقد فاته ثلاثة أطفال مصابين بالتوحد في كل تشغيل، مما يشير إلى أن التكنولوجيا الحالية لا تزال تواجه صعوبة في اكتشاف بعض العلامات الدقيقة. يعمل النظام بشكل أفضل كأداة فرز للمساعدة في تحديد أولويات الأطفال لتقييم المتخصصين، وليس كتشخيص نهائي. وتوضح الدراسة أنه من خلال الجمع بين قدرة التعرف على الأنماط للذكاء الاصطناني الحديث وقواعد اتخاذ القرار الصارمة والشفافة، من الممكن إنشاء أداة فحص تكون دقيقة وموثوقة في آن واحد. ويقدم هذا النهج مساراً للمضي قدماً في استخدام مقاطع الفيديو المنزلية لتقليل وقت الانتظار لتقييمات التوحد، بشرما يتوسع العمل المستقبلي ليشمل أطفالاً أكثر تنوعاً ويحسن قدرته على رصد كل حالة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →