← أحدث الأبحاث
🤖 machine learning

ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery

تقدم هذه الورقة ThermEval، وهو معيار شامل يتكون من 55,000 زوج من أسئلة وأجوبة بصرية ومجموعة بيانات جديدة ذات خرائط حرارية كثيفة، لتوضيح أن نماذج الرؤية واللغة الحالية تعاني بشكل كبير في الاستدلال على الصور الحرارية بسبب اعتمادها على الأولويات المتمحورة حول الصور المرئية (RGB).

المؤلفون الأصليون: Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

نُشر 2026-02-17
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً نابغاً قرأ كل كتاب في المكتبة وشاهد كل فيلم صُنع على الإطلاق. هذا الطالب خبير في وصف ما يراه: "هذه تفاحة حمراء"، "هذا شاطئ مشمس"، "هذا كلب سعيد". إنه بارع في رؤية الـ RGB — أي رؤية العالم من خلال عدسة الألوان، والملمس، والضوء، تماماً مثل أعيننا البشرية.

لكن الآن، تخيل أنك سلمت هذا الطالب نظارات رؤية ليلية (كاميرات حرارية). فجأة، يبدو العالم مختلفاً تماماً. لا توجد تفاحات حمراء أو سماوات زرقاء. بدلاً من ذلك، أصبح كل شيء عبارة عن خريطة متوهجة من الحرارة. المحرك الساخن يبدو كشمس مستعرة؛ والحجر البارد يبدو كقمر متجمد.

هذه الورقة البحثية، ThermEval، هي في الأساس "شهادة درجات" لطالبنا النابغ عندما يحاول استخدام نظارات الرؤية الليلية تلك. لقد اكتشف المؤلفون أنه بينما كان الطالب بارعاً في وصف الصور، إلا أنه كان سيئاً للغاية في فهم الحرارة.

المشكلة: الذكاء الاصطناعي "المصاب بعمى الألوان"

تتدرب نماذج الذكاء الاصطناوية الحالية (نماذج الرؤية واللغة - VLMs) في الغالب على صور العالم الواقعي. إنهم يعرفون كيف يبدو "الشخص" في ضوء النهار. لكن الصور الحرارية لا تُظهر شخصاً؛ بل تُظهر بصمة حرارية.

سأل المؤلفون سؤالاً بسيطاً: إذا عرضت على ذكاء اصطناعي صورة حرارية لشخص، هل يمكنه إخبارك بمدى سخونة جبهته؟ هل يمكنه معرفة ما إذا كان أحد الأشخاص أكثر سخونة من الآخر؟

للأسف، كانت الإجابة هي "لا" قاطعة.

الحل: ThermEval (اختبار الحرارة)

لإثبات ذلك، صمم الباحثون امتحاناً ضخماً يسمى ThermEval. فكر فيه كاختبار قيادة متخصص، ولكن بدلاً من قيادة سيارة، يتعين على الذكاء الاصطناعي "القيادة" عبر عالم الحرارة.

لقد أنشأوا 55,000 سؤال تغطي سبع مهارات مختلفة:

  1. اختبار "هل هذه صورة؟": هل يمكن للذكاء الاصطناعي التمييز بين الصورة العادية والخريطة الحرارية؟ (معظم النماذج استطاعت).
  2. اختبار "تحول الألوان": تستخدم الكاميرات الحرارية غالباً لوحات ألوان مختلفة (مثل "Magma" أو "Viridis") لإظهار الحرارة. إذا قمت بتغيير الألوان، هل يرتبك الذكاء الاصطناعي؟ (نعم، الكثير منهم ارتبكوا).
  3. اختبار "عد الأشخاص": كم عدد الأشخاص الموجودين في هذه الخريطة الحرارية؟ (الأداء كان مهزوزاً قليلاً).
  4. اختبار "الميزان الحراري": هل يمكن للذكاء الاصطناعي قراءة شريط الألوان الصغير الموجود بجانب الصورة والذي يعمل كميزان حرارة؟ (الكثير منهم فشل فشلاً ذريعاً، حيث بدأوا في "الهلوسة" بأرقام مثل "335 درجة" بدلاً من "33.5").
  5. اختبار "الساخن مقابل البارد": من هو الأكثر سخونة، الشخص الذي على اليسار أم الذي على اليمين؟ (غالباً ما كان الذكاء الاصطناعي يخمن بناءً على ما "يعتقد" أن البشر يشعرون به عادةً، بدلاً من النظر إلى الصورة فعلياً).
  6. اختبار "درجة الحرارة الدقيقة": ما هي درجة الحرارة الدقيقة لهذا الأنف؟ (غالباً ما كان الذكاء الاصطناعي يخمن فقط "37 درجة مئوية" لأن هذا هو متوسط درجة حرارة جسم الإنسان، متجاهلاً الصورة الفعلية).
  7. اختبار "المسافة": هل يعرف الذكاء الاصطناً أن الحرارة تبدو مختلفة عندما تكون بعيداً؟ (معظم النماذج فشلت).

النتائج: الذكاء الاصطناعي "يهلوس" بالحرارة

كانت النتائج مفاجئة. حتى أكبر نماذج الذكاء الاصطناعي وأكثرها قوة (بعضها يمتلك مئات المليارات من المعلمات/Parameters) فشلت في هذه الاختبارات.

  • فخ "المعلومات النظرية": لم يكن الذكاء الاصطناعي ينظر إلى الخريطة الحرارية. بل كان يخمن بناءً على ما عرفه من بيانات التدريب الخاصة به. إذا سُئل: "كم تبلغ حرارة جبهة الإنسان؟"، سيقول "37 درجة مئوية" لأن هذا ما تعلمه في الكتب، حتى لو كانت الصورة تُظهر 40 درجة مئوية (حمى) أو 30 درجة مئوية (برودة). لقد كان يتجاهل الأدلة البصرية ويعتمد على المعلومات اللغوية المسبقة (ما يتوقعه أن يكون صحيحاً).
  • ارتباك "شريط الألوان": العديد من النماذج لم تستطع حتى قراءة مقياس درجة الحرارة الموجود على جانب الصورة. الأمر يشبه إعطاء شخص ما خريطة مع مفتاح للرموز، ثم تطلب منه تجاهل المفتاح وتخمين التضاريس.
  • حل "الضبط الدقيق": حاول الباحثون تعليم الذكاء الاصطناعي كيفية قراءة الخرائط الحرارية خصيصاً (الضبط الدقيق الخاضع للإشراف). ساعد هذا كثيراً! أصبح الذكاء الاصطناعي أفضل بكثير، وكاد يضاهي أداء البشر. لكنه لم يكن مثالياً بعد. الأمر يشبه تعليم طالب كيف يجتاز اختباراً معيناً، لكنه لا يزال لا يفهم حقاً فيزياء الحرارة.

لماذا يهم هذا؟

قد تعتقد: "وما الشأن؟ الذكاء الاصطناعي لا يستطيع قراءة الخرائط الحرارية بعد". لكن هذا أمر بالغ الأهمية في الحياة الواقعية. تُستخدم الكاميرات الحرارية في:

  • البحث والإنقاذ: للعثور على الأشخاص المفقودين في الغابات ليلاً.
  • الفحص الطبي: للكشف عن الحمى دون لمس الناس.
  • السيارات ذاتية القيادة: لرؤية المشاة في الظلام الدامس.
  • السلامة الصناعية: للعثور على الأسلاك الكهربائية التي ترتفع حرارتها قبل أن تشتعل.

إذا لم يستطع الذكاء الاصطناعي الذي يقود سيارة في الظلام التمييز بين صخرة دافئة وإنسان دافئ، أو إذا لم يستطع ذكاء اصطناعي طبي قياس الحمى بدقة، فقد يتعرض الناس للأذى.

الخلاصة

تخلص الورقة البحثية إلى أن الذكاء الاصطناعي الحالي يشبه فناناً عبقرياً لم يشعر بالشمس قط. يمكنه وصف صورة الشمس بشكل مثالي، لكنه لا يفهم ما الذي "تشعر" به الحرارة.

لإصلاح ذلك، لا يمكننا فقط جعل الذكاء الاصطناعي أكبر أو أذكى. نحن بحاجة إلى إعادة تدريبه من الصفر ليفهم الإشارات الفيزيائية مثل الحرارة، وليس فقط الألوان الجميلة. يعد معيار ThermEval الخطوة الأولى نحو إنشاء جيل جديد من الذكاء الاصطناعي يمكنه حقاً "رؤية" العالم غير المرئي لدرجات الحرارة.

باختصار: لقد بنينا اختباراً لنرى ما إذا كان بإمكان الذكاء الاصطناعي قراءة ميزان الحرارة. لقد فشلوا. الآن نحن نعرف بالضبط ما نحتاج لتعليمهم إياه لإنقاذ الأرواح في الظلام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →