← أحدث الأبحاث
🤖 AI

World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty

تقترح هذه الورقة البحثية C3، وهي طريقة مبتكرة لتقدير عدم اليقين تقوم بتدريب نماذج الفيديو القابلة للتحكم لتوليد خرائط حرارية للثقة عالية الدقة ومعايرة على مستوى شبه الرقعة (subpatch) من خلال تقدير عدم اليقين في الفضاء الكامن واستخدام قواعد تسجيل ملائمة تماماً، مما يتيح الكشف الموثوق عن الهلوسة وتحديد البيانات الخارجة عن التوزيع لتطبيقات الروبوتات.

المؤلفون الأصليون: Zhiting Mei, Tenny Yin, Micah Baker, Ola Shorinwa, Anirudha Majumdar

نُشر 2026-03-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhiting Mei, Tenny Yin, Micah Baker, Ola Shorinwa, Anirudha Majumdar

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك كاميرا فيديو سحرية وذكية للغاية يمكنها التنبؤ بالمستقبل. تخبر الكاميرا: "يا ذراع الروبوت، ارفع ذلك الكوب الأحمر"، فتقوم فوراً بإنشاء فيديو لما سيحدث تالياً بالضبط. هذا هو ما تفعله نماذج الفيديو القابلة للتحكم (Controllable Video Models) الحديثة؛ فهي مذهلة في إنشاء أفلام واقعية لحركات الروبوتات، أو سقوط الأشياء، أو تطور المشاهد.

لكن هناك مشكلة: هذه الكاميرات تكذب أحياناً.

تماماً مثل الشخص الحالم الذي يضيع في خياله الخاص، تقوم هذه النماذج الذكية أحياناً بـ "الهلوسة". قد تُظهر لك الروبوت وهو يلتقط كوباً ليس موجوداً أصلاً، أو يتحول الكوب إلى موزة، أو تمر يد الروبوت من خلال الطاولة. الجزء المخيف؟ الذكاء الاصطناعي لا يعرف أنه يكذب. إنه يعرض لك الفيديو المزيف بثقة بنسبة 100%، مما يجعلك تعتقد أنه حقيقي.

هذه مشكلة ضخمة في مجال الروبوتات. إذا كانت "رؤية المستقبل" لدى سيارة ذاتية القيادة تهلوس وتعتبر مشاةً مجرد سحابة، فقد تصطدم بهم. نحن بحاجة لطريقة نقول بها للذكاء الاصطناعي: "مهلاً، أنت لست متأكداً من هذا الجزء. لا تثق به."

إليك C3: "كاشف الصدق" لفيديوهات الذكاء الاصطناعي

قام الباحثون في جامعة برينستون ببناء نظام جديد يسمى C3 (المعاير، القابل للتحكم، والمستمر - Calibrated Controllable Continuous). فكر في C3 ليس ككاميرا جديدة، بل كـ مشرف صادق يجلس بجانب مولد الفيديو مباشرة.

إليك كيف يعمل C3، باستخدام بعض التشبيهات البسيطة:

1. "بطاقة تقييم الثقة" (بدلاً من مجرد صورة)

عادةً، عندما ينشئ الذكاء الاصطناعي فيديو، فإنه يعطيك الصورة فقط. يضيف C3 طبقة ثانية: بطاقة تقييم الثقة.

  • التشبيه: تخيل مذيع نشرة الطقس. المذيع العادي يقول: "ستمطر غداً". أما C3 فهو مثل مذيع يقول: "ستمطر غداً، لكنني متأكد بنسبة 40% فقط بشأن الجانب الشمالي من المدينة".
  • كيف يعمل: يقوم C3 بتقسيم الفيديو إلى مربعات صغيرة جداً (subpatches). لكل مربع على حدة، يسأل الذكاء الاصطناعي: "ما مدى تأكدك من أن هذه البكسل حقيقية؟" إذا كان الذكاء الاصطناعي يخمن، يضع C3 علامة بـ خريطة حرارية حمراء (مثل علامة تحذير) على ذلك المكان. وإذا كان الذكاء الاصطناعي واثقاً، يظل اللون بارداً وأزرق.

2. خدعة "اللغة السرية" (الفضاء الكامن - Latent Space)

للتحقق مما إذا كان الذكاء الاصطناعي يكذب، يمكنك محاولة مشاهدة الفيديو ومقارنته بالواقع. لكن هذا يستغرق وقتاً طويلاً ويتطلب حاسوباً خارقاً.

  • التشبيه: تخيل محاولة التحقق مما إذا كان الطاهي يطبخ شريحة لحم مثالية عن طريق تذوق الطبق النهائي (فضاء البكسل - Pixel Space). إنها عملية بطيئة وفوضوية. C3 أكثر ذكاءً؛ فهو يستمع إلى أفكار الطاهي الداخلية بينما لا يزال في المطبخ (الفضاء الكامن - Latent Space).
  • كيف يعمل: نماذج فيديو الذكاء الاصطناعي لا "ترى" البكسلات فعلياً؛ بل تفكر بلغة مضغوطة وسرية تسمى "الفضاء الكامن". يتعلم C3 قراءة هذه اللغة السرية. إنه يتحقق من ثقة الذكاء الاصطناعي الداخلية قبل أن يتم رسم الفيديو بالكامل. وهذا يجعله سريعاً جداً وغير مكلف في التشغيل، حتى مع النماذج الضخمة.

3. تعليم الذكاء الاصطناعي قول "لا أعرف"

الابتكار الأكبر هو كيفية تعليم الذكاء الاصطناعي أن يكون صادقاً.

  • التشبيه: تخيل طالباً يؤدي امتحاناً. إذا خمن عشوائياً وأصاب الإجابة، يحصل على نجمة ذهبية. ولكن إذا خمن وأخطأ، يحصل على عقوبة. يستخدم C3 قاعدة تسجيل خاصة (تسمى قاعدة التسجيل الصحيحة - Proper Scoring Rule) تعاقب الذكاء الاصطناعي إذا كان واثقاً جداً بينما هو في الواقع مخطئ.
  • النتيجة: يتعلم الذكاء الاصطناعي أن كون المرء صادقاً بشأن عدم يقينه أكثر قيمة من التظاهر بالعبقرية. إنه يتعلم أن يقول: "أنا لست متأكداً من هذا الجزء"، بدلاً من اختلاق قصة مزيفة.

لماذا يهم هذا؟ (الاختبار في العالم الحقيقي)

اختبر الباحثون C3 في مختبر روبوتات حقيقي. أعطوا الروبوت مهاماً لم يرها من قبل، مثل:

  • خلفيات جديدة: وضع هيكل عظمي في المطبخ.
  • إضاءة غريبة: تشغيل وإطفاء الأضواء بسرعة.
  • أدوات غريبة: ربط منشفة بيد الروبوت.

النتيجة:
عندما حاول الروبوت القيام بهذه المهام الغريبة، بدأ مولد الفيديو بالهلوسة (على سبيل المثال، تحول يد الروبوت إلى كتلة هلامية).

  • بدون C3: سيقوم الروبوت بتوليد فيديو مزيف ويحاول التصرف بناءً عليه، مما قد يؤدي إلى الاصطدام أو كسر الأشياء.
  • مع C3: في اللحظة التي واجه فيها الروبوت الإضاءة الغريبة أو الهيكل العظمي، أضاء C3 الشاشة بـ مناطق تحذير حمراء ساطعة. لقد أخبر النظام: "توقف! أنا لا أعرف ما الذي يحدث هنا. لا تثق بهذا الفيديو!"

الخلاية

C3 هو بمثابة شبكة أمان لخيال الذكاء الاصطناعي.

إنه يسم يسمح للروبوتات باستخدام نماذج الفيديو القوية لـ "رؤية" المستقبل، ولكنه يضيف طبقة حاسمة من الوعي الذاتي. إنه يضمن أنه عندما يبدأ الذكاء الاصطناعي في تخيل فيزياء مستحيلة (مثل اختفاء الأشياء أو تغير لونها)، فإنه يرفع راية حمراء على الفور.

في عالم نريد فيه للروبوتات أن تساعدنا في منازلنا ومستشفياتنا، نحن لا نحتاج فقط إلى روبوتات ذكية؛ بل نحتاج إلى روبوتات تعرف متى لا تعرف. C3 يمنحها هذا التواضع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →