← أحدث الأبحاث
💻 computer science

Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought

تقترح هذه الورقة البحثية "سلسلة التفكير البصري الرقمي" (NV-CoT)، وهو إطار عمل يُمكّن النماذج اللغوية الكبيرة متعددة الوسائط من إجراء استدلال دقيق مرتبط بالمنطقة من خلال توليد إحداثيات عددية مستمرة كأفعال، مما يتغلب على قيود النهج القائم على النصوص المتقطعة أو الرقع الثابتة مع تحسين دقة التحديد وكفاءة التدريب.

المؤلفون الأصليون: Kesen Zhao, Beier Zhu, Junbao Zhou, Xingyu Zhu, Zhongqi Yue, Hanwang Zhang

نُشر 2026-03-02
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kesen Zhao, Beier Zhu, Junbao Zhou, Xingyu Zhu, Zhongqi Yue, Hanwang Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت ذكي جداً كيف ينظر إلى صورة ويجيب على سؤال حولها، مثل "ماذا يمسك الرجل الذي على اليسار؟"

للقيام بذلك، يحتاج الروبوت إلى التقريب (Zoom in) على جزء محدد من الصورة (يدي الرجل مثلاً) ليلقي نظرة أفضل قبل الإجابة. تسمى هذه العملية "سلسلة التفكير البصري" (Visual Chain-of-Thought).

لفترة طويلة، كان على الروبوتات القيام بذلك بطريقة خرقاء للغاية. إليك قصة كيف قامت هذه الورقة البحثية بحل هذه المشكلة باستخدام طريقة جديدة تسمى NV-CoT.

الطريقة القديمة: مشكلة "البكسلات" (Pixelated)

تخيل أنك تحاول إخبار صديقك بمكان شجرة معينة في حديقة ضخمة.

  1. طريقة "النصوص" (الطريقة القديمة):
    يحاول الروبوت وصف موقع الشجرة باستخدام الكلمات. يقول: "الشجرة عند 3... 1... 5... 9."
  • المشكلة: بالنسبة للروبوت، "3" و"4" هما مجرد كلمتين مختلفتين تماماً، مثل "تفاحة" و"موزة". هو لا يفهم أنهما بجانب بعضهما البعض مباشرة. إذا كانت الشجرة في الواقع عند 3.1، وخمن الروبوت أنها عند 3.9، سيعتقد الروبوت أنه ارتكب خطأً فادحاً لأن الأرقام كلمات مختلفة تماماً. الأمر يشبه محاولة قياس غرفة بمسطرة تحتوي فقط على بوصات كاملة، بدون كسور. إنه أمر غير دقيق ومربك.
  1. طريقة "الرقعة" (طريقة قديمة أخرى):
    يقوم الروبوت بتقطيع الصورة إلى شبكة ضخمة من كتل الليغو (Patches). يمكنه فقط الإشارة إلى "الكتلة رقم 42".
  • المشكلة: ماذا لو كانت الشجرة تقع تماماً على الخط الفاصل بين الكتلة 42 والكتلة 43؟ لن يستطيع الروبوت أن يكون دقيقاً. إنه مقيد بحجم كتل الليغو، بغض النظر عن مدى صغرها.

الطريقة الجديدة: NV-CoT (المنزلق السلس)

ابتكر المؤلفون في هذه الورقة، كيسين تشاو وفريقه، حلاً عبقرياً يسمى Numerical Visual Chain-of-Thought (NV-CoT).

بدلاً من استخدام الكلمات أو كتل الليغو، أعطوا الروبوت منزلقاً سلساً (مثل مفتاح التحكم في مستوى الصوت في المسجل أو مفتاح تعتيم الضوء).

  • كيف يعمل: عندما يحتاج الروبوت إلى التقريب، فإنه لا يقول "3، 1، 5، 9". بدلاً من ذلك، يقوم بتوليد رقم سلس ومستمر مثل 3.142.
  • السحر: نظرًا لأنه رقم سلس، يدرك الروبوت أن 3.14 قريبة جداً من 3.15. إذا أخطأ الهدف بمقدار ضئيل جداً، فإنه يعرف أنه كان "قريباً جداً من الصواب"، وليس "مخطئاً تماماً". هذا يسمح للروبوت بالإشارة إلى النقطة المحددة بدقة الليزر.

تشبيه "غاوسي" و"لابلاس" (Gaussian and Laplace)

تذكر الورقة بعض المصطلحات الرياضية المعقدة مثل "Gaussian" و"Laplace". إليك ما تعنيه باللغة البسيطة:

  • سياسة غاوس (تخمين "منحنى الجرس"):
    تخيل أن الروبوت يرمي السهام على هدف. هو لا يرمي سهماً واحداً فحسب؛ بل يرمي مجموعة كاملة من السهام التي تتجمع حول المركز. هو يعلم: "أنا متأكد من أن الهدف هنا، لكنني قد أكون بعيداً قليلاً". هذا يساعد الروبوت على التعلم من خلال تجربة أماكن مختلفة قليلاً ورؤية أي منها يعمل بشكل أفضل.
  • سياسة لابلاس (التخمين "الأكثر حدة"):
    في بعض الأحيان، يحتاج الروبوت إلى أن يكون أكثر ثقة وأقل عرضة لارتكاب أخطاء كبيرة. طريقة "لابلاس" تشبه رامي السهام الذي يكون مركزاً جداً ونادراً ما يرمي سهماً بعيداً عن المركز. إنها رائعة في المواقف التي تحتاج فيها إلى دقة عالية وتجنب "القيم المتطرفة" (التخمينات العشوائية البعيدة).

لماذا يعد هذا أمراً هاماً؟

اختبر الباحثون هذه الطريقة الجديدة على ثلاثة "مستويات ألعاب فيديو" (اختبارات معيارية) حيث يتعين على الروبوتات العثور على الأشياء في الصور.

  1. إنها أسرع: يتعلم الروبوت كيفية التقريب بسرعة أكبر من ذي قبل.
  2. إنها أكثر دقة: يجد الروبوت الشيء المحدد (مثل مطحنة الفلفل أو حقيبة اليد) دون أن يقترب بالخطأ من الخلفية.
  3. إنها مرنة: تعمل سواء كان الروبوت يتم تعليمه بواسطة معلم (ضبط دقيق تحت الإشراف) أو يتعلم من خلال التجربة والخطأ (التعلم المعزز).

الخلاصة

فكر في الروبوتات القديمة كأشخاص يحاولون التنقل في مدينة باستخدام خريطة تحتوي فقط على الطرق السريعة الرئيسية. كان بإمكانهم الوصول قريباً، لكنهم غالباً ما كانوا يضيعون في التفاصيل.

NV-CoT يعطي الروبوت نظام GPS مع ملاحة خطوة بخطوة. فهو يسمح له بالقول: "انعطف يساراً عند 42.5 متراً"، بدلاً من قول "انعطف يساراً عند التقاطع الكبير التالي". هذا التغيير الصغير يجعل الروبوت أكثر ذكاءً، وأسرع، وأفضل في فهم العالم المرئي.

باختختصار: لقد علموا الروبوت أن يتوقف عن التخمين بالكلمات ويبدأ في القياس بأرقام سلسة ودقيقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →