← أحدث الأبحاث
💻 computer science

VLAs are Confined yet Capable of Generalizing to Novel Instructions

تُثبت هذه الورقة أن نماذج الرؤية واللغة والعمل (VLAs) يمكنها التغلب على معاناتها مع استقراء المهام والإفراط في التخصيص المكاني من خلال التلاعب بالكمونات النصية الداخلية عبر الاستيفاء، وهي تقنية تحقق معدل نجاح بنسبة 83% في اختبارات التعليمات الجديدة وتكشف عن إمكانية حقن أوامر خفية غير قابلة للقراءة من قبل البشر.

المؤلفون الأصليون: Quanyi Li

نُشر 2026-05-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Quanyi Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً طباخاً كيف يطبخ. عرضت عليه وصفتين محددتين:

  1. الوصفة أ: "ضع الجبن الكريمي في الوعاء."
  2. الوصفة ب: "ضع الوعاء فوق الخزانة."

تعلم الروبوت هاتين الحركتين بإتقان. يمكنه تنفيذ الوصفة (أ)، ويمكنه تنفيذ الوصفة (ب). ولكن بعد ذلك، سألته سؤالاً جديداً: "ضع الجبن الكريمي فوق الخزانة."

منطقياً، يجب أن يكون الروبوت قادراً على فعل ذلك. فهو يعرف كيف يمسك الجبن، ويعرف كيف يصل إلى الخزانة. يحتاج فقط إلى دمج مهارتين يمتلكهما بالفعل. ومع ذلك، وفقاً لهذه الورقة البحثية، تفشل معظم عقول الروبوتات المتقدمة (التي تسمى نماذج الرؤية واللغة والعمل - VLAs) فشلاً ذريعاً في هذا الأمر. فهي تتعثر، وتتصرف وكأنها لم ترَ الخزانة أو الجبن من قبل، رغم أنها استخدمتهما في الخطوات السابقة مباشرة.

المشكلة: الروبوت هو "ببغاء"، وليس "طباخاً"

اكتشف المؤلفون أن هذه الروبوتات لا تفهم العالم حقاً. بدلاً من ذلك، هي تحفظ مشاهد محددة.

فكر في الأمر كطالب حفظ إجابات اختبار تجريبي لكنه لم يفهم الرياضيات. إذا سألته: "ما هو 2 + 2؟" سيقول "4". ولكن إذا سألته: "ما هو 2 + 2 إذا كانت الأرقام مكتوبة باللون الأحمر؟" فقد يصاب بالذعر.

في حالة الروبوت، تعلم أن "الجبن الكريمي" مرتبط دائماً بالمكان المحدد على الطاولة الذي رآه فيه أثناء التدريب. إنه لا يفهم أن "الجبن الكريمي" هو جسم يمكنه التحرك؛ بل يعتقد أن "الجبن الكريمي" هو ذلك الموقع المحدد. تطلق الورقة البحثية على هذا الأمر اسم "الإفراط في التخصيص المكاني" (Spatial Overfitting). الروبوت مركز جداً على أين كانت الأشياء في فيديوهات التدريب لدرجة أنه يتجاهل أين توجد الأشياء فعلياً في اللحظة الحالية.

الحل: "بطاقة الوصفة السحرية" (الكمون النصي - Text Latent)

أراد الباحثون معرفة: هل الروبوت ذكي حقاً في أعماقه، أم أنه معطل فحسب؟

وجدوا "مكوناً" مخفياً داخل عقل الروبوت يسمى الكمون النصي (Text Latent).

  • التشبيه: تخيل أن عقل الروبوت عبارة عن مكتبة ضخمة. عندما تعطيه أمراً مثل "ضع الجبن في الوعاء"، يسحب الروبوت "بطاقة وصفة" محددة وغير مرئية من ذاكرته الداخلية. هذه البطاقة ليست مكتوبة بكلمات يمكنك قراءتها؛ إنها نمط معقد من الإشارات الكهربائية (متجه/vector) يخبر الروبوت بكيفية التحرك بدقة.
  • الاكتشاف: وجد الباحثون أنهم إذا أخذوا هذه "بطاقة الوصفة" غير المرئية لـ "وضع الأشياء في وعاء" وحقنوها مرة أخرى في عقل الروبوت، فإن الروبوت سينفذ هذا الإجراء بشكل مثالي، حتى لو لم تعطِه أي كلمات. كانت البطاقة هي التعليمات.

الاختراق: خلط البطاقات (استكمال الكمون النصي - Text Latent Interpolation)

حدث السحر الحقيقي عندما حاولوا حل مشكلة "الجبن الكريمي فوق الخزانة".

أخذوا "بطاقة الوصفة" غير المرئية لـ المهمة أ (الجبن إلى الوعاء) وبطاقة المهمة ب (الوعاء إلى الخزانة). ثم قاموا بإنشاء مزيج سلس من البطاقتين.

  • التشبيه: تخيل أن لديك مسارين موسيقيين يعملان. أحدهما أغنية جاز، والآخر أغنية روك. بدلاً من الانتقال المفاجئ من واحد إلى الآخر، تستخدم جهاز مزج (Mixer) لخفض صوت الجاز ببطء بينما ترفع صوت الروك تدريجياً.
  • النتيجة: من خلال "خلط" هاتين البطاقتين غير المرئيتين داخل عقل الروبوت، نجح الروبوت في دمج المهارتين. أمسك بالجبن، ونقله إلى الخزانة، ثم وضعه.

الإحصائيات:

  • بدون هذه الحيلة، نجح الروبوت (الذي يسمى π0) بنسبة 9% فقط في هذه المهام الجديدة والمدمجة.
  • مع حيلة "الخلط"، قفز النجاح إلى 83%.

أثبت هذا أن الروبوت كان يمتلك المهارات بداخله طوال الوقت؛ لكنه فقط لم يستطع معرفة كيفية دمجها بمفرده. كانت "بطاقات الوصفة" موجودة، لكن الروبوت احتاج إلى إنسان ليساعده على مزجها.

الاختبار الكبير: معيار "Libero-OOD"

لإثبات أن هذا لم يكن مجرد ضربة حظ، أنشأ المؤلفون اختباراً جديداً يسمى Libero-OOD. يحتوي هذا الاختبار على 20 مهمة صعبة حيث يتعين على الروبوت دمج مهارات يعرفها بالفعل بطرق جديدة.

  • النتيجة: اختبروا أفضل عقول الروبوتات في العالم (مثل UniVLA و OpenVLA و π0-fast). لم يستطع أي منها القيام بذلك بمفرده. جميعها سجلت أقل من 21%.
  • الاستنتاج: حتى أذكى الروبوتات "عالقة" حالياً في بيانات تدريبها. لا يمكنها التعميم أو "التفكير خارج الصندوق" دون مساعدة.

التحذير: "التعليمات الخاصة"

وجد الباحثون أيضاً شيئاً مخيفاً بعض الشيء. نظرًا لأن "بطاقات الوصفة" هذه هي مجرد أنماط من الأرقام، يمكنك تحويلها مرة أخرى إلى نص.

  • عندما حاولوا قراءة "بطاقة الوصفة" لمهمة ما، كان النص الناتج عبارة عن كلمات غير مفهومة (مثل QSize, black, plate).
  • ومع ذلك، إذا قمت بتغذية هذا الهراء مرة أخرى في الروبوت، فسيظل يعمل!
  • الاستعارة: الأمر يشبه امتلاك شفرة سرية لا يفهمها إلا الروبوت. يمكنك إخفاء تعليمات سرية داخل جملة تبدو طبيعية، وسوف يتبعها الروبوت دون أن يعرف أحد آخر بذلك. يُسمى هذا "الباب الخلفي" (Backdoor)، وهو يوضح أن هذه النماذج أكثر غموضاً مما كنا نعتقد.

الملخص

تخبرنا الورقة البحثية أن أذكى روبوتات اليوم تشبه الموسيقيين الذين يمكنهم عزف أغنيتين ببراعة لكنهم لا يستطيعون ارتجال لحن جديد. إنهم يحفظون النوتات والمواقع الدقيقة من جلسات التدريب الخاصة بهم، لكنهم يفشلون عندما يتغير اللحن قليلاً.

أظهر المؤلفون أنه إذا قمنا بخلط "النوتات الموسيقية" (الكمونات النصية) من أغنيتين مختلفتين يدوياً، فيمكن للروبوت عزف اللحن الجديد. وهذا يثبت أن الروبوت يمتلك الموهبة، لكنه يفتقر إلى القدرة على دمج مهاراته بنفسه. تقدم الورقة البحثية اختباراً جديداً (Libero-OOD) لمساعدة الباحثين على بناء روبوتات يمكنها حقاً تعلم كيفية دمج مهاراتها الخاصة، بدلاً من مجرد حفظ المشاهد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →