Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy
تستقصي هذه الورقة إضافة اللغة اليونانية إلى سياسة الرؤية واللغة والعمل الخاصة بالروبوت باستخدام تعليمات أعيدت صياغتها آلياً فقط، كاشفةً أن التقييم القوي يتطلب معايير مرجعية صفرية وتكراراً للبذور لتجنب الاستنتاجات الخاطئة، بينما تثبت أن التدريب ثنائي اللغة يحقق تحسينات متسقة مقارنة بمجموعات الضبط رغم الإفراط في التخصيص لصياغات محددة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
أصبحت الروبوتات التي يمكنها الرؤية والفهم والحركة واقعاً ملموساً، لكنها تتحدث حالياً لغة واحدة فقط: الإنجليزية. تتعلم هذه الآلات من خلال مشاهدة مقاطع فيديو لبشر يؤدون مهاماً، حيث تكون التعليمات مكتوبة باللغة الإنجليزية. والبرمجيات التي تساعدها على فهم هذه الكلمات مدربة على كميات هائلة من النصوص الإنجليزية، مما يجعلها بارعة للغاية في تلك اللغة المحددة. وبالنسبة لأي شخص يتحدث اليونانية، أو أي لغة أخرى، فإن هذا يخلق حاجزاً صعباً. فلا توجد مكتبات فيديو لروبوتات تحرك الأشياء بتعليمات يونانية، وبناء واحدة من الصفر سيتطلب شهوراً من التوجيه اليدوي لذراع الروبوت لكل حركة على حدة. كان السؤال الذي طرحه الباحثون بسيطاً: هل يمكنهم أخذ البيانات الإنجليزية الموجودة، وترجمة التعليمات إلى اليونانية باستخدام الكمبيوتر، وتعليم الروبوت فهم اللغة الجديدة دون إعادة بناء النظام بأكمله؟
تبين أن الإجابة أكثر تعقيداً من مجرد ترجمة بسيطة. فقد أخذ فريق من الباحثين في "Sophea AI" و"KIEFER SA" في أثينا نظام روبوت مفتوح المصدر وغذّوه بآلاف التعليمات اليونانية التي أنشأتها آلة. لم يغيروا دماغ الروبوت أو هيكله الفيزيائي؛ بل قاموا ببساطة باستبدال النص الإنجليزي بنص يوناني. كانت عملية الترجمة سريعة وسهلة، ولم تستغرق سوى ساعات. ومع ذلك، بدأ العمل الحقيقي عندما حاولوا قياس ما إذا كان الروبوت يفهم حقاً ما يُقال له. في عالم الروبوتات، من السهل بشكل مفاجئ خداع النظام ليبدو ناجحاً بينما هو في الواقع مجرد يخمن. وجد الباحثون أن الاختبارات القياسية، التي عادة ما تعطي نتيجة نجاح أو فشل واضحة، قد خُدعت تماماً. واكتشفوا أن الروبوت يمكنه اتباع أمر يوناني بمعدلات نجاح عالية حتى عندما يكون الأمر بلا معنى، أو حتى عندما لم يتم تعليمه اليابقة من قبل. حدث هذا لأن الروبوت كان يتعلم التعرف على المشهد والأشياء بدلاً من قراءة الكلمات.
ولحل هذه المشكلة، اضطر الفريق إلى ابتكار طرق جديدة لاختبار الروبوت. فقد بنوا مجموعة ضابطة حيث أعطوا الروبوت عمداً تعليمات خاطئة باللغة اليونانية لمعرفة ما إذا كان سيحاول تنفيذ المهمة أم لا. ووجدوا أنه في مجموعة صغيرة مكونة من عشر مهام، بدا أن الروبوت المدرب بتعليمات يونانية مترجمة آلياً ينجح بنسبة تقارب أربعة وثمانين بالمائة. ولكن عندما اختبروه بالتعليمات الخاطئة، ظل ينجح بنسبة تقارب اثنين وثمانين بالمائة. أثبت هذا أن الروبوت لم يكن يقرأ اليونانية؛ بل كان يتفاعل مع الإعداد البصري فحسب. لقد كان الروبوت يتجاهل اللغة تماماً.
ثم جرب الباحثون نهجاً مختلفاً. استخدموا مجموعة أكبر تضم تسعين مهمة حيث يتعين على الروبوت الاختيار بين عدة أهداف محتملة في نفس المشهد. هنا، أصبحت اللغة هي الإشارة الوحيدة لإخبار الروبوت بما يجب فعله. ووجدوا أن الروبوت المدرب على تعليمات بالإنجليزية واليونانية معاً يمكنه اتباع الأوامر اليونانية بنسبة تقارب سبعة وعشرين بالمائة، وهو أمر أفضل بكثير من التخمين العشوائي. ومع ذلك، فإن الروبوت المدرب على اليونانية فقط، دون وجود بيانات إنجليزية لدعمه، بالكاد تحسن عن مستوى التخمين العشوائي. وبينما كان التدريب ثنائي اللغة يؤدي أداءً أفضل في المتوسط من التدريب باليونانية فقط، إلا أن النطاقات الإحصائية لأدائهما تداخلت بشكل كبير، مما يعني أن البيانات لا يمكنها التأكيد بشكل قاطع ما إذا كان التدريب الإنجليزي يعمل كدعامة ضرورية لتعلم اليونانية. كانت النتيجة الأكثر قوة هي أن العروض التوضيحية للغة المستهدفة ضرورية، لكنها بمفردها غالباً ما تكون غير كافية؛ فالمخطط (policy) المدرب على اليونانية فقط يكاد يتبع اللغة، حيث يبقى ضمن ثلاث نقاط من حد الفشل الخاص به عبر جولات اختبار متعددة.
كما كشفت الدراسة أن الروبوت لم يكن يتعلم اللغة اليونانية بالطريقة التي يتعلم بها البشر. بدلاً من ذلك، كان يحفظ الصياغات المحددة التي يستخدمها المترجم الآلي. وعندما اختبر الباحثون الروبوت بجمل يونانية كتبها برنامج كمبيوتر آخر، انخفض أداء الروبوت بشكل حاد. لقد تعلم أسلوب المترجم الأول، وليس اللغة نفسها. ولإصلاح ذلك، علموا الروبوت المهمة نفسها باستخدام سبع صياغات يونانية مختلفة. هذا التغيير البسيط جعل الروبوت أكثر متانة، مما قلل من انخفاض الأداء إلى النصف عند اختباره بصياغات جديدة. أظهر هذا أن التنوع في بيانات التدريب ضروري لتمكين الروبوت من التعميم خارج أسلوب الكتابة الخاص بآلة واحدة.
ولعل الاكتشاف الأكثر إثارة للدهشة هو أن بعض التحسينات المنطقية جعلت الروبوت أسوأ في الواقع. فقد جرب الفريق بدء تدريب الروبوت بنموذج تم تكييفه بالفعل مع اليونانية، ظناً منهم أن هذا سيمنحه دفعة قوية. وبدلاً من ذلك، أدى أداء الروبوت إلى التراجع في كل من الإنجليزية واليونانية. كما جربوا ترك الجزء من دماغ الروبوت الذي يعالج اللغة يتعلم بحرية، بدلاً من إبقائه "مجمداً". أدى هذا أيضاً إلى تدهور الأداء. تشير النتائج إلى أنه بالنسبة لهذه الأنظمة المحددة، فإن أفضل استراتيجية هي إبقاء جزء فهم اللغة كما هو مدرب تماماً، وتعليم الروبوت كيفية التحرك باستخدام تعليمات اللغة الجديدة فقط.
حاول الباحثون أيضاً اختبار هذه الأساليب على مجموعة ضخمة من بيانات الروبوت الواقعية، وهي أكبر بكثير من اختباراتهم المحاكية. قاموا بترجمة أكثر من خمسين ألف حلقة من حلقات الروبوت إلى اليونة. ومع ذلك، لم يتمكنوا من قياس نجاح هذه البيانات بسبب افتقارهم إلى الأجهزة المادية للروبوت المطلوبة لتشغيل الاختبارات. وقد سلط هذا الضوء على عقبة رئيسية في هذا المجال: ترجمة البيانات رخيصة وسريعة، لكن التحقق من أن الروبوت قد تعلم بالفعل هو أمر بطيء ومكلف ويتطلب معدات مادية.
في النهاية، تخلص الورقة البحثية إلى أن إضافة لغة جديدة إلى الروبوت أمر ممكن، لكنه ليس ببساطة الترجمة. إنه يتطلب نوعاً معيناً من النماذج الأساسية التي تفهم اللغة بالفعل، ومزيجاً من بيانات التدريب باللغتين الجديدة والإنجليزية، وعملية اختبار دقيقة تتضمن حالات فشل متعمدة للتأكد من أن الروبوت يستمع حقاً. الروبوت لا يتعلم اللغة بطريقة عميقة كالبشر؛ بل يتعلم ربط أنماط معينة من الكلمات بالأفعال، وهو يحتاج إلى استقرار التدريب بالإنجليزية للقيام بذلك، رغم أن الآلية الدقيقة لكيفية دعم الإنجليزية لليونانية تظل سؤالاً مفتوحاً بدلاً من كونها قاعدة مؤكدة. يعمل هذا العمل كتحذير للآخرين في هذا المجال: لا تثق في معدل نجاح الروبوت بناءً على المظهر فقط، واختبر دائماً باستخدام مجموعة ضابطة تثبت أن الروبوت لا يقوم بمجرد التخمين. إن الطريق نحو روبوت متعدد اللغات ليس معبداً بالبيانات فحسب، بل بالانضباط الصارم لإثبات أن البيانات قد فُهمت بالفعل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.