ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction
يُعد ReLI إطار عمل عابر للغات يعمل على تكييف النماذج التأسيسية واسعة النطاق لتمكين الوكلاء المستقلين من فهم التعليمات باللغة الطبيعية، والتفكير دلالياً، وتنفيذ المهام بفعالية عبر أكثر من 140 لغة متنوعة، بما في ذلك اللغات ذات الموارد المنخفضة والأنواع الكريولية، مما يتغلب على قيود الأنظمة الحالية المقتصرة على اللغات ذات الموارد العالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً يمكن فيه لروبوت أن يفهم أمراً معطى بأي لغة، من اللغات الأكثر انتشاراً إلى اللهجات النادرة التي تتحدث بها مجتمعات صغيرة. لعقود من الزمن، ظل حلم التعاون الطبيعي بين الإنسان والروبوت محجوباً بعائق بسيط: اللغة. وبينما أصبحت الروبوتات الحديثة أكثر قدرة على رؤية محيطها والتحرك من خلاله، إلا أنها تدربت إلى حد كبير على فهم عدد قليل فقط من اللغات الرئيسية، مثل الإنجليزية أو الماندرين. هذا القصور يستبعد مليارات المستخدمين المحتملين الذين يتحدثون لغات أو لهجات أو كريول (لغات هجينة) أخرى، مما يحرمهم فعلياً من مستقبل الأتمتة. يعتمد مجال التفاعل بين الإنسان والروبوت على القدرة على ترجمة طلب منطوق أو مكتوب إلى فعل مادي، وهي عملية تُعرف باسم "التأصيل" (grounding). وحتى الآن، كانت هذه الترجمة طريقاً ذا اتجاه واحد، يعمل بشكل جيد فقط لأولئك الذين لديهم وصول إلى اللغات ذات الموارد العالية، تاركةً بقية العالم خلف الركب.
لقد طور فريق من الباحثين نظاماً جديداً يسمى ReLI، صُمم لكسر هذه الجدران اللغوية. يتيح ReLI للوكلاء المستقلين إجراء محادثات طبيعية، والتفكير في بيئتهم، وتنفيذ المهام بغض النظر عن اللغة التي أُعطي بها الأمر. لا يعتمد النظام على ترجمة كلام المستخدم إلى الإنجليزية أولاً، ولا يتطلب إعادة تدريب الروبوت لكل لغة جديدة. بدلاً من ذلك، فإنه يستفيد من القدرة المتأصلة لنماذج الكمبيوتر الضخمة سابقة التدريب على فهم المعنى وراء الكلمات عبر مئات اللغات المختلفة في وقت واحد. ومن خلال الجمع بين نماذج اللغة هذه والمستشعرات البصرية التي تسمح للروبوت بـ "رؤية" الأشياء والمساحات، يمكن لـ ReLI أن يأخذ أمراً مثل "ابحث عن الكرسي الأحمر" (find the red chair) المنطوق بلهجة نادرة ويحوله إلى حركة فيزيائية دقيقة، وكل ذلك دون أن يحتاج المستخدم إلى معرفة أي كود تقني أو التحدث بلغة عالمية مهيمنة.
اختبر الباحثون هذا النظام في كل من البيئات المحاكية والبيئات الواقعية باستخدام روبوتات ذات عجلات وآلات رباعية الأرجل مجهزة بكاميرات ومستشعرات عمق. وقد تحدوا الروبوتات بأكثر من 70,000 محادثة متعددة الأدوار بأكثر من 140 لغة مختلفة. تم اختيار هذه اللغات بعناية لتمثل طيفاً واسعاً من التنوع اللغوي في العالم، بما في ذلك اللغات ذات الموارد العالية ذات البيانات الرقمية الهائلة، واللغات ذات الموارد المحدودة، واللغات الضعيفة أو لغات الكريول التي غالباً ما يتم تجاهلها تكنولوجياً. وتراوحت المهام من الأوامر البسيطة ذات الخطوة الواحدة، مثل التحرك للأمام مسافة محددة، إلى المهام المعقدة متعددة الخطوات التي تتطلب من الروبوت التنقل عبر غرفة، وتحديد جسم بناءً على وصف، والعودة للإبلاغ عما وجده.
أظهرت النتائج أن النظام أدى عمله باتساق ملحوظ عبر هذا المشهد اللغوي الواسع. ففي جميع اللغات المختبرة تقريباً، فهم الروبوت نية المستخدم ونفذ المهمة بنسبة نجاح تجاوزت 83 بالمائة. وبالنسبة للعديد من اللغات الأكثر شيوعاً، ارتفت نسبة النجاح إلى أكثر من 97 بالمائة. وحتى بالنسبة للغات الأكثر ضعفاً وقلة في الموارد، حافظ النظام على مستويات عالية من الدقة، حيث نجح في تحليل التعليمات وتوجيه الروبوت نحو هدفه. وظل الوقت الذي استغرقه الروبوت لمعالجة الأمر والبدء في الحركة مستقراً، بمتوسط يتراوح بين 2.1 و2.6 ثانية، بغض النظر عما إذا كانت التعليمات قد أُعطيت بلغة عالمية كبرى أو بلهجة نادرة. تشير هذه السرعة والموثوقية إلى أن النظام ليس مجرد مفهوم نظري، بل هو أداة عملية قادرة على العمل في الوقت الفعلي.
ولضمان أن تكون هذه التكنولوجيا شاملة حقاً، أجرى الباحثون أيضاً دراسة مع مشاركين بشريين تفاعلوا مع الروبوتات بلغاتهم الأصلية. قام 34 مقيّماً، يتحدثون 13 لغة مختلفة، باختبار النظام في بيئة مختبرية واقعية. وأفادوا بأن التفاعلات كانت تبدو طبيعية واستجابية، مع ملاحظة الغالبية العظمى منهم عدم وجود أي فرق في الأداء بناءً على اللغة التي استخدموها. وتعد هذه النتيجة أمراً بالغ الأهمية، إذ تشير إلى أن النظام لا يفضل لغة على أخرى، ولا يخلق فجوة خفية حيث يتلقى مستخدمو لغات معينة تجربة أسوأ. لقد تعامل النظام بنجاح مع "تبديل الرموز" (code-switching)، حيث قد يخلط المستخدم بين كلمات من لغتين مختلفتين في جملة واحدة، كما أدار ببراعة التفكير المكاني المعقد، مثل التنقل إلى موقع موصوف بوظيفته فقط، مثل "المكان الذي يُطهى فيه الطعام".
يكمن جوهر هذا الإنجاز في كيفية ربط النظام بين اللغة والفعل. فعندما يتحدث المستخدم أو يكتب أمراً، يقوم النظام أولاً بتطبيع المدخلات، وتحويل الكلام إلى نص إذا لزم الأمر، ثم يمررها إلى نموذج لغة ضخم يعمل بمثابة "دماغ" الروبوت. يفسر هذا النموذج نية الأمر، ويقوم بتفكيكه إلى سلسلة من الخطوات المنطقية. بعد ذلك، يستشير مستشعرات الرؤية الخاصة بالروبوت لتحديد الأشياء والمساحات المذكورة في الأمر. فإذا طلب مستخدم من الروبوت الذهاب إلى كرسي معين، يستخدم النظام الرؤية الحاسوبية لتحديد موقع ذلك الكرسي في الغرفة، وتحديد موقعه الدقيق في الفضاء ثلاثي الأبعاد، وحساب المسار الذي يجب أن يسلكه الروبوت للوصول إليه. أخيراً، يقوم النظام بإنشاء خطة، ولأغراض السلامة، غالباً ما يطلب تأكيد المستخدم قبل تنفيذ الحركات المعقدة أو طويلة المدى. تحدث هذه العملية برمتها بسلاسة، مما يسد الفجوة بين الفكر البشري والعمل الآلي دون الحاجة إلى ترجمة صريحة أو تدريب متخصص لكل لغة جديدة.
كما استكشفت الدراسة حدود هذه التكنولوجيا، وكشفت أنه بينما كان النظام قوياً، فإنه ليس معصوماً عن الخطأ. فقد ظهرت التحديات الأكبر عندما كان يتعين على الروبوت تحديد أشياء تبدو متشابهة جداً من بعضها البعض، أو عندما كانت البيئة المرئية مزدحمة، مما يجعل من الصعب تمييز الهدف. بالإضافة إلى ذلك، كانت المهام التي تتطلب التنقل عبر تسلسلات معقدة متعددة الخطوات أكثر عرضة للخطأ قليلاً من الأوامر المباشرة والبسيطة، وذلك ببسا_طة لوجود فرص أكبر لحدوث خطأ في سلسلة الاستنتاج. ومع ذلك، حتى في هذه السيناريوهات الصعبة، ظل أداء النظام قوياً، وأشار الباحثون إلى أن الأخطاء كانت غالباً مرتبطة بالقيود الفيزيائية لمستشعرات الروبوت أو تعقيد البيئة، وليس بفشل في فهم اللغة.
من خلال إثبات أن إطاراً واحداً يمكنه التعامل مع أكثر من 140 لغة بدقة عالية، يشير هذا العمل إلى مسار جديد للمستقبل في التفاعل بين الإنسان والروبوت. فهو ينتقل من فكرة وجوب تعليم الروبوت لغة محددة ليكون مفيداً، إلى نموذج يتكيف فيه الروبوت مع لغة المستخدم الأصلية. وقد أطلق الباحثون بياناتهم ورموزهم البرمجية للجمهور، داعين الآخرين للبناء على هذا الأساس. الهدف النهائي ليس مجرد جعل الروبوتات قادرة على التحدث بلغات عديدة، بل خلق مستقبل يكون فيه القدرة على توجيه الآلة حقاً عالمياً، متاحاً لأي شخص، في أي مكان، باللغة التي يعرفها بشكل أفضل. يعد هذا التحول بدمقرطة الوصول إلى الأتمتة، وضمان مشاركة فوائد الروبوتات مع البشرية جمعاء، وليس فقط أولئك الذين يتحدثون لغات النخبة الرقمية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.