From Vocal Instructions to Household Tasks: The Inria TIAGo++ in the euROBIN Service Robots Coopetition
تقدم هذه الورقة نظام الروبوتات مفتوح المصدر الخاص بفريق "إنريا" (Inria)، والذي يتميز بمنصة "TIAGo++" معدلة مع تحكم في كامل الجسم ومسار تخطيط يعتمد على النماذج اللغوية الكبيرة (LLM)، والتي نجحت في استعراض تنفيذ المهام المنزلية عبر الأوامة الصوتية والتحكم عن بُعد المخصص خلال مسابقة "euROBIN coopetition" الأولى.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل مسابقة طبخ عالية المخاطر، ولكن بدلاً من الطهاة البشر، يكون المتسابقون روبوتات. التحدي؟ يتعين عليهم الاستماع إلى أوامر صوتية من حكم، ثم السير داخل مطبخ فوضوي، والعثور على عناصر محددة، وتسليمها إلى شخص ما — كل ذلك دون إسقاط أي شيء أو التعثر.
هذا البحث هو تقرير "جولة النصر" لفريق Inria (مجموعة من الباحثين الفرنسيين) الذين صنعوا روبوتاً يسمى TIAGo++ للمنافسة في هذا الحدث، المعروف باسم euROBIN coopetition. وكلمة "coopetition" هي مزيج ممتع بين "التعاون" (cooperation) و"المنافسة" (competition)؛ حيث تتنافس الفرق للفوز، لكنها تشارك أيضاً أفضل حيلها البرمجية لمساعدة الجميع على التحسن.
إليك تفصيل لكيفية عمل الروبوت الخاص بهم، باستخدام تشبيهات بسيطة:
1. العقل: "مساعد الشيف الذكي" (LLM)
الروبوت لا يتبع مجرد نص جامد مثل الميكروويف. بدلاً من ذلك، لديه نموذج لغوي كبير (LLM) يعمل كدماغ له.
- التشبيه: فكر في الـ LLM كأنه مساعد شيف ذكي وذو خبرة يتحدث لغة البشر. عندما يقول الحكم: "من فضلك خذ الكوب الأحمر وأعطه للرجل الطويل"، فإن الروبوت لا يسمع الكلمات فحسب؛ بل يفهم "القصد".
- كيف يعمل: يستمع الروبوت إلى الصوت، ويحوله إلى نص، ثم يقوم عقل "مساعد الشيف" بتحويل هذه الجملة إلى وصفة خطوة بخطوة (خطة JSON). حتى أنه يشرح منطقه بصوت عالٍ ("سأذهب إلى الطاولة أولاً...") ليعرف البشر بماذا يفكر. ولضمان عدم ارتباكه أو اختلاقه لخطوات وهمية (الهلوسة)، بنى الباحثون "حارس قواعد" صارم يجبر الروبوت على الالتزام بالقواعد.
2. الجسد: "الراقص الأكروباتي" (التحكم في كامل الجسم - Whole-Body Control)
يمتلك الروبوت قاعدة متحركة (عجلات)، وذراعين، وجذعاً. وتحريك كل هذه الأجزاء في وقت واحد يشبه محاولة التلاعب بالكرات أثناء ركوب دراجة أحادية العجلة.
- التشبيه: نظام التحكم في كامل الجسم (WBC) يشبه مدرب رقص عالي التدريب. فهو يضمن أنه عندما يمد الروبوت يده لالتقاط كوب بيده اليسرى، لا تصطدم ذراعه اليمنى بخزانة، ولا تنزلق عجلاته خارج السيطرة. إنه يحسب الحركة المثالية لكل مفصل من مفاصله في آن واحد للحفاظ على توازن الروبوت وسلامته.
3. العيون: "المحقق مع كشاف ضوئي" (الإدراك)
للعثور على الأشياء في مطبخ فوضوي، يحتاج الروبوت إلى رؤية واضحة.
- التشبيه: يستخدم الروبوت كاميرات ثلاثية الأبعاد خاصة (RGB-D) مثل محقق يحمل كشافاً يمكنه رؤية العمق. بدلاً من رؤية "كوب" فقط، فإنه يرى "كوباً يقع على بعد مترين، مائلاً بزاوية 15 درجة".
- الحيلة: لتسهيل الأمور، وضعوا ملصقات تشبه أكواد QR (تسمى AprilTags) على الأشياء والمواقع. الأمر يشبه وضع جهاز تحديد مواقع (GPS) على الكوب حتى لا يضل الروبوت طريقه أثناء البحث عنه.
4. الأيدي: "لاعب خيال الظل" (التحكم عن بُعد - Teleoperation)
في بعض الأحيان، يعلق الروبوت أو يكون المطبخ فوضوياً جداً بالنسبة لمهاراته المبرمجة مسبقاً. في تلك اللحظة، يتدخل البشر.
- التشبيه: بنى الفريق وحدات تحكم مخصصة تبدو مثل أذرع روبوتية صغيرة وخفيفة الوزن. عندما يحرك الإنسان وحدة التحكم الخاصة به، يحاكي الروبوت الكبير تلك الحركة تماماً، مثل لاعب خيال ظل يتحكم في ظله.
- شبكة الأمان: استُخدم هذا الوضع لتسجيل "عروض الخبراء". تخيل إنساناً يوضح للروبوت بالضبط كيفية فتح باب غسالة أطباق صعب. يسجل الروبوت هذه الحركة. لاحقاً، عندما يحتاج الروبوت لفتح غسالة الأطباق مرة أخرى، فإنه لا يحتاج إلى "التفكير" في كيفية القيام بذلك؛ بل يقوم ببساطة بإعادة عرض "حركة الرقص" المسجلة بدقة.
5. الجهاز العصبي: "قائد الأوركسترا" (التكامل)
كل هذه الأجزاء (العقل، والعيون، والجسد، والتحكم عن بُعد) هي قطع مختلفة من البرامج والأجهزة.
- التشبيه: استخدم الباحثون نظاماً يسمى ROS (نظام تشغيل الروبوت) وحاويات Docker. فكر في هذا كقائد لأوركسترا. كل موسيقي (وحدة برمجية) يعزف على آلتة الخاصة، لكن القائد يضمن أنهم جميعاً يعزفون في نفس النغمة وبنفس السرعة، لكي يبدو الموسيقى (فعل الروبوت) متناغماً وليس كضجيج فوضوي.
النتيجة: مزيج من النجاح والتعلم
في المسابقة، حقق الروبوت نجاحاً باهراً:
- الفهم: فهم الأوامر الصوتية بشكل مثالي (7 من أصل 7 مرات).
- التنقل: وجد طريقه في المطبخ بشكل شبه مثالي (17 من أصل 18 مرة)، ويرجع الفضل في ذلك أساساً إلى "ملصقات الـ GPS" (AprilTags) التي ساعدته.
- المناولة: نجح في التقاط وتحريك الأشياء 12 مرة من أصل 15. وعندما كان يعلق، يتولى "لاعب خيال الظل" البشري المهمة لإنهاء العمل.
الخلاصة الكبرى:
يظهر هذا البحث أنه بينما أصبح الروبوتات بارعين جداً في فهمنا وتحريك أجسادهم، إلا أنهم لا يزالون يواجهون صعوبات في البيئات الحقيقية الفوضوية وغير المتوقعة. المستقبل لا يقتصر فقط على جعل الروبوتات أكثر ذكاءً؛ بل يتعلق ببناء "عجلات تدريب" أفضل (مثل نظام التحكم عن بُعد) وتعليمهم التعلم من العروض البشرية حتى يتمكنوا من التعامل مع الفوضى في مطبخ منزل حقيقي.
لقد جعل الفريق كل الأكواد والتصاميم الخاصة بهم مفتوحة المصدر، مما يعني أنهم يشاركون "كتاب الوصفات" الخاص بهم مع العالم لكي يتعلم صانعو الروبوتات الآخرون من نجاحاتهم وإخفاقاتهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.