Riemann-1.0: An Embodied World Action Model for Physical AI
يُعد Riemann-1.0 نموذج عمل عالمي (World Action Model) سببيًا ذاتي الانحدار وموحدًا، يدمج الملاحظات متعددة المشاهد، وحالات الروبوت، والأفعال في إطار عمل واحد، مستفيدًا من استراتيجية تدريب مسبق تدريجي على أكثر من 200,000 ساعة من البيانات المتجسدة المتنوعة لتحقيق أداء رائد في كل من مهام التلاعب طويلة الأمد في المحاكاة وفي العالم الحقيقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كان الذكاء الاصطناعي سيداً في العالم الرقمي، يقرأ النصوص، ويتعرف على الصور، ويحل الألغاز ضمن حدود شاشة الكمبيوتر. ولكن لكي تنضم الآلات حقاً إلينا في العالم المادي، يجب عليها أن تفعل أكثر من مجرد فهم ما تراه؛ بل يجب أن تتعلم كيف تعمل بداخله. هذا هو تحدي "الذكاء المتجسد": تعليم الروبوتات إدراك محيطها، والتفكير في السبب والنتيجة، وتنفيذ حركات بدنية بنفس الانسيابية التي يستخدمها الإنسان لالتقاط كوب أو طي قميص. لكي تنجح الآلة، تحتاج إلى نموذج للعالم يفهم ليس فقط كيف تبدو الأشياء، بل كيف تتحرك وتتغير عند لمسها. يجب أن تتعلم أن دفع كتلة يؤدي إلى انزلاقها، وأن رفع غطاء يكشف عما بداخله. وحتى الآن، كان إنشاء نظام واحد يمكنه التخطيط لهذه الأفعال البدنية والتنبؤ بالنتائج البصرية لتلك الأفعال في آن واحد يمثل عقبة صعبة، وغالباً ما يتطلب أنظمة منفصلة للتفكير وللحركة.
قدم فريق من الباحثين نظاماً جديداً يسمى "Riemann-1.0"، صُمم لسد هذه الفجوة عبر التعامل مع أفعال الروبوت والتغييرات الناتجة عنها كقصة واحدة مستمرة. فبدلاً من بناء أدوات منفصلة لتقرير ما يجب فعله وأدوات أخرى لتخيل ما سيحدث بعد ذلك، يتعلم هذا النموذج القيام بالأمرين معاً. وهو يعمل وفق مبدأ بسيط ولكنه قوي: في العالم الحقيقي، يحدث الفعل دائماً قبل رؤية النتيجة. إذا مدّ الروبوت يده نحو ملعقة، فإن الحركة تحدث أولاً، ثم يتبعها التغيير البصري — أي حركة الملعقة. وقد بُني "Riemann-1.0" ليحترم هذا الترتيب، حيث يتعلم من مجموعة هائلة من بيانات الفيديو والحركة ليتنبأ بدقة بما يجب أن يفعله الروبوت بعد ذلك وكيف سيبدو العالم بعد قيامه بذلك.
ولتعليم هذا النظام، جمع الباحثون مكتبة ضخمة من الخبرات، بلغ مجموعها أكثر من 200,000 ساعة من التفاعل. لم تكن هذه المجموعة مجرد كومة من فيديوهات الروبوتات؛ بل كانت مزيجاً منسقاً بعناية من ثلاثة أنواع مختلفة من مواد التعلم. أولاً، تضمنت آلاف الساعات من الفيديوهات المسجلة من وجهة نظر الإنسان، والتي تُظهر أشخاصاً يؤدون مهاماً يومية مثل الطبخ أو التنظيف. وفرت هذه الفيديوهات فهماً واسع النطاق لكيفية تفاعل الأشياء وكيفية تطور المهام بمرور الوقت، رغم افتقارها للبيانات الميكانيكية المحددة للروبوت. ثانياً، أضافوا نماذج من مقابض روبوتية محمولة وأجهزة قابلة للارتداء، والتي تعمل كجسر، حيث تُظهر كيفية ترجمة حركات اليد البشرية إلى تحكمات تشبه تحكمات الآلة. وأخيراً، تضمنت تسجيلات دقيقة لحركات الروبوت الفعلية، والتي قدمت التعليمات القابلة للتنفيذ بدقة لتعليم الآلة كيفية تحريك أطرافها. ومن خلال الجمع بين هذه المصادر، أنشأ الباحثون مجموعة بيانات موحدة سمحت للنموذج بالتعلم من الحكمة الواسعة للتجربة البشرية مع ترسيخ تلك المعرفة في الميكانيكا الدقيقة للتحكم الروبوتي.
تم هيكلة عملية التدريب لـ "Riemann-1.0" مثل المنهج الدراسي، حيث انتقلت من الملاحظة العامة إلى التنفيذ المحدد. في المرحلة الأولى، درس النموذج المكتبة الضخمة من الفيديوهات البشرية. وبما أن هذه الفيديوهات لم تكن تحتوي على بيانات حركة الروبوت، استخدم النظام أداة مساعدة لتقدير "الأفعال" غير المرئية التي لا بد أنها تسببت في التغييرات البصرية المشهودة على الشاشة. سمح هذا للنموذج بتعلم الديناميكيات الأساسية لكيفية حركة العالم دون الحاجة إلى بيانات روبوتية مثالية. وفي المرحلة الثانية، تم تقديم بيانات مختلطة من الأيدي البشرية والمقابض الروبوتية للنموذج، ليتعلم مواءمة فهمه للحركة مع الضوابط الفيزيائية الحقيقية. وأخيراً، ركز النموذج في المرحلة الثالثة حصرياً على تسجيلات عالية الجودة لروبوتات تؤدي مهام معينة. صقلت هذه المرحلة النهائية قدرته على توليد أوامر دقيقة وقابلة للتنفيذ، مما يضمن أن الأفعال التي يخطط لها ليست مجرد أفعال منطقية بصرياً، بل هي ممكنة فيزيائياً لآلة حقيقية لتنفيذها.
كانت النتائج مذهلة. فعند اختباره على مجموعة متنوعة من المهام، سواء في عمليات المحاكاة الحاسوبية أو على روبوتات حقيقية، تفوق "Riemann-1.0" على الطرق السابقة بفارق كبير. في محاكاة صُممت لاختبار المهام الطويلة والمعقدة التي تتضمن خطوات عديدة، نجح النموذج بنسبة 62.6%، وهو تحسن ملحوظ عن أفضل الأنظمة الحالية. وفي محاكاة أخرى ركزت على الروبوتات ذات الذراعين، حقق نسبة نجاح بلغت 94.3%. ولعل الأمر الأكثر إثارة للإعجاب هو أنه عند نشره على روبوتات في العالم الحقيقي لأداء مهام مثل تكديم مكعبات ملونة، أو طي الملابس، أو تنظيم مكتب فوضوي، أو ترتيب أدوات المطبخ، أتم النظام المهام بنجاح بنسبة 85% من المرات. كما أظهر قدرة رائعة على التكيف مع مواقف جديدة لم يسبق له رؤيتها، مثل وضع مكعب "روبيك" في صندوق أو وضع منشفة في حوض، حيث نجح في 85% من هذه التجارب المستحدثة.
بعيداً عن مجرد العمل كمتحكم في الروبوت، يمكن لـ "Riemann-1.0" أيضاً أن يعمل كمحاكي. ولأن النظام يفهم الرابط السببي بين الفعل والنتيجة البصرية، يمكن للباحثين أن يطلبوا منه تخيل ما سيحدث إذا قام الروبوت بحركة معينة. يمكن للنموذج توليد فيديو للمستقبل، يُظهر بالضبط كيف ستتحرك الأشياء وأين ستستقر، بناءً على الفعل المقدم. تعني هذه القدرة المزدوجة أن النظام يمكن أن يعمل كـ "العقل" الذي يقرر ما يجب فعله، و"الخيال" الذي يتحقق مما إذا كانت الخطة ستنجح قبل أن يتحرك الروبوت فعلياً. إن القدرة على التنبؤ بمستقبل العالم المادي، المرتكزة على واقع كيف تسبب الأفعال التغييرات، تمثل خطوة كبيرة للأمام في جعل الذكاء الاصطناعي شريكاً موثوقاً في العالم المادي. ويشير هذا العمل إلى أنه من خلال توحيد تعلم كيفية الفعل مع تعلم كيفية استجابة العالم، يمكن للآلات أن تطور فهماً أكثر قوة وتعميماً للمهام التي نؤديها كل يوم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.