IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training
يُعد IMPACT إطار عمل قابلاً للتوسع لتدريب نماذج عالمية مدركة للتفاعل، يعالج نقص الإشراف على الأجسام الديناميكية في تدريب MSE القياسي باستخدام الانتباه المتقاطع لإنشاء خريطة تفاعل داخلية لإعادة وزن إشراف إزالة الضجيج، مما يحسن الواقعية الفيزيائية والجودة البصرية دون الحاجة إلى تمثيلات خارجية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل حاسوبًا يمكنه مشاهدة فيديو لذراع روبوت وهي تلتقط كوبًا، ثم يتنبأ بدقة بما سيحدث بعد ذلك. إنه يعلم أن الكوب سيرتفع، وأن الطاولة ستظل ثابتة، وأن الضوء سينعكس على السيراميك. هذا النوع من الذكاء الاصطناعي، المعروف باسم "نموذج العالم" (world model)، يزداد مهارة في تخيل المستقبل. فهو يتعلم من كميات هائلة من بيانات الفيديو لفهم كيفية تحرك الأشياء وكيف يتغير العالم بمرور الوقت. وتعد هذه الأنظمة بالغة الأهمية لتعليم الروبوتات أداء مهام معقدة، بدءًا من تجميع الإلكترونيات وصولاً إلى المساعدة في الأعمال المنزلية، لأنها تسمح للآلات بالممارسة والتخطيط في مساحة افتراضية قبل لمس أي جسم حقيقي. ومع ذلك، وبينما تبرع هذه النماذج في التنبؤ بالتدفق العام للمشهد، فإنها غالبًا ما تعاني عندما يتعلق الأمر بلحظة التلامس المحددة. فعندما تمسك يد الروبوت بأداة أو يلمس إصبع بشري زرًا، غالبًا ما تنتج التكنولوجيا الحالية نتائج ضبابية أو مستحيلة فيزيائيًا أو غير متسقة؛ فقد يذوب الجسم داخل اليد، أو قد يبدو أن الحركة منفصلة عن الفعل الذي تسبب فيها.
لقد حاول الباحثون إصلاح ذلك عبر تزويد الحاسوب بمعلومات إضافية، مثل خرائط تفصيلية للعمق أو المسارات الدقيقة التي يجب أن تتبعها الأشياء. ورغم أن هذا يساعد، إلا أنه يتطلب تحضيرات مكلفة وتستغرق وقتًا طويلاً، وغالبًا ما يحد من كمية البيانات التي يمكن للنظام تعلمها. إلا أن دراسة جديدة أجراها فريق من الباحثين من مؤسسات تشمل جامعة تسينغهوا وجامعة العلوم والتكنولوجيا في الصين، قدمت حلاً مختلفًا. فقد اكتشفوا أن المشكلة لم تكن في نقص البيانات، بل في كيفية تعليم الحاسوب التعلم منها. فمن خلال تغيير الطريقة التي يركز بها عملية التدريب انتباهه، ابتكروا طريقة تسمى "إمباكت" (IMPACT) تعمل على تحسين كيفية تعامل هذه النماذج مع التفاعلات الفيزيائية بشكل كبير، دون الحاجة إلى أي بيانات خارجية إضافية أو إبطاء النظام.
تكمن القضية الجوهرية التي حددها الباحثون في نوع من عدم التوازن في كيفية تعلم الحاسوب. فعند تدريب نماذج العالم هذه، يُطلب من النظام عادةً التنبؤ بالإطار التالي للفيديو ويُعاقب على كل خطأ يرتكبه. ومع ذلك، في معظم مقاطع الفيديو التقليدية، تكون أغلب الصورة عبارة عن خلفية ثابتة: جدار، أو طاولة، أو أرضية لا تتغير كثيرًا. ولأن هذه المناطق الثابتة تشكل الغالبية العظمى من البكسلات، فإن الحاسوب يبذل معظم جهده في محاولة ضبط الخلفية بشكل صحيح، لمجرد وجود الكثير منها. أما المناطق الصغيرة والحرجة حيث يحدث الفعل — مثل ملامسة القابض لكتلة أو إمساك يد لأداة — فهي صغيرة جدًا لدرجة أنها تضيع في الضجيج. وبذلك يتجاهلها الحاسوب فعليًا، ويعتبرها غير مهمة لأنها تشغل مساحة ضئيلة للغاية. وهذا يؤدي إلى وضع يبدو فيه الفيديو سلسًا ومتماسكًا بشكل عام، لكن التفاعلات المحددة تكون خاطئة فيزيائيًا أو مشوشة بصريًا.
ولحل هذه المشكلة، طور الباحثون طريقة تعلم الحاسوب إعطاء المزيد من الاهتمام للأجزاء التي يحدث فيها الفعل بالفعل. لقد أدركوا أن الحاسوب يمتلك بالفعل تلميحًا مدمجًا حول مكان النظر. فعندما يتلقى النظام أمرًا مثل "التقط الوعاء الأزرق"، فإنه يستخدم آلية تسمى "الانتباه المتقاطع" (cross-attention) لربط الكلمات "الوعاء الأزرق" بالأجزاء المرئية من الفيديو. وهذا ينشئ خريطة ذهنية توضح مكان الوعاء في نظر الحاسوب. وقد استخدم الباحثون هذه الخريطة الموجودة كنقطة انطلاق، ثم طلبوا من الحاسوب النظر إلى تلك المناطق المحددة والتحقق من مدى صعوبة التنبؤ بما سيحدث هناك. فإذا كان الحاسوب يكافح للتنبؤ بحركة الوعاء، فهذا يعني أن تلك المنطقة مهمة وتحتاج إلى مزيد من التركيز.
تذهب طريقة "إمباكت" (IMPACT) بهذا العملية خطوة أبعد، حيث تقوم بأخذ عينات من عدة مناطق محتملة حول الجسم وتوزينها بناءً على مدى صعوبة التنبؤ بها بالنسبة للحاسوب. ثم تنشئ دليلاً خاصًا، أو خريطة، تسلط الضوء على مناطق التفاعل هذه. وخلال التدريب، يتم توجيه الحاسوب لإعطاء الأولوية لتصحيح أخطائه في هذه المناطق المظللة، مما يخبره فعليًا: "تجاهل الجدار للحظة؛ ركز على اليد والجسم". ومن الأهمية بمكان أن هذا الدليل يتم توليده بالكامل من الإشارات الداخلية للحاسوب نفسه أثناء عملية التدريب. فهو لا يتطلب أي أدوات خارجية، أو تصنيفًا يدويًا، أو مستشعرات إضافية لإخباره بمكان الحدث. وهذا يجعل الطريقة قابلة للتوسع بشكل كبير، مما يسمح لها بالعمل مع كميات هائلة من البيانات دون التكاليف الباهظة المرتبطة بالأساليب السابقة.
اختبر الباحثون هذه الطة الجديدة على نوعين مختلفين تمامًا من المهام: ذراع روبوت تتلاعب بالأشياء على طاولة، ويد بشرية تؤدي مهامًا ماهرة من منظور الشخص الأول. وفي كلتا الحالتين، قاموا بتدريب النماذج باستخدام تقنية توليد الفيديو القياسية ولكن مع تطبيق طريقة "إمباكت" على عملية التعلم. وكانت النتائج متسقة وهامة؛ حيث أنتجت النماذج المدربة بطريقة "إمباكت" فيديوهات كانت فيها التفاعلات أكثر واقعية بكثير. فعندما أغلقت قبضة الروبوت على كتلة، ظلت الكتلة صلبة وتحركت بشكل صحيح. وعندما أمسكت يد بشرية بكوب، التفّت الأصابع حوله بشكل طبيعي، واستجاب الكوب للوزن والحركة بشكل صحيح. وقد تحسنت الجودة البصرية للتفاعلات بشكل كبير، مع وجود تشوهات أقل وحركات أكثر منطقية من الناحية الفيزيائية مقارنة بالنماذج المدربة بالنهج الموحد التقليدي.
وفي اختبارات ذراع الروبوت، حسنت الطريقة الجديدة درجة الجودة الإجمالية بهامش ملحوء، لا سيما في مدى قدرة الروبوت على اتباع التعليمات ومدى دقة محاكاة فيزياء الأشياء. أما بالنسبة لمهام اليد البشرية، فقد كان التحسن أكثر إثارة من حيث الدقة البصرية؛ حيث أنتجت النماذج المدربة بطريقة "إمباكت" صورًا أكثر حدة وتماسكًا، حيث تفاعلت اليد مع الجسم بطريقة تبدو طبيعية للعين البشرية. ووجد الباحثون أن هذا النهج يعمل بشكل جيد عبر أنواع مختلفة من بنيات الحاسوب وإشارات التحكم، مما يشير إلى أن الحل قوي وقابل للتكيف. فمن خلال إعادة وزن عملية التعلم ببساطة للتركيز على ما هو مهم حقًا، تمكنوا من الوصول إلى مستوى أعلى من الواقعية الفيزيائية دون تغيير الهيكل الأساسي للذكاء الاصطناعي.
يُظهر هذا العمل أن المفتاح لتحسين التفاعل في الذكاء الاصطناعي قد لا يكمن في إضافة بيانات أكثر تعقيدًا أو قيود خارجية، بل في تحسين كيفية تعلم النظام من البيانات التي يمتلكها بالفعل. لقد أثبت الباحثون أنه من خلال تحديد عدم التطابق في كيفية تخصيص الانتباه أثناء التدريب وتصحيحه، استطاعوا توجيه النموذج لإتقان التفاصيل الدقيقة والصعبة للتفاعل الفيزيائي. ولا تتطلب الطريقة أي تغييرات في النظام عند استخدامه فعليًا لتوليد فيديوهات جديدة، مما يعني أنها تحسين خالص لمرحلة التدريب. ومع استمرار تطور نماذج العالم لدعم مهام ومحاكاة روبوتية أكثر تعقيدًا، توفر تقنيات مثل "إمباكت" مسارًا قابلًا للتوسع، مما يضمن أن المستقبل الذي تتخيله هذه النماذج ليس مجرد مستقبل سلس بصريًا، بل هو مستقبل حقيقي فيزيائيًا أيضًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.