← أحدث الأبحاث
💻 computer science

Sandwich-Residuals: Parameter-Efficient Test-time Adaptation of World Models

تقدم الورقة البحثية "Sandwich-Residuals"، وهي طريقة فعالة من حيث المعلمات للتكيف عند وقت الاختبار لنماذج العالم الكامنة، تقوم بتجميد الأوزان مسبقة التدريب وتتعلم فقط تصحيحات متبقية صغيرة عبر الإنترنت باستخدام أخطاء التنبؤ ذاتية الإشراف، مما يحقق معدلات نجاح محسنة بشكل كبير تحت تحولات التوزيع مع تكييف أقل بنسبة 97-99% من المعلمات مقارنة بالأساليب الحالية.

المؤلفون الأصليون: Krishnam Soni, Aditya Sehgal, Vedant Dave, Elmar Rueckert

نُشر 2026-09-21
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Krishnam Soni, Aditya Sehgal, Vedant Dave, Elmar Rueckert

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تعتمد الروبوتات التي يمكنها التخطيط لحركاتها الخاصة غالبًا على خريطة داخلية لكيفية عمل العالم. تخيل ذراعًا روبوتية تحاول دفع مكعب عبر طاولة. بدلًا من مجرد التفاعل مع ما تراه في اللحظة الراهنة، يبني الروبوت الذكي نموذجًا ذهنيًا يتنبأ بما سيحدث إذا حرك ذراعه بطريقة معينة. إنه يتعلم أن يقول: "إذا دفعت هنا، سينزلق المكعب إلى هناك". هذا النموذج الذهني، الذي يُسمى غالبًا "نموذج العالم"، يسمح للروبوت بمحاكاة الأفعال المستقبلية في عقله قبل أن يتحرك فعليًا، مما يساعده على تجنب الأخطاء والوصول إلى أهدافه بكفاءة. وعادة ما يتم تدريب هذه النماذج في بيئة محكومة، مثل محاكاة حاسوبية، حيث تكون الإضاءة مثالية والفيزياء متسقة. ومع ذلك، فإن العالم الحقيقي فوضوي. فعندما يُوضع روبوت تم تدريبه في محاكاة في غرفة جديدة ذات إضاءة مختلفة، أو عندما يصبح سطح الطاولة زلقًا، يمكن أن تصبح خريطة الروبوت الداخلية خاطئة. وتصبح تنبؤاته التي يضعها لا تتطابق مع الواقع، وبالتالي يفشل الروبوت في إكمال مهمته. ولسنوات طويلة، كان الحل القياسي لهذه المشكلة هو إعادة تدريب أجزاء من عقل الروبوت أثناء عمله، وتعديل ملايين الإعدادات الداخلية لتتناسب مع الظروف الجديدة. هذه العملية ثقيلة وبطيئة وتتطلب من الروبوت أن يعيد كتابة فهمه لكيفية تحرك الأشياء باستمرار.

لقد اكتشف فريق من الباحثين طريقة أخف بكثير لإصلاح هذه المشكلة. فبدلًا من مطالبة الروبوت بإعادة كتابة خريطته الداخلية بالكامل، وجدوا أنه يكفي غالبًا مجرد تعديل الحواف حيث يقرأ الروبوت مدخلاته ويكتب مخرجاته. وفي دراسة جديدة، قدم الباحثون طريقة أطلقوا عليها اسم "البقايا الساندوتشية" (Sandwich-Residuals). لقد أخذوا روبوتًا تعلم بالفعل كيفية الحركة في المحاكاة وجمدوا عقله الداخلي تمامًا، مانعين أيًا من إعداداته المليونية المتعلمة من التغيير. ثم أضافوا طبقتين برمجيتين صغيرتين ومرنتين: واحدة تعدل المعلومات القادمة إلى عقل الروبوت، وأخرى تعدل التنبؤات الخارجة منه. تعمل هاتان الطبقتان الصغيرتان كحشوة الساندوتش، حيث تلتفان حول النواة المجمدة. وبينما يحاول الروبوت التحرك ويرتكب أخطاءً، تتعلم هاتان الطبقتان الصغيرتان تصحيح الأخطاء فور حدوثها، دون المساس بالعقل الثقيل المدرب مسبقًا في الداخل. يتعلم الروبوت أن يقول: "يعتقد عقلي أن المكعب سيذهب إلى هنا، لكن طبقة التصحيح الجديدة الخاصة بي تعرف أن الأرض زلقة، لذا سأعدل خطتي لإرساله إلى هناك بدلاً من ذلك".

اختبر الباحثون هذه الفكرة في مجموعة متنوعة من المهام الصعبة، بما في ذلك التنقل في المتاهات ودفع أشياء ذات أشكال مختلفة. وقارنوا طريقتهم بالنهج القياسي، الذي يتضمن تحديث العقل الداخلي للروبوت، وبالروبوت الذي لا يقوم بأي تعديلات على الإطلاق. في واحد وعشرين سيناريو اختبار مختلفًا، نجح الروبوت الذي يستخدم طريقة "الساندوتش" الجديدة في الوصول إلى هدفه بنسبة 65 بالمائة من المرات. وكان هذا تحسنًا ملحوظًا عن الروبوت غير المعدل الذي نجح بنسبة 49 بالمائة تقريبًا فقط. والأهم من ذلك، أن الطريقة الجديدة أدت أداءً يقارب أداء النهج القياسي الذي يعيد كتابة عقل الروبوت، والذي نجح بنسبة 68 بالمائة تقريبًا. ويكمن الفرق الجوهري في الكفاءة؛ فقد اضطر النهج القياسي إلى تحديث ما يقرب من عشرة ملايين إعداد للتكيف مع الظروف الجديدة، بينما احتاجت الطريقة الجديدة، في المقابل، إلى تعديل حوالي مائة ألف إعداد فقط. وهذا يعني أن النهج الجديد يتكيف باستخدام أقل من ثلاثة بالمائة من الجهد الحسابي المطلوب من الطريقة القديمة، ومع ذلك يحقق مستوى نجاح مشابهًا تقريبًا.

كما بحثت الدراسة فيما يحدث عندما يواجه الروبوت مشكلات متعددة في آن واحد، مثل الجمع بين تغير في الإضاءة وتغير في كيفية شعور الأشياء بالثقل. في هذه المواقف "المركبة" الصعبة، كانت الطريقة الجديدة أكثر إثارة للإعجاب؛ فقد نجحت بمعدل 1.9 مرة أكثر من الروبوت غير المعدل، بينما ظلت فعالة تمامًا مثل طريقة تحديث العقل الثثقيلة. ووجد الباحثون أن نوع التصحيح المطلوب يعتمد على المشكلة المحددة. فعندما كان الروبوت يتنقل في متاهة وتغيرت فيزياء الحركة، قامت الطبقة التي تصحح تنبؤات الروبوت بعد صدورها بمعظم العمل. وعندما كان الروبوت يدفع الأشياء وأصبح التحكم أكثر حساسية، كانت الطبقة التي تعدل أوامر مدخلات الروبوت هي الأكثر أهمية. ومن خلال الاحتفاظ بكلتا الطبقتين، استطاع النظام التعامل مع مجموعة واسعة من التغييرات غير المتوقعة دون الحاجة لمعرفة نوع المشكلة التي سيواجهها مسبقًا.

ولإثبات أن هذه الفكرة تعمل بما يتجاوز ألعاب المتاهات البسيطة، طبقها الباحثون أيضًا على مهمة أكثر تعقيدًا تتضمن ذراعًا روبوتية بأسلوب واقعي تحرك مكعبًا في فضاء ثلاثي الأبعاد. وقد استخدموا نوعًا مختلفًا من عقول الروبوتات لهذه المهمة، يعتمد على الأنماط البصرية بدلاً من التصميم السابق. وحتى مع هذا الهيكل المختلف، نجح مبدأ "الساندوتش" نفسه. فقد تمكن الروبوت من التكيف مع التغيرات في الإضاءة، وزوايا الكاميرا، وقوة محركاته الخاصة. وفي كل حالة اختبار تغيرت فيها الظروف، أدت الطريقة الجديدة إلى تحسين أداء الروبوت مقارنة بعدم القيام بأي شيء، في حين أن الطرق الأخرى جعلت أداء الروبوت يسوء أحيانًا. وهذا يشير إلى أن القدرة على التكيف لا تتطلب دائمًا من الروبوت تغيير فهمه للعالم بشكل جذري. فأحيانًا، يكفي مجرد إضافة مرشح (فلتر) صغير ومرن يساعد الروبوت على تفسير وضعه الحالي بشكل صحيح.

تشير النتائج إلى تحول في كيفية بناء الروبوتات في المستقبل. لفترة طويلة، كان الافتراض هو أنه إذا تغيرت بيئة الروبوت، يجب إعادة كتابة نموذجه الداخلي للفيزياء ليتناسب معها. وتظهر هذه الورقة البحثية أن هذا الافتراض ليس ضروريًا دائمًا. فإذا كان فهم الروبوت الجوهري للعالم لا يزال صحيحًا إلى حد كبير، يمكنه ببساطة تعلم تعديل مدخلاته ومخرجاته لتناسب الواقع الجديد. هذا النهج ليس أسرع وأرخص فحسب، بل هو أيضًا أكثر استقرارًا، لأنه يتجنب خطر نسيان الروبوت لما يعرفه بالفعل أثناء محاولته تعلم شيء جديد. وبينما أجريت التجارب في عمليات محاكاة حاسوبية، فإن النتائج تشير نحو مستقبل يمكن فيه للروبوتات دخول بيئات جديدة والبدء في العمل فورًا، باستخدام تعديلات صغيرة وفعالة للتعامل مع مفاجآت العالم الحقيقي دون الحاجة إلى عملية إصلاح شاملة لذكائها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →