Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation
تقدم هذه الورقة إطار عمل "التنفيذ-الملاحظة-إعادة الكتابة" (AOR)، وهو إطار يُمكّن النماذج اللغوية متعددة الوسائط من تحسين سياسات التحكم في الروبوتات بشكل تكراري عبر توليد وإعادة كتابة كود متحكم بلغة بايثون قابل للتنفيذ بناءً على التغذية الراجعة البصرية وتحليل الإخفاق، محققاً معدلات نجاح عالية عبر المهام دون الحاجة إلى عروض توضيحية، أو هندسة مكافآت، أو تحديثات تدرجية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيفية بناء برج من المكعبات. في الأيام الخوالي، كان لديك خياران رئيسيان:
- طريقة "الرقيب الصارم": تعرض على الروبوت فيديو لإنسان يقوم بالمهمة بشكل مثالي 10,000 مرة. يحفظ الروبوت الحركات عن ظهر قلب. إذا تغيرت الإضاءة أو تغيرت الطاولة، يصاب الروبوت بالارتباك ويفشل.
- طريقة "التجربة والخطأ": تترك الروبوت يحاول، يفشل، ثم يحاول مجددًا، ولكن عليك تعديل "دماغه" (شبكته العصبية) يدويًا بعد كل خطأ. هذا يستغرق وقتًا طويلاً ويتطلب حاسوبًا خارقًا.
تقدم هذه الورقة البحثية طريقة ثالثة: "المبرمج الذي يعلم نفسه".
يطلق المؤلفون على هذه الطريقة اسم (الفعل – الملاحظة – إعادة الكتابة) أو AOR. وإليك كيف تعمل، مشروحة بقصة بسيطة وتشبيهات.
القصة: الروبوت و"الكاتب الخفي"
تخيل ذراعًا روبوتية (الفاعل) تحاول التقاط مكعب أحمر ووضعه على الطاولة.
- الفعل: يحاول الروبوت القيام بالمهمة. يحرك ذراعه، يمسك المكعب، ثم يضعه.
- الملاحظة: يفشل الروبوت. ربما أخطأ في التقاط المكعب، أو ربما أسقطه. ولكن بدلًا من مجرد قول "لقد فشلت"، يقوم مساعد ذكاء اصطناعي خاص (نموذج لغوي كبير متعدد الوسائط - Multimodal LLM) بمشاهدة فيديو الفشل. إنه ينظر إلى كود الروبوت (التعليمات التي تخبر الروبوت بكيفية الحركة) وفيديو الخطأ جنبًا إلى جنب.
- إعادة الكتابة: لا يكتفي المساعد الذكي بقول "حاول بجهد أكبر". بل يعمل مثل "كاتب خفي" لدماغ الروبوت. يفتح الكود المصدري للروبوت، ويجد السطر الدقيق المتسبب في الخطأ، ثم يعيد كتابته.
بعد ذلك، يقوم الروبوت بتجميع (compile) هذا الكود الجديد ويجرب مرة أخرى. لم يلمس أي إنسان الكود، ولم تُستخدم بيانات تدريب ضخمة. لقد كتب الروبوت حرفيًا نسخة أفضل من نفسه بعد كل فشل.
التشبيه السحري: "الكود مقابل القرص"
لفهم سبب تميز هذه الطريقة، تخيل راديو.
- الطرق القديمة (ضبط المعلمات): تخيل أن الروبوت هو راديو به قرص تحكم. إذا كانت الإشارة سيئة، فأنت فقط تقوم بتدوير القرص قليلًا لليسار أو اليمين. أنت هنا تخمن. إذا كان الراديو معطلًا لأن الهوائي في المكان الخاطئ، فإن تدوير القرص لن يساعد.
- طريقة هذه الورقة (إعادة كتابة الكود): تخيل أن الروبوت هو راديو، لكن المساعد الذكي هو مهندس. إذا كانت الإشارة سيئة، فالمهندس لا يكتفي بتدوير القرص فحسب، بل يفتح الراديو، وينظر إلى لوحة الدوائر، ويدرك: "آه، الهوائي موصل بشكل مقلوب!". ثم يقوم بلحام سلك جديد (إعادة كتابة الكود) لإصلاح السبب الجذري.
لماذا يعد هذا أمرًا مهمًا؟
معظم طرق تعلم الروبوتات تقوم فقط بـ "تدوير القرص"؛ فهي تعدل الأرقام. لكن هذه الورقة توضح أنه إذا سمحت للذكاء الاصطناي بإعادة كتابة التعليمات الفعلية، فإنه يمكنه إصلاح المشكلات الهيكلية العميقة التي لا تستطيع الأرقام حلها.
التحديات الثلاثة التي حلوها
اختبر الباحثون هذا على ثلاث مهام، وحل نظام "الكاتب الخفي" هذه المهام بطرق تشبه البشر تمامًا:
مشكلة "الخريطة الخاطئة" (مهمة الرفع):
- الخطأ: ظل الروبوت يحوم على ارتفاع 8 بوصات فوق المكعب. كان يعتقد أن المكعب يطفو في الهواء.
- الطريقة القديمة: كان عليك أن تخمن: "ربما الكاميرا حساسة جدًا؟"
- طريقة AOR: نظر الذكاء الاصطناعي إلى الكود والفيديو. وقال: "الكاميرا تستخدم نظام إحداثيات مختلفًا (مثل خريطة يكون فيها الشمال للأسفل). الكود يقرأ الخريطة مقلوبة". فأعاد كتابة الرياضيات لقلب الصورة. نجاح.
مشكلة "عمى الألوان" (مهمة الالتقاط والوضع للعلبة):
- الخطأ: كان الروبوت يبحث عن علبة صودا "فضية"، ولكن في رؤية الكاميرا، بدت العلبة حمراء. لم يستطع الروبوت العثور عليها.
- طريقة AOR: رأى الذكاء الاصطناعي الروبوت وهو يحدق في الفراغ. نظر إلى الكود:
بحث عن فضي. وأدرك: "انتظر، الإضاءة تجعل لونها يبدو أحمر!". فقام بتغيير الكود إلىبحث عن أحمر. نجاح.
مشكلة "اليد الخرقاء" (مهمة التكديس):
- الخطأ: استطاع الروبوت التقاط المكعب الأول، ولكن عندما حاول تكديس مكعب ثانٍ، استمرت أصابعه في الاصطدام بالمكعب السفلي وإسقاطه.
- طريقة AOR: رأى الذكاء الاصطناعي الاصطدام في الفيديو. فأعاد كتابة مسار الاقتراب ليكون أكثر حذرًا. وجعل الروبوت يصل إلى نسبة نجاح 91%.
- الحدود: تعثر الروبوت في النهاية. لقد عرف لماذا كان يفشل (كان يصطدم بالمكعب)، لكنه لم يستطع معرفة كيف يحرك أصابعه بشكل مختلف لتجنب ذلك. لقد وصل إلى طريق مسدود. وهذا يوضح أن النظام ليس مثاليًا بعد، لكنه صادق بشأن حدوده.
"منطقة عدم الذهاب" (ما الذي يجعل هذا فريدًا؟)
عادةً، لجعل الروبوت يتعلم، تحتاج إلى:
- آلاف الفيديوهات لبشر يقومون بالمهمة.
- رياضيات معقدة لمكافأة الروبوت على الحركات الجيدة.
- حواسيب فائقة لتدريب الدماغ.
نظام AOR لا يحتاج لأي من ذلك.
- لا فيديوهات: هو يتعلم من أخطائه الخاصة.
- لا مكافآت: لا يحتاج إلى درجة أو نتيجة؛ يحتاج فقط لرؤية أن الكود لم يعمل.
- لا تدريب: هو لا "يتعلم" في الخلفية؛ بل يعيد كتابة برمجياته حرفيًا بين المحاولات.
الخلاصة
تقترح هذه الورقة طريقة جديدة لبناء الروبوتات: لا تدرب الروبوت ليكون ذكيًا؛ بل أعطه محررًا ذكيًا يعيد كتابة دليله الخاص.
الأمر يشبه إعطاء الروبوت زر "Ctrl+Z" (تراجع)، ولكن بدلًا من مجرد التراجع عن الحركة، فإنه يعيد كتابة التعليمات حتى لا يتكرر الخطأ مرة أخرى. إنه يحول تعلم الروبوت من "صندوق أسود" (حيث لا نعرف لماذا يعمل) إلى عملية شفافة حيث يمكننا قراءة الكود ونقول: "آه، هذا هو سبب الفشل، وهذا هو الحل".
على الرغم من أن الأمر ليس مثاليًا بعد (قد يتعثر أحيانًا في المشكلات الفيزيائية المعقدة للغاية)، إلا أنه يثبت أن الروبوتات يمكنها تعلم إصلاح كودها الخاص بمجرد مشاهدة فشلها والتفكير في الأمر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.