Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics
تثبت هذه الورقة أن نظام برمجة وكيل يعتمد على نماذج اللغات الكبيرة يمكنه حل معيار "Push-T" للمناولة وامتداداته الأبجدية بشكل مستقل من خلال تعلم ميكانيكا المحاكاة بشكل تكراري دون عروض توضيحية بشرية، متفوقاً في النهاية على سياسات تعلم التقليد البصري الحركي التقليدية في كل من معدل النجاح وكفاءة الخطوات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في الركن الهادئ من علم الروبوتات حيث تتعلم الآلات الحركة، يوجد تحدٍ بسيط ولكنه عنيد: جعل الروبوت يدفع جسماً إلى مكان محدد دون الإمساك به. تخيل كتلة على شكل حرف T موضوعة على طاولة. يجب على ذراع روبوت أن تدفعها، باستخدام نقطة اتصال واحدة فقط، حتى تستقر في اتجاه مثالي. هذا المهمة، المعروفة باسم "Push-T"، أصبحت اختباراً معيارياً للذكاء الاصطناعي. لسنوات، كانت الطريقة السائدة لحلها هي التعلم بالتقليد، حيث يشاهد الروبوت مئات الفيديوهات لبشر يدفعون الكتلة ويحاول تقليد حركاتهم. هذا النهج يعمل، لكنه يتطلب كميات هائلة من البيانات البشرية وغالباً ما ينتج روبوتاً جيداً في المحاكاة وليس بالضرورة جيداً في فهم فيزياء سبب نجاح الدفعة. فكرة جديدة بدأت تلوح في الأفق: بدلاً من تعليم الروبوت عبر إظهار الأمثلة له، هل يمكننا تعليم برنامج كمبيوتر كتابة تعليماته الخاصة من خلال التفكير في المشكلة؟
هذا السؤال يقع في قلب دراسة حديثة أجراها باحثون من جامعة كاليفورنيا، بيركلي. لقد عادوا إلى مهمة "Push-T" ليس لتدريب روبوت على بيانات بشرية، بل ليروا ما إذا كان بإمكان وكيل برمجة يعمل بالذكاء الاصطناعي حل اللغز من الصفر. استخدموا نموذج لغة متطوراً، وهو ذكاء اصطناعي قادر على كتابة وتصحيح أكواد الكمبيوتر، وطلبوا منه إنشاء وحدة تحكم لروبوت. كانت التعليمات صارمة: لا يمكن للذكاء الاصطناعي استخدام أي سياسات متعلمة أو نماذج بشرية. كان عليه كتابة برنامج يفهم هندسة الكتلة، واحتكاك السطح، وميكانيكا الدفع. أراد الباحثون معرفة ما إذا كان بإمكان الآلة أن تفكر لتصل إلى حل ليس فعالاً فحسب، بل وأكثر كفاءة من أفضل الطرق التي ضبطها البشر.
كانت النتيجة عرضاً مذهلاً لما يحدث عندما يُمنح الذكاء الاصطناعي حرية التفكير بدلاً من مجرد التقليد. لم يقم وكيل البرمجة، الذي يعمل في بيئة محاكاة، بالتخمين العشوائي. قام أولاً بتحديد موقع المحاكاة الرقمية للمهمة وبدأ في كتابة كود يصف كيفية تحرك الروبوت. بدأ بخطة أساسية: الاقتراب من الكتلة، لمسها، دفعها، ثم الابتعاد. لكن الوكيل لم يتوقف عند هذا الحد. قام بتشغيل الكود، وشاهد المحاكاة، ورأى أين فشل الروبوت. عندما لم تدر الكتلة بشكل صحيح أو علقت ضد الحائط، قام الوكيل بتحليل الخطأ، وعدل معاملات الاحتكاك في الكود الخاص به، وحاول مجدداً. هذه الدورة من الكتابة، والاختبار، والإصلاح تكررت مراراً وتكراراً. بنى الوكيل نموذجاً داخلياً لكيفية حركة الكتلة، وتعلم أن الدفع من خلال مركز الكتلة يحركها للأمام، بينما الدفع من الجانب يجعلها تدور.
بعد عدة جولات من التحسين الذاتي، أنتج الوكيل حلاً يتفوق على الطرق القياسية. في اختبار شمل مائتي وضعية بداية مختلفة، حقق الكود الذي كتبه الذكاء الاصطناعي معدل نجاح مثالي، حيث نقل الكتلة إلى الهدف في كل مرة. بالمقارنة، فإن سياسة الروبوت المتطورة التي تم تدريبها على مائتي نموذج بشري نجحت بنسبة 62% فقط من الوقت. لم يكن حل الذكاء الاصطناعي أكثر موثوقية فحسب، بل كان أيضاً أكثر كفاءة. استغرق الروبوت المدرب بشرياً في المتوسط أكثر من مائتي خطوة لإكمال المهمة، بينما أنجز برنامج الذكاء الاصطناعي المهمة في حوالي مائة وعشرين خطوة. كما تطلب عدداً أقل من الدفعات المتميزة، بمتوسط يقل قليلاً عن أربع دفعات لكل مهمة مقارنة بأكثر من ست دفعات للنموذج المدرب بشرياً. لقد اكتشف الذكاء الاصطناعي مساراً أكثر مباشرة نحو الهدف من خلال فهم ميكانيكا الدفع بدلاً من محاكاة تجربة الخطأ والخطأ لدى البشر.
ثم دفع الباحثون الحدود إلى أبعد من ذلك. طلبوا من الوكيل ليس فقط حل شكل حرف T، بل كل حروف الأبجدية، من A إلى Z. قدم كل حرف لغزاً هندسياً جديداً، بمنحنيات ومراكز توازن وزوايا مختلفة. تلقى الوكيل نفس التعليمات: اكتب كوداً لدفع هذه الأشكال دون أمثلة بشرية. تكيف الذكاء الاصطناعي مع استراتيجيته، منشئاً منهجاً تعليمياً حيث تدرب على الحروف التي وجدها أكثر صعوبة. تعلم التعامل مع منحنيات حرف "C" والزوايا الضيقة لحرف "Q" من خلال تعديل كيفية اقترابه وتدويره لكل شكل. في النهاية، حقق الوكيل معدل نجاح يقترب من 99% عبر جميع الحروف الستة والعشرين. تمكن من ذلك عبر التبديل بين نقاط اتصال مختلفة واستخدام استراتيجية تحكم تعيد التخطيط باستمرار بناءً على ما يراه، مما ضمن عدم علوقه في طريق مسدود.
وللتأكد من أن هذا لم يكن مجرد خدعة مرتبطة بمحاكاة محددة، اختبر الباحثون كود الذكاء الاصطناٍء على نوعين مختلفين من أذرع الروبوتات المحاكية، أحدهما مصمم على طراز ذراع "Franka" والآخر على طراز ذراع "UR5". المنطق نفسه الذي نجح مع شكل حرف T والأبجدية نجح مع كلا الآلتين. نجح برنامج الذكاء الاصطناعي في توجيه الروبوتات المختلفة لدفع الحروف، مما أثبت أن التفكير الذي طوره كان قابلاً للنقل. لم يكن بحاجة لإعادة التدريب على الذراع الجديدة؛ بل طبق ببساطة فهمه للتلامس والحركة على الشكل الفيزيائي الجديد. يشير هذا إلى أن الوكيل قد تعلم مبدأً عاماً للتلاعب وليس مجرد خدعة خاصة بروبوت واحد.
كما سلطت الدراسة الضوء على تكلفة وتعقيد هذا النهج. أنتج وكيل الذكاء الاصطناعي ملايين الكلمات من الكود والتحليل خلال العملية، وهي مهمة استغرقت أكثر من مائتي ساعة من العمل الآلي وكبدت موارد حوسبة كبيرة. أشار الباحثون إلى أن الوكيل تعامل مع المحاكاة كعالم مثالي، وهو أمر يمثل قيداً. في العالم الحقيقي، قد يختلف الاحتكاك، أو قد تكون الكاميرا خارج التركيز قليلاً، وهي أمور لم تأخذها المحاكاة في الاعتبار. ومع ذلك، فإن حقيقة قدرة الذكاء الاصطناعي على حل مشكلة معقدة متعددة الخطوات كهذه دون أي بيانات بشرية تشير إلى اتجاه جديد قوي. إنها تظهر أن الذكاء الاصطناعي يمكن أن يعمل كباحث، يصيغ فرضياته الخاصة حول كيفية تحرك الروبوت، ويختبرها، ويصقل فهمه حتى يجد حلاً ليس صحيحاً فحسب، بل وأنيقاً أيضاً.
لا تدعي هذه الدراسة أن الروبوتات مستعدة لاستبدال العمال البشر في المصانع غداً. كانت عمليات المحاكاة مثالية، والعالم الحقيقي فوضوي. لكن النتائج تقدم تحولاً هادئاً في المنظور. بدلاً من تعليم الروبوتات عبر إظهار ما يجب فعله، يمكننا الآن أن نطلب منها اكتشاف كيفية القيام بذلك بنفسها. لم يكتفِ الوكيل بدفع كتلة؛ بل فكر في فيزياء الدفعة، وتعلم من أخطائه، ووجد طريقة أفضل. ومن خلال القيام بذلك، أثبت أنه مع الأدوات المناسبة، يمكن للذكاء الاصطناعي أن يتجاوز التقليد ليصبح حلالاً حقيقياً للمشكلات، قادراً على معالجة مهام قد تكون معقدة للغاية أو متنوعة بحيث يصعب على البشر تقديم نماذج لها يدوياً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.