← أحدث الأبحاث
💻 computer science

Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

تقترح هذه الورقة استراتيجية "تقطيع الإجراءات التكيفي" (Adaptive Action Chunking - AAC)، وهي استراتيجية جديدة وقت الاستنتاج تعمل على ضبط أحجام قطع الإجراءات ديناميكيًا بناءً على إنتروبيا الإجراء لتحقيق التوازن بين سرعة استجابة النموذج واتساقه، مما يؤدي إلى تفوقها بشكل كبير على النهج ذات القطع الثابتة الموجودة في مهام المناولة الروبوتية المتنوعة.

المؤلفون الأصليون: Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat

نُشر 2026-04-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية صنع شطيرة. أعطيته أمرًا: "اصنع شطيرة زبدة الفول السوداني".

في عالم الروبوتات، هناك توازن دقيق وصعب يُسمى تجزئة الأفعال (Action Chunking).

المشكلة: معضلة "اضبطه وانسه"

غالبًا ما تستخدم الروبوتات الحالية استراتيجية حيث تخطط لتسلسل كامل من الحركات دفعة واحدة، مثل السيناريو المكتوب.

  • الكتلة الكبيرة (عداء الماراثون): إذا خطط الروبوت لـ 16 خطوة للأمام دفعة واحدة، فإنه يتحرك بسلاسة وكفاءة عالية. لا يتوقف ليفكر: "مهلًا، هل أسقطت الخبز؟" بل يستمر في الجري فقط. لكن، إذا حركت أنت الخبز فجأة، سيكون الروبوت عنيدًا جدًا بحيث لا يلاحظ ذلك. سيستمر في تنفيذ سيناريو الحركة الخاص به ويصطدم بالطاولة.
  • الكتلة الصغيرة (العداء المتوتر): إذا خطط الروبوت لخطوة واحدة فقط في كل مرة، فسيكون سريع الاستجابة للغاية. سيرى تحرك الخبز ويعدل مساره فورًا. لكن، نظرًا لأنه يتوقف للتفكير باستمرار، ستصبح حركاته متقطعة ومهتزة. قد يسقط الخبز لأنه حاول التصحيح الزائد عن اللزوم في كل ميلي ثانية.

لسنوات، ظل المهندسون عالقين في التخمين: "هل يجب أن آمر الروبوت بالتخطيط لـ 16 خطوة للأمام، أم 4 فقط؟" كان عليهم اختيار رقم واحد والالتزام به لكل مهمة، سواء كانت فتح باب ثقيل (يتطلب السلاسة) أو الضغط على زر صغير (يتطلب الدقة). هذا يشبه محاولة قيادة سيارة مع ضبط مثبت السرعة عند 45 ميلًا في الساعة بالضبط، بغض النظر عما إذا كنت على طريق سريع أو في منطقة مدرسية.

الحل: "السائق الذكي" (AAC)

ابتكر مؤلفو هذه الورقة البحثية، بقيادة يوان تشانغ ليانغ، حيلة ذكية تسمى تجزئة الأفعال التكيفية (Adaptive Action Chunking - AAC).

بدلاً من حصر الروبوت في أسلوب تخطيط واحد، منحوه "شعورًا داخليًا" (أو بالأحرى "مقياس عدم يقين" رياضيًا) ليقرر إلى أي مدى ينظر للأمام.

إليك التشبيه: قيادة السيارة.

  1. الطريق السريع (عدم يقين منخفض): عندما تقود على طريق سريع مستقيم وخالٍ، تشعر بالثقة. لا تحتاج إلى تفقد مراياك كل ثانية. يمكنك الإبحار، والنظر بعيدًا، والتخطيط لمسارك للميل القادم.

    • في الروبوت: عندما يحرك الروبوت ذراعه في مساحة فارغة، فإنه يشعر بـ "الثقة" (اعتلال منخفض/Entropy منخفض). يخبره نظام AAC: "انطلق بقوة! خطط لـ 16 خطوة للأمام!" وهذا يجعل الحركة سلسة وسريعة.
  2. المنطقة المدرسية (عدم يقين مرتفع): فجأة، يركض طفل في الشارع. تنخفض ثقتك. لا يمكنك النظر ميلًا للأمام؛ بل تحتاج إلى الاستجابة الآن. تنتقل إلى تفقد مراياك كل جزء من الثانية.

    • في الروبوت: عندما يكون الروبوت على وشك الإمساك بموزة زلقة أو الضغط على زر صغير، فإنه يشعر بـ "عدم اليقين" (اعتلال مرتفع/Entropy مرتفع). يخبره نظام AAC: "توقف! خطط لخطوة أو خطوتين فقط للأمام!" وهذا يجعل الروبوت شديد الوعي والدقة، مما يمنعه من سحق الموزة.

كيف "يشعر" الروبوت بعدم اليقين؟

تستخدم الورقة البحثية مفهومًا يسمى اعتلال الفعل (Action Entropy). فكر في هذا كـ "درجة ثقة".

  • إذا قال عقل الروبوت: "أنا متأكد بنسبة 99% أنه يجب عليّ تحريك يدي لليسار"، فهذا هو الاعتلال المنخفض (ثقة عالية).
  • إذا قال عقل الروبوت: "همم، ربما لليسار؟ أو رب الله يمينًا؟ أو ربما يجب أن أتوقف؟" فهذا هو الاعتلال المرتفع (عدم يقين عالٍ).

يقوم خوارزمية AAC بفحص هذا المقياس باستمرار.

  • ثقة عالية؟ -> انتقل إلى كتلة طويلة (سلسة، فعالة).
  • ثقة منخفضة؟ -> انتقل إلى كتلة قصيرة (دقيقة، استجابية).

لماذا هذا الأمر مهم؟

اختبر الباحثون هذا على كل من المحاكاة الحاسوبية والروبوتات الحقيقية.

  • في المطبخ: استطاع الروبوت حمل كوب بسلاسة (كتلة طويلة) ثم الانتقال فجأة إلى حركة صغيرة وحذرة لصب الماء دون انسكاب (كتلة قصيرة).
  • في العالم الحقيقي: عندما حاولوا التقاط موزة أو الضغط على زر الطوارئ، كان الروبوت المزود بنظام AAC أقل عرضة للاصطدام أو إسقاط الأشياء مقارنة بالروبوتات القديمة "ثابتة النمط".

الخلاصة

تحل هذه الورقة مشكلة "المقاس الواحد الذي يناسب الجميع" في الروبوتات. بدلاً من إجبار الروبوت على أن يكون مخططًا سلسًا بطيئًا أو مستجيبًا سريعًا مهتزًا، يجعل نظام AAC الروبوت قادرًا على أن يكون كليهما.

إنه يشبه منح الروبوت حدسًا بشريًا: "أعلم أن المسار خالٍ، لذا سأسرع. ولكن أوه، أرى جزءًا صعبًا قادمًا، لذا سأبطئ وأركز." هذا التحول البسيط يجعل الروبوتات أكثر أمانًا، وذكاءً، وقدرة على أداء المهام المعقدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →