← أحدث الأبحاث
🤖 AI

PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation

يُعد PACT-WAM نموذجاً مدمجاً للعمل في العالم يتنبأ بكفاءة بمسارات حركة مكونة من 16 خطوة وتوقعات بصرية متعددة المشاهد باستخدام الترميز الزمني الهرمي وأخذ عينات التدفق الشرطي، محققاً معدلات نجاح عالية في مهام التلاعب الروبوتي مع تمكين مراجعة المقترحات القائمة على الرؤية واللغة لتعزيز الأداء بشكل أكبر.

المؤلفون الأصليون: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

نُشر 2026-09-17
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

ملخص تقني: PACT-WAM

بيان المشكلة

تتطلب سياسات التلاعب الروبوتية شكلين من المعلومات الزمنية: التاريخ (History) لتوفير سياق للحركة والتفاعلات السابقة، والاستشراف البصري (Visual Foresight) للتنبؤ بتغيرات الحالة وتقييم الأفعال المقترحة. وبينما تعمل نماذج "العالم-الفعل" (World-Action Models - WAMs) بفعالية على ربط التاريخ والأفعال والملاحظات المستقبلية، إلا أنها تواجه اختناقاً حوسبياً كبيراً. إذ تتسبب التمثيلات الكثيفة لملاحظات الماضي والمستقبل في تكاليف معالجة باهظة؛ فعلى سبيل المثال، يتطلب ترميز 16 إطاراً تاريخياً بواقع 64 رمزاً (token) لكل منها 1,024 رمزاً لكل عرض، كما تضيف التوقعات متعددة الخطوات تسلسلات بصرية كامنة منفصلة. غالباً ما تعالج الطرق الحالية هذه التحديات بشكل منعزل—إما عبر ضغط التاريخ، أو استخدام استشراف بصري معياري مع وحدات تحكم منفصلة، أو إهمال توليد المستقبل أثناء الاستنتاج. ويتمثل التحدي الجوهري في تصميم تمثيلات مدمجة تحافظ على التغطية التاريخية وتوفر حالات قابلة للفك بشكل مستقل عند كل انتقال، مع وضع بروتوكول لاستخدام هذه التوقعات لتوجيه التنفيذ دون أعباء حوسبية باهظة.

المنهجية: PACT-WAM

يقترح المؤلفون نموذج PACT-WAM (التنبؤ بالأفعال والاستشراف البصري عبر الترميز الزمني المدمج)، وهو نموذج عالم-فعل يولد بشكل مشترك مسار حركة مكون من 16 خطوة وما يقابره زمنياً من استشراف بصري متعدد المشاهد عبر أخذ عينات التدفق الشرطي (conditional flow sampling). تعتمد البنية على ثلاثة خيارات تصميمية رئيسية:

1. الترميز الهرمي للتاريخ

بدلاً من الترميز الموحد، يستخدم PACT-WAM تخصيصاً للتاريخ بناءً على الحداثة (recency-based history allocation). حيث يخصص تمثيلات مكانية خشنة للملاحظات الأقدم وتمثيلات أدق للملاحظات الأحدث.

  • الآلية: باستخدام خلفية DINOv3 ViT-B/16 مجمدة، يعالج النموذج 16 إطاراً تاريخياً. يتم ضغط أقدم 8 إطارات إلى 4 رموز لكل عرض، والـ 6 إطارات الوسطى إلى 16 رمزاً، وأحدث إطارين إلى 64 رمزاً.
  • الكفاءة: يحافظ هذا على جميع الملاحظات الـ 16 باستخدام 256 رمزاً فقط لكل عرض، وهو ما يمثل خفضاً بنسبة 75% مقارنة بالترميز الكثيف (1,024 رمزاً) مع الحفاظ على تغطية زمنية عالية.
  • التكامل: يتم دمج هذه الميزات المضغوطة وإسقاطها في نموذج اللغة Qwen3-VL-4B لتشكيل سياق مشترك hth_t جنباً إلى جنب مع تعليمات المهمة.

2. توليد التدفق المشترك للفعل والبصر

يستخدم PACT-WAM محول تدفق مشترك (shared flow transformer) مع انتباه سببي حسب الانتقال (transition-wise causal attention) لتحديث الفعل المستمر والحالات البصرية بشكل مشترك.

  • الكمونات البصرية (Visual Latents): تُمثل الصور المستقبلية بواسطة كمونات TiTok-VAE مستمرة (K=32K=32 موقعاً لكل صورة) دون تقليل العينة الزمني. يضمن ذلك اقتران كل فعل بحالة بصرية لاحقة قابلة للفك بشكل مستقل.
  • العمود الفقري المشترك: يستقبل المحول (transformer) حالات الفعل والبصر المشوشة، وتضمين وقت التدفق، والسياق الثابت. ويستخدم قناعاً سببياً كتلياً (block-causal mask) حيث يمكن للاستعلامات في الكتلة jj (التي تمثل الانتقال رقم jj) الانتباه إلى جميع المواقع في الكتل kjk \leq j.
  • الرؤوس المزدوجة: تتنبأ رؤسان متخصصان في النوع (head) بالسرعة (gag_a للأفعال، و gvg_v للبصريات) بالسرعات في مساحات معيارية. تتبادل الأنواع المعلومات أثناء أخذ العينات من خلال اعتمادها المشترك على الحالات المشوشة ضمن البادئة الزمنية المسموح بها.
  • التدريب: يتم تدريب النموذج باستخدام مطابقة التدفق الشرطي (conditional flow matching) مع هدف انحدار سرعة ذو مسار خطي، مما يحسن فروع الضغط، ومسار السياق، ومحول التدفق، ورؤوس المخرجات مع إبقاء مشفرات/مفككات DINOv3 و TiTok-VAE مجمدة.

3. مراجعة المقترح (Proposal Review)

لتوجيه التنفيذ، يقدم PACT-WAM آلية مراجعة المقترح (Proposal Review) باستخدام نموذج لغة-رؤية (VLM).

  • العملية: تقوم أربعة طلبات متوازية لنموذج VLM بتقييم بادئات التوقع المتداخلة عند الخطوات 4، 8، 12، و16. وهي تقيم التقدم المتسق مع المهمة وتكتشف الإخفاقات المرئية (مثل عدم المحاذاة أو الاصطدامات).
  • منطق التنفيذ: يختار المتحكم أكبر بادئة معتمدة بالتتابع تحت أي قرار بالرفض (veto). إذا تم رفض المقترح، يقوم النظام بإجراء إعادة أخذ عينات مشتركة (حتى ثلاث محاولات) ضمن ميزانية محددة. إذا فشلت جميع المحاولات، تنتهي الحلقة (episode).

المساهمات الرئيسية

  1. تخصيص التاريخ بناءً على الحداثة: قدمت الورقة استراتيجية تخصص 256 رمزاً لكل عرض عبر إعطاء الأولوية للإطارات الحديثة. في اختبار LIBERO، تفوق هذا الأسلوب على الترميز الموحد لنفس الـ 16 إطاراً (98.6% مقابل 8 de 87.5% نجاح) وحقق أداءً مقارباً للترميز الكثيف (98.0%) مع استخدام رموز تاريخ أقل بنسبة 75%.
  2. التوليد المشترك في مساحة كامنة مدمجة: يولد PACT-WAM بشكل مشترك مسارات الأفعال والحالات البصرية في مساحة كامنة مدمجة لكل صورة، مما يوفر استشرافاً قابلاً للفك بشكل مستقل عند كل انتقال فيزيائي. وهذا يتيح لآلية مراجعة المقترح التحقق من بادئات التنفيذ، بناءً على أطر العمل الموحدة التي تدمج ترميز التاريخ المدمج ومراجعة المقترح.
  3. الأداء مع تعزيز وقت الاختبار: يحقق السياسة الأساسية معدلات نجاح عالية عبر المحاكاة والواقع. ويقدم إضافة "مراجعة المقترح" دفعة كبيرة في وقت الاختبار، مما يعزز المتانة دون إعادة تدريب السياسة الأساسية.

النتائج التجريبية

تم تقييم النموذج على LIBERO، و RoboTwin 2.0، ومنصة AgileX Piper في العالم الحقيقي.

  • LIBERO (المحاكاة):
    • بدون مراجعة المقترح (PR): 98.6% متوسط النجاح.
    • مع مراجعة المقترح (PR): 99.5% متوسط النجاح (الوصول إلى 100% في مجموعات Object و Goal).
  • RoboTwin 2.0 (المحاكاة):
    • بدون مراجعة المقترح (PR): 92.3% متوسط النجاح عبر 50 مهمة ثنائية اليد.
    • مع مراجة المقترح (PR): 93.4% متوسط النجاح.
  • Piper في العالم الحقيقي:
    • بدون مراجعة المقترح (PR): 78.0% متوسط النجاح عبر مهام Sorting و Handover و Cleanup.
    • مع مراجعة المقترح (PR): 86.7% متوسط النجاح.
  • الدراسات الاستقصائية (Ablation Studies):
    • التاريخ: يتفوق التسلسل الهرمي للرمونات 8:6:2 بشكل كبير على الترميز الموحد والكثيف من حيث الكفاءة والنجاح.
    • التوليد المشترك: يحسن التدريب المشترك للأفعال والبصريات نجاح التحكم (98.6%) مقارنة بنسخ الأفعال فقط (93.6%) أو النسخ المساعدة للبصر (96.4%).
    • السعة البصرية: تزيد زيادة السعة الكامنة من K=32K=32 إلى K=64K=64 من دقة التوقع (PSNR, SSIM) ولكنها تقلل قليلاً من نجاح التحكم (97.3% مقابل 98.6%)، مما يشير إلى وجود مقايضة حيث يوازن K=32K=32 الافتراضي بين الأداء والتكلفة الحوسبية.
    • مراجعة المقترح: تعمل مراجعة المقترح (PR) بفعالية على تصفية المسارات الفاشلة، حيث تقلل المعاينات المتوقعة من معدلات الرفض الخاطئ مقارത്ഥ باستخدام الملاحظات الحالية فقط.

الأهمية والادعاءات

تدعي الورقة أن PACT-WAM يعالج بنجاح المقايضة بين تكلفة التمثيل وتوافر الاستشراف البصري لاتخاذ قرارات التنفيذ. ومن خلال الجمع بين ترميز التاريخ الهرمي والكمونات البصرية المدمجة والقابلة للفك، يتيح النموذج أخذ عينات مشترك لمسارات الأفعة والتوقعات المقترنة زمنياً. تسمح هذه البنية ببروتوكول مراجعة المقترح الذي يوجه التنفيذ عبر التحقق من البادئات المتداخلة، مما يعزز المتانة في كل من المحاكاة وبيئات العالم الحقيقي.

يؤكد المؤلفون أن نهجهم يحافظ على المعلومات الزمنية الضرورية لاختيار الفعل مع تقليل عدد الرموز المطلوبة للتاريخ بشكل جذري. ويشيرون إلى أنه بينما تعد السياسة الأساسية تنافسية، فإن دمج الاستشراف البصري مع آلية مراجعة تعتمد على نموذج VLM يوفر مساراً متميزاً لتحسين الموثوقية في مهام التلاعب المعقدة. ويبرز العمل أن دقة التوقع العالية لا ترتبط دائماً بنجاح التحكم العالي، مما يشير إلى أن فائدة التوقع لاتخاذ القرار أكثر أهمية من جودة إعادة البناء الخام.

القيود التي ذكرها المؤلفون: يستخدم النظام الحالي تخصيصاً ثابتاً يعتمد على الحداثة، وأفقاً ثابتاً قدره 16 خطوة، وعملية مراجعة قد تغفل عن الإخفاقات القصيرة بين نقاط التحقق. ويُقترح للعمل المستقبلي استكشاف ضغط تكيفي للمهام وتوليد بآفاق زمنية متغيرة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →