Visual Prompt Guided Unified Pushing Policy
تقترح هذه الورقة سياسة دفع موحدة تدمج آلية تنبيه بصري خفيفة الوزن مع مطابقة التدفق لتوليد أفعال تفاعلية متعددة الأنماط، مما يتيح إعادة ترتيب الكائنات بكفاءة وتنوع عبر سيناريوهات تخطيط متنوعة.
4796 ورقة بحثية
تقترح هذه الورقة سياسة دفع موحدة تدمج آلية تنبيه بصري خفيفة الوزن مع مطابقة التدفق لتوليد أفعال تفاعلية متعددة الأنماط، مما يتيح إعادة ترتيب الكائنات بكفاءة وتنوع عبر سيناريوهات تخطيط متنوعة.
تقدم هذه الورقة CaPE، وهو إطار عمل لتخطيط المسارات متعدد الوسائط يتسم بالأمان والقابلية للتفسير، يستفيد من نماذج الرؤية واللغة لتخليق برامج تعديل مسار مُتحقق منها، مما يمكّن الوكلاء اللامركزيين من تكييف مساراتهم بفعالية لتجنب الاصطدام والتعاون الفيزيائي بناءً على التواصل اللغوي من الوكلاء الآخرين.
يُعد Vid2Sid خط أنابيب لتحديد هوية الأنظمة الموجه بالفيديو، يستفيد من الإدراك القائم على النماذج التأسيسية ومحسن يعتمد في الحلقة ضمن نموذج لغوي بصري لتشخيص التباينات الفيزيائية بين المحاكاة والواقع تلقائياً وتحديث معلمات المحاكاة بشكل تكراري بمسوغات لغوية طبيعية قابلة للتفسير، محققاً دقة معايرة هي الأفضل في مجالها على كل من الأنظمة الروبوتية الصلبة واللينة.
تقدم هذه الورقة DeMUSE، وهو إطار عمل عميق متعدد الوسائط يدمج بيانات RGB والعمق والقوة سداسية المحاور عبر محول انتشار (Diffusion Transformer) مع تطبيع تكيفي وتوسيع خبير متفرق لتحقيق أداء فائق في التلاعب المجسم الماهر في كل من بيئات المحاكاة والبيئات الواقعية.
تقترح هذه الورقة إطار عمل لشبكة "MIMO Q" من الرتبة الأولى الواعية بعدم اليقين، والتي تعمل بفعالية على تخفيف أخطاء الاستقراء في التعلم المعزز غير المتصل عبر الاستفادة من البيانات خارج التوزيع من خلال قياس عدم اليقين، مع تحقيق أداء رائد بكفاءة حوسبية تضاهي الشبكة الواحدة.
تقدم هذه الورقة إطار عمل للملاحة التفاعلية مدى الحياة يستفيد من نهج تخطيط قائم على القيود ومدفوع بنماذج لغوية كبيرة مع الإدراك النشط لتمكين الروبوتات من إزالة الفوضى وإكمال مهام وضع الأشياء المتتالية بنجاح في بيئات معقدة ومعاقة، متفوقة بذلك على النماذج المرجعية الحالية في كل من المحاكاة والأجهزة الواقعية.
إن NovaPlan هو إطار عمل هرمي يُمكّن من التلاعب الروبوتي طويل الأمد بنمط "الصفر استباقي" (zero-shot) عبر دمج التخطيط البصري-اللغوي ذي الحلقة المغلقة لتفكيك المهام عالية المستوى والتعافي من الأخطاء، مع الأولويات الكينماتيكية المولدة عبر الفيديو لضمان تنفيذ متين للأفعال منخفضة المستوى.
تقترح هذه الورقة نظاماً لتعلم السياق مدعوماً بالنماذج اللغوية الكبيرة (LLM) لشبكات الاستشعار المدعومة بالطائرات بدون طيار، يقوم بتوليد جداول زمنية لجمع البيانات عبر أوصاف مهام باللغة الطبيعية، ويتضمن مُحقِّق سلامة لمنع العمليات غير الآمنة، ويُظهر أداءً فائقاً في تقليل فقدان الحزم مقارنة بطرق التعلم المعزز العميق التقليدية مع تسليط الضوء على نقاط الضعف تجاه هجمات كسر الحماية (jailbreaking).
تقترح الورقة البحثية ConformalNL2LTL، وهي طريقة مبتكرة تترجم التعليمات باللغة الطبيعية إلى صيغ المنطق الزمني الخطي (LTL) مع ضمانات صحة محددة من قبل المستخدم عبر الحل التكراري لمشكلات الأسئلة والأجوبة ذات المفردات المفتوحة باستخدام النماذج اللغوية الكبيرة المعززة بالتنبؤ المطابق لتقليل تدخل المستخدم.
تقدم هذه الورقة تصميماً للتحكم المشترك مدفوعاً بتتبع حركة العين للأذرع الروبوتية المساعدة، باستخدام دراسات "ساحر أوز" (Wizard of Oz) لتقييم احتياجات المستخدمين بسرعة، وتحديد تحديات التصميم، وتوجيه التحسينات المستقبلية في مجال سهولة الوصول.