💻 computer science

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

تقترح هذه الورقة طريقة لاتساق الأفعال عبر الرؤى المتعددة تعمل على تنظيم سياسات الرؤية-اللغة-الأفعال القائمة على التدفق لتحقيق المتانة ضد تغيرات زوايا رؤية الكاميرا والمشهد باستخدام الصور اللونية (RGB) والبيانات الحسية الخاصة فقط، مما يحسن الأداء بشكل كبير في مهام الروبوتات المحاكاتية والواقعية دون الحاجة إلى تسميات الكاميرا أو مدخلات العمق.

Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang2026-09-15
💻 computer science

DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

تقدم الورقة البحثية طريقة "ميزة إزالة الضجيج الوسيطة" (DIA)، وهي طريقة تدرج السياسة التي تعزز سياسات الروبوت القائمة على الانتشار من خلال تخصيص ائتمان يعتمد على الحالة لخطوات إزالة الضجيج الوسيطة، مما يتيح استكشافاً أكثر كفاءة وأداءً فائقاً للمهام مقارنة بنهج الضبط الدقيق الحالي.

Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic, Alan Aspuru-Guzik2026-09-15
🤖 machine learning

Early Prediction of Satellite Collision Probability Using a Hybrid TCN-Transformer Model for a CDM-Based Conjunction Analysis Framework

تقترح هذه الورقة نموذجاً هجيناً يجمع بين الشبكات العصبية التلافيفية الزمنية (TCN) والمحولات (Transformer)، والذي يستفيد من تحليل الحساسية وتحليل المكونات الرئيسية على رسائل بيانات الاقتران (CDMs) للتنبؤ بدقة باحتمالات التصادم المستقبلية لأقمار مدار الأرض المنخفض الاصطناعية، مما يتيح تقييماً مبكراً وأكثر اتساقاً للمخاطر المتعلقة بمناورات تجنب الاقتران.

Rabia Tüylek Tok, Burak Yağlıoğlu, Enes Dağ, Emre Onur Kahya2026-09-15
🤖 machine learning

Part Grounding, Not Action Knowledge: Locating the Bottleneck in VLM Affordance Prediction

تحدد هذه الورقة أن تحديد أجزاء الأجزاء (part grounding)، وليس نقص معرفة الفعل، هو العائق الأساسي في التنبؤ بالإمكانات (affordance prediction) في نماذج الرؤية واللغة، مما يثبت أن التحديد الصريح لجزء الكائن المستهدف يحسن دقة الفعل بشكل كبير عبر جميع النماذج المختبرة.

Sarthak Sattigeri2026-09-15
🤖 machine learning

GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures

تُعد GroundBench معياراً مرجعياً تحليلياً وضد واقعي، صُمم لعزل وتشخيص الأسباب المحددة لإخفاقات نماذج الرؤية واللغة في إدراك القدرة على التنفيذ (affordance)، وذلك من خلال إثبات أن العديد من نجاحات التوطين الظاهرية مدفوعة في الواقع بالارتباطات بين الفئة والفعل بدلاً من الاستنتاج البصري أو الميكانيكي الحقيقي.

Sarthak Sattigeri2026-09-15
🤖 machine learning

Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control

تقدم هذه الورقة آلية "ترانسفورمر" (transformer) ذات زيادة تدريجية أثناء وقت التشغيل، تعمل على نمو وتقليص رؤوس الانتباه ديناميكيًا أثناء التعلم التعزيزي بناءً على القدرة التمثيلية للسياق وفائض الرؤوس، مما يقضي على الإخفاقات الكارثية في التحكم التكيفي طويل الأمد للمناولات الروبوتية ذات ذاكرة الاحتكاك غير المرئية، ويزيل الحاجة إلى الضبط المسبق المكلف للمعلمات الفائقة.

Giansalvo Cirrincione, Adriano Fagiolini2026-09-15
🤖 AI

LePlanner: An Iterative Amortized Controller For World Models

يُعد LePlanner متحكماً تكرارياً مستهلكاً (amortized) يتدرب على نموذج عالم مجمد باستخدام هدف "الوصول والانتظار" (arrival-and-hold) لتحقيق تخطيط سريع مدرك للأفق في البيئات الغنية بالتلامس، مما يجعله يضاهي أداء طرق البحث المكلفة مع تقليل زمن الاستجابة الحسابي بشكل كبير.

Saksham Bansal, Om Naphade, Chayan Aggarwal, Vrishin M2026-09-15
🤖 AI

LPA-CWM: A Learned Physical Adjudicator for Motion Reasoning with Counterfactual World Models

تقدم هذه الورقة البحثية LPA-CWM، وهي طريقة توظف مُحكّماً فيزيائياً مُتعلماً خفيف الوزن (Learned Physical Adjudicator) لوزن استجابات نموذج العالم المضاد للواقع (counterfactual world model) ديناميكياً بناءً على موثوقيتها، مما يحسن بشكل كبير من دقة الاستدلال الحركي والتتبع مقارنة بنهج التجميع الموحد.

Kunwei Wu, Xiang Liu, Guocai Yao, Junming Chen, Zhikang Chen, Min Zhang, Pengwei Wang, Sen Cui2026-09-15
🤖 machine learning

VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching

تقترح الورقة البحثية "مطابقة التدفق الموجه بالقيمة" (VGFM)، وهو إطار عمل قابل للتوسع للتعلم التعزيزي غير المتصل (offline reinforcement learning) يدمج التوجيه الكثيف القائم على القيمة في سياسات مطابقة التدفق التعبيرية للتحكم الروبوتي دون الحاجة إلى الانتشار العكسي عبر الزمن أو أعباء خوارزمية إضافية، محققاً أداءً قوياً عبر مهام متنوعة من الحركة والتلاعب.

Prajwal Koirala, Mark Campbell2026-09-15
🤖 machine learning

S3-Tracker: Self-Supervised Surgical Tissue Tracking With Contrastive Random Walks

تقدم هذه الورقة البحثية S3-Tracker، وهو أسلوب تعلم ذاتي يستفيد من المسارات العشوائية التباينية على مقاطع فيديو تنظيرية غير مصنفة لتحقيق تتبع قوي لأنسجة الجراحة يضاهي الأساليب شبه المشرفة، مما يتغلب على تحدي الحصول على مجموعات بيانات ضخمة مشروحة للتدخل المساعد بالحاسوب.

Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean2026-09-15