🤖 AI

Grounding Social Perception in Intuitive Physics

تقترح هذه الورقة أن الإدراك الاجتماعي البشري يرتكز على دمج علم النفس والفيزياء الحدسيين، مبرهنةً من خلال مجموعة بيانات PHASE والنموذج الحسابي SIMPLE أن الاستنتاج الدقيق لأهداف الوكلاء وعلاقاتهم من التفاعلات الفيزيائية يتطلب نهج تخطيط عكسي بايزي قائم على الفيزياء بدلاً من مجرد مطابقة الأنماط البصرية البسيطة.

Lance Ying, Aydan Y. Huang, Aviv Netanyahu, Andrei Barbu, Boris Katz, Joshua B. Tenenbaum, Tianmin Shu2026-03-31
💻 computer science

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

تقدم الورقة البحثية SpatialStack، وهو إطار عمل للدمج الهرمي يعمل على محاذاة ميزات الرؤية والهندسة واللغة متعددة المستويات بشكل تدريجي للتغلب على قيود النماذج البصرية اللغوية (VLMs) الحالية في الاستدلال المكاني ثلاثي الأبعاد، مما أدى إلى نموذج VLM-SpatialStack الذي حقق أفضل النتائج الحالية.

Jiang Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan2026-03-31
💻 computer science

LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model

يُعد LOME نموذج عالم منظور شخصي مشروط بالأفعال، يقوم بتوليد مقاطع فيديو واقعية ومتسقة فيزيائياً للتفاعل بين الإنسان والأشياء من خلال التقدير المشترك للأفعال المكانية والسياقات البيئية، متفوقاً بذلك على الأساليب الحالية في التحكم في الحركة والتعميم لتطبيقات مثل الواقع المعزز/الواقع الافتراضي والتدريب الروبوتي.

Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, Yue Wang2026-03-31
📊 statistics

Estimating the Impact of COVID-19 on Travel Demand in Houston Area Using Deep Learning and Satellite Imagery

تستخدم هذه الدراسة صور الأقمار الصناعية عالية الدقة ونماذج التعلم العميق (Detectron2 وFaster R-CNN) لتقدير تأثير كوفيد-19 على الطلب على السفر في منطقة هيوستن الكبرى، مما كشف عن انخفاض متوسط بنسبة 30% في وجود المركبات في المواقع الرئيسية في عام 2020 مقارنة بعام 2019.

Alekhya Pachika, Lu Gao, Lingguang Song, Pan Lu, Xingju Wang2026-03-31
🤖 AI

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

تقترح هذه الورقة إطار عمل جديد للتعلم التعزيزي ثنائي المراحل يستخدم آلية "فجوة المعلومات" وفقدان التجذير لتدريب النماذج اللغوية الكبيرة متعددة الوسائط على التركيز ذاتياً وقص مناطق الصور الرئيسية بدقة، مما يعزز بشكل كبير قدرات الإدراك والاستدلال دقيقة التفاصيل لديها في المشاهد البصرية المعقدة دون الحاجة إلى إشراف على المسار.

Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu2026-03-31
💻 computer science

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

يُعد Chat-Scene++ إطار عمل جديداً للنماذج اللغوية الكبيرة متعددة الوسائط يعزز فهم المشاهد ثلاثية الأبعاد من خلال تمثيل المشاهد كمتتاليات كائنات غنية بالسياق مع رموز تعريفية، محققاً أداءً هو الأفضل في فئته في مجالات تحديد مواقع الكائنات والاستدلال المكاني عبر العديد من المعايوهات دون الحاجة إلى رؤوس مهام متخصصة أو إعادة بناء ثلاثية الأبعاد مكلفة حاسوبياً.

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao2026-03-31
💻 computer science

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

يُعد OmniColor إطار عمل موحداً لتلوين الرسوم الخطية متعدد الوسائط، يدمج التوجيه المتوافق مكانياً والمرجعي الدلالي من خلال استراتيجيات ترميز متخصصة ووحدة بوابات تكيفية لتحقيق نتائج دقيقة ومرنة ومستقرة زمنياً تحت قيود مستخدم متنوعة.

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li2026-03-31
💻 computer science

MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction

يُعد MV-RoMa نموذجاً للمطابقة الكثيفة متعدد الرؤى يتغلب على عدم الاتساق الهندسي للمطابقة الثنائية من خلال التقدير المشترك للمراسلات عبر رؤى متعددة عبر بنية فعالة واستراتيجية معالجة لاحقة، مما يتيح في النهاية عمليات إعادة بناء ثلاثية الأبعاد أكثر دقة وكثافة.

Jongmin Lee, Seungyeop Kang, Sungjoo Yoo2026-03-31
💻 computer science

PANDORA: Pixel-wise Attention Dissolution and Latent Guidance for Zero-Shot Object Removal

يُعد PANDORA إطار عمل مبتكر لإزالة الأجسام بنمط (zero-shot)، حيث يستفيد من حل التلاشي للانتباه على مستوى البكسل (Pixel-wise Attention Dissolution) والتوجيه بفك الارتباط الانتباهي الموضعي (Localized Attentional Disentanglement Guidance) لمحو الأجسام من الصور الطبيعية باستخدام نماذج الانتشار سابقة التدريب دون الحاجة إلى ضبط دقيق أو مطالبات نصية أو تحسين، محققاً بذلك دقة بصرية وملاءمة دلالية فائقتين مقارنة بالأساليب الحالية.

Dinh-Khoi Vo, Van-Loc Nguyen, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le2026-03-31
💻 computer science

Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method

تقدم هذه الورقة طريقة المحاذاة المتقاطعة المتدرجة والمستقلة عن النطاق (PICA)، وهي طريقة مبتكرة تعالج هشاشة كشف الأشياء ذات المفردات المفتوحة في ظل تغير النطاقات من خلال توظيف منهج تعليمي متعدد المستويات لبناء نماذج أولية تكيفية للكلمات الوهمية وفرض محاذاة مستقرة متقاطعة الوسائط عبر نطاقات متنوعة.

Xiaoran Xu, Xiaoshan Yang, Jiangang Yang, Yifan Xu, Jian Liu, Changsheng Xu2026-03-31