💬 NLP

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

تقدم هذه الورقة البحثية ESI-Bench، وهو معيار مرجعي شامل للذكاء المكاني المتجسد مبني على أنظمة OmniGibson وأنظمة المعرفة الأساسية لـ Spelke، والذي يوضح أن حلقات الإدراك والعمل النشطة تتفوق بشكل كبير على الملاحظة السلبية من خلال تمكين الوكلاء من كشف المعلومات المكانية الخفية، بينما يكشف أن النماذج الحالية تفشل أساساً بسبب عمى العمل والفجوات الميتا معرفية بدلاً من ضعف الإدراك.

Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi2026-05-19
💻 computer science

Aurora: Unified Video Editing with a Tool-Using Agent

تقدم الورقة البحثية Aurora، وهو إطار عمل لتحرير الفيديو وكيلِيّ يستخدم نموذج رؤية ولغة مدعوم بالأدوات لترجمة طلبات المستخدم الخام إلى خطط تحرير مهيكلة، مما يؤدي إلى حل مشكلات عدم التحديد النصي والبصري لتعزيز أداء نماذج محولات انتشار الفيديو الموحدة.

Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo2026-05-19
💻 computer science

Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate

تقدم هذه الورقة البحثية \benchmark، وهو معيار مرجعي قوي وعائلة من المقاييس القائمة على COLMAP والتي توضح كيف يمكن لنماذج التأسيس ثلاثية الأبعاد الحالية أن تهلوس بالهندسة من مدخلات غير ذات صلة أو مشوشة، مما يوفر تقييماً للاتساق أكثر موثوقية بشكل كبير من الطرق العصبية الحالية من خلال التوافق بشكل أفضل مع الحكم البشري.

Soumava Paul, Prakhar Kaushik, Alan Yuille2026-05-19
🤖 AI

Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs

تقترح هذه الورقة البحثية "انتباه الوسائط المتبادل" (Modality-Mutual Attention - MMA)، وهو تعديل هيكلي خالٍ من المعلمات يستبدل الانتباه السببي في النماذج اللغوية الكبيرة متعددة الوسائط لتمكين رموز الصور من الانتباه إلى رموز النصوص، مما يؤدي إلى حل مشكلة عدم الاتساق بين الرؤية واللغة وتحقيق أداء هو الأفضل حالياً عبر 12 معياراً مرجعياً.

Wei-Yao Wang, Zhao Wang, Helen Suzuki, Yoshiyuki Kobayashi2026-05-18
🤖 machine learning

Integrating chemical structures as treatments improves representations of microscopy images for morphological profiling

تقدم الورقة البحثية MICON، وهو إطار عمل للتعلم التبايني ذاتي الإشراف يدمج هياكل المركبات الكيميائية كتحولات في النمط الظاهري مستحثة بالعلاج لتحسين تمثيل وإعادة إنتاج التوصيف المورفولوجي الخلوي بشكل كبير مقارنة بالطرق الحالية القائمة على الصور فقط.

Yemin Yu, Emre Hayir, Neil Tenenholtz, Lester Mackey, Ying Wei, David Alvarez-Melis, Ava P. Amini, Alex X. Lu2026-05-18
💻 computer science

Visual Compositional Tuning

تقدم الورقة البحثية COMPACT، وهي طريقة تركيبية لتنظيم البيانات تعمل على تخليق أمثلة تدريب معقدة من خلال دمج القدرات البصرية الذرية، مما يحقق كفاءة بيانات وأداءً فائقين في معايير الاختبار متعددة الوسائط مقارنة بتقنيات الاختزال الحالية مع تقليل بيانات التدريب المطلوبة بنسبة 90%.

Xindi Wu, Hee Seung Hwang, Polina Kirichenko, Esin Tureci, Olga Russakovsky2026-05-18
💬 NLP

VideoGameBench: Can Vision-Language Models complete popular video games?

تقدم الورقة البحثية VideoGameBench، وهو معيار قياسي حيث يتعين على نماذج الرؤية واللغة لعب ألعاب فيديو من حقبة التسعينيات باستخدام المدخلات البصرية الخام والتعليمات عالية المستوى فقط، مما يكشف أن حتى النماذج المتطورة تعاني بشكل كبير في اللعب في الوقت الفعلي بسبب القيود في الإدراك، والملاحة المكانية، وزمن انتقال الاستدلال.

Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press2026-05-18
🤖 AI

FAR: Function-preserving Attention Replacement for IMC-friendly Inference

تقترح هذه الورقة إطار عمل FAR، الذي يستبدل آلية الانتباه الذاتي في نماذج DeiT مسبقة التدريب بوحدات LSTM ثنائية الاتجاه متوافقة مع الحوسبة داخل الذاكرة (IMC) عبر التقطير والتقليم، محققاً دقة مماثلة مع تقليل كبير في زمن الاستجابة وتكاليف عرض النطاق الترددي على المسرعات القائمة على تقنية ReRAM.

Yuxin Ren, Maxwell D Collins, Miao Hu, Huanrui Yang2026-05-18
💻 computer science

Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging

يُعد MedBridge إطار عمل خفيف الوزن ومستقل عن النموذج، يعمل على تكييف النماذج التأسيسية للرؤية واللغة من أجل التشخيص الطبي عبر توظيف جسر الخبراء القائم على الاستعلام لمعالجة التحولات في المجال، وعدم تطابق الدقة، والاستنتاج متعدد التسميات في آن واحد، محققاً تحسينات كبيرة في الأداء عبر معايير قياسية متنوعة.

Yitong Li, Morteza Ghahremani, Christian Wachinger2026-05-18
💻 computer science

Grounded Reinforcement Learning for Visual Reasoning

تقدم الورقة البحثية نموذج ViGoRL، وهو نموذج رؤية ولغة تم تدريبه باستخدام إطار عمل جديد للتعلم التعزيزي متعدد الجولات يربط خطوات الاستدلال بإحداثيات بصرية محددة ويسمح بالتكبير الديناميكي، مما يجعله يتفوق بشكل كبير على الأساليب الحالية في مختلف اختبارات الاستدلال البصري والتثبيت.

Gabriel Sarch, Snigdha Saha, Naitik Khandelwal, Ayush Jain, Michael J. Tarr, Aviral Kumar, Katerina Fragkiadaki2026-05-18