🤖 AI

LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks

تقدم هذه الورقة البحثية LRR-Bench، وهو معيار اصطناعي لتقييم نماذج الرؤية واللغة في مهام الفهم المكاني المطلق والثلاثي الأبعاد، كاشفةً أن النماذج الحالية تتخلف بشكل كبير عن الأداء البشري وتفشل غالباً تماماً في تحديات الاستدلال المكاني المعقدة.

Fei Kong, Jinhao Duan, Kaidi Xu, Zhenhua Guo, Xiaofeng Zhu, Xiaoshuang Shi2026-02-24
💻 computer science

Unleashing the Power of Discrete-Time State Representation: Ultrafast Target-based IMU-Camera Spatial-Temporal Calibration

تقترح هذه الورقة طريقة جديدة، فائقة السرعة، ومفتوحة المصدر للمعايرة المكانية والزمانية بين وحدة قياس القصور الذاتي (IMU) والكاميرا بناءً على تمثيل الحالة في الزمن المنفصل، والتي تتغلب على التكاليف الحسابية العالية للنهج الحالية المعتمدة على الزمن المستمر مع معالجة تحديات المعايرة الزمنية بفعالية.

Junlin Song, Antoine Richard, Miguel Olivares-Mendez2026-02-24
🤖 AI

Comparing and Integrating Different Notions of Representational Correspondence in Neural Systems

تقيم هذه الورقة وتدمج مقاييس متعددة لتشابه التمثيل باستخدام نهج دمج شبكة التشابه المعدل لإثبات أن الجمع بين المقاييس المتكاملة يؤدي إلى مقارنات أكثر دقة وذات مغزى بيولوجي لكل من الشبكات العصبية الاصطناعية ونشاط الدماغ مقارنة بالاعتماد على أي مقياس منفرد.

Jialin Wu, Shreya Saha, Yiqing Bo, Meenakshi Khosla2026-02-24
🤖 AI

CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models

تقدم هذه الورقة البحثية تدريب الاتساق المتوسط (CMT)، وهي مرحلة تدريب وسيطة مبتكرة تعمل على استقرار وتسريع تعلم نماذج خرائط التدفق مثل نماذج الاتساق (Consistency Models) والتدفق المتوسط (Mean Flow)، محققةً جودة توليد فائقة في خطوات معدودة مقارنة بالطرق الحالية مع تقليل تكاليف البيانات والحوسبة بشكل كبير مقارنة بالأساليب القائمة.

Zheyuan Hu, Chieh-Hsin Lai, Yuki Mitsufuji, Stefano Ermon2026-02-24
💻 computer science

AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models

يقدم AlignTok استراتيجية محاذاة ثلاثية المراحل تعمل على تكييف المشفرات البصرية التأسيسية سابقة التدريب لتصبح أجهزة ترميز غنية دلالياً، مما يسرع بشكل كبير من تقارب نماذج الانتشار ويحسن جودة توليد الصور مقارنة بمشفرات VAE التقليدية.

Bowei Chen, Sai Bi, Hao Tan, He Zhang, Tianyuan Zhang, Zhengqi Li, Yuanjun Xiong, Jianming Zhang, Kai Zhang2026-02-24
🤖 machine learning

Flower: A Flow-Matching Solver for Inverse Problems

تقدم الورقة البحثية Flower، وهو حل تكراري للمسائل العكسية الخطية يستفيد من نماذج التدفق مسبقة التدريب لتقريب أخذ عينات التوزيع البعدي البايزي من خلال عملية ثلاثية الخطوات تتمثل في تقدير الوجهة، وإسقاط الجدوى، وتقدم الوقت، محققاً جودة إعادة بناء هي الأفضل في فئتها مع ثبات المعلمات الفائقة عبر مهام متنوعة.

Mehrsa Pourya, Bassam El Rawas, Michael Unser2026-02-24
🤖 AI

VIRTUE: Visual-Interactive Text-Image Universal Embedder

تقدم هذه الورقة البحثية VIRTUE، وهو نموذج تضمين بصري-تفاعلي عالمي للنصوص والصور يدمج قدرات التجزئة للسماح بمطالبات المستخدم المحددة لمنطقة معينة، محققاً أداءً هو الأفضل في فئته على كل من المعايير القياسية متعددة الوسائط ومهمة استرجاع بصري-تفاعلي جديدة واسعة النطاق.

Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji2026-02-24
🤖 AI

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

تقدم هذه الورقة البحثية RewardMap، وهو إطار عمل للتعلم التعزيزي متعدد المراحل يستفيد من مجموعة بيانات ذات مكافأة كثيفة (ReasonMap-Plus) وإشارات مكافأة مدركة للصعوبة للتغلب على تحديات المكافأة المتفرقة، مما يعزز بشكل كبير قدرات الاستدلال البصري دقيق التفاصيل والفهم المكاني للنماذج اللغوية الكبيرة متعددة الوسائط.

Sicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong, Jianke Zhu, Huan Wang2026-02-24
💻 computer science

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

يُعد LinVideo إطار عمل للتدريب اللاحق لا يعتمد على البيانات، يحقق تعقيد انتباه بمقدار O(n) في توليد الفيديو من خلال الاختيار التلقائي للطبقات لتحويل الانتباه الخطي عبر نهج التصنيف الثنائي وتوظيف هدف مطابقة التوزيع في أي وقت، مما يؤدي إلى تسريع كبير مع الحفاظ على جودة التوليد.

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang2026-02-24
💻 computer science

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

يقترح MergeMix نموذج تعزيز موحداً يجسّر الفجوة بين الضبط الدقيق الخاضع للإشراف والتعلم المعزز من خلال الاستفيد من تقنية Mixup القائمة على الرموز (token-based Mixup) لتوليد صور متوافقة سياقياً وتحسين هوامش التفضيل، مما يعزز قابلية التوسع والكفاءة والتعميم للنماذج اللغوية الكبيرة متعددة الوسائط.

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang2026-02-24