💻 computer science

PaCo-FR: Patch-Pixel Aligned End-to-End Codebook Learning for Facial Representation Pre-training

يُعد PaCo-FR إطار عمل للتدريب المسبق غير الخاضع للإشراف يجمع بين نمذجة الصور المقنعة ومحاذاة الرقعة مع البكسل وقيود الاتساق المكاني لتحقيق تعلم تمثيل وجهي رائد من خلال التقاط الدلالات الدقيقة والهياكل التشريحية بفعالية مع تقليل الاعتماد على البيانات المصنفة.

Yin Xie, Zhichao Chen, Zeyu Xiao, Yongle Zhao, Xiang An, Kaicheng Yang, Zimin Ran, Jia Guo, Ziyong Feng, Jiankang Deng2026-04-08
💻 computer science

Matrix-game 2.0: An open-source real-time and streaming interactive world model

تُعد Matrix-Game 2.0 نموذج عالم تفاعلي في الوقت الفعلي ومفتوح المصدر، يستفيد من خط أنابيب بيانات قابل للتوسع، وحقن الأفعال، والتقطير متعدد الخطوات لتوليد مقاطع فيديو عالية الجودة مدتها دقيقة واحدة وبمعدل 25 إطاراً في الثانية بناءً على مدخلات المستخدم.

Xianglong He, Chunli Peng, Zexiang Liu, Boyang Wang, Yifan Zhang, Qi Cui, Fei Kang, Biao Jiang, Mengyin An, Yangyang Ren (…)2026-04-08
💬 NLP

MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction

يقدم MetaEmbed إطار عمل جديد للاسترجاع متعدد الوسائط يستخدم رموز ميتا (Meta Tokens) قابلة للتعلم وتدريب متجهات ماتريوشكا متعددة (Matryoshka Multi-Vector) لتمكين التوسع المرن لجودة وكفاءة الاسترجاع في وقت الاختبار، محققاً أداءً هو الأفضل في فئته على معايير مثل MMEB وViDoRe.

Zilin Xiao, Qi Ma, Mengting Gu, Chun-cheng Jason Chen, Xintao Chen, Vicente Ordonez, Vijai Mohan2026-04-08
💻 computer science

A Scene is Worth a Thousand Features: Feed-Forward Camera Localization from a Collection of Image Features

تقدم هذه الورقة FastForward، وهي طريقة تغذية أمامية (feed-forward) تحقق دقة رائدة في تحديد موقع الكاميرا مع حد أدنى من وقت إعداد الخرائط، وذلك عن طريق تمثيل المشاهد كمجموعات سمات مرتكزة ثلاثية الأبعاد للتنبؤ بالتوافق بين الصورة والمشهد في تمريرة واحدة.

Axel Barroso-Laguna, Tommaso Cavallari, Victor Adrian Prisacariu, Eric Brachmann2026-04-08
💻 computer science

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

تقدم هذه الورقة MATRIX، وهي طريقة تنظيم تهدف إلى محاذاة آليات الانتباه في نماذج Video DiTs مع مسارات أقنعة متعددة المثيلات من مجموعة بيانات MATRIX-11K المنسقة حديثاً لتعزيز توليد الفيديو المدرك للتفاعل عبر تحسين التجذر الدلالي والانتشار مع تقليل الهلوسة.

Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim2026-04-08
💻 computer science

Cattle-CLIP: A Multimodal Framework for Cattle Behaviour Recognition from Video

لمعالجة ندرة البيانات وفجوات النطاق في مراقبة الماشية، يقترح المؤلفون Cattle-CLIP، وهو إطار عمل رؤية-لغة متكيف مع النطاق يعيد صياغة التعرف على سلوك الماشية كتحاذٍ دلالي عبر الوسائط، ويقدم مجموعة بيانات CattleBehaviours6، محققاً دقة بنسبة 96.1% في الإعدادات الخاضعة للإشراف وتعماً قوياً في سيناريوهات التعلم من أمثلة قليلة.

Huimin Liu, Jing Gao, Daria Baran, AxelX Montout, Neill W Campbell, Andrew W Dowsey2026-04-08
💬 NLP

DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation

تقدم هذه الورقة البحثية DialectGen، وهو معيار قياسي واسع النطاق يكشف عن تدهور كبير في أداء النماذج التوليدية متعددة الوسائط عند معالجة المدخلات اللهجية، وتقترح استراتيجية تخفيف مبتكرة قائمة على الترميز تعمل بفعالية على استعادة متانة اللهجات لتطابق مستويات اللغة الإنجليزية الأمريكية القياسية دون المساس بالأداء القياسي.

Yu Zhou, Sohyun An, Haikang Deng, Da Yin, Clark Peng, Cho-Jui Hsieh, Kai-Wei Chang, Nanyun Peng2026-04-08
💻 computer science

NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation

يُعد NoisyGRPO إطار عمل للتعلم التعزيزي متعدد الوسائط يعمل على تعزيز قدرة التعميم والمتانة في تسلسل التفكير (Chain-of-Thought) لدى النماذج اللغوية الكبيرة من خلال حقن ضوضاء قابلة للتحكم في المدخلات البصرية لأغراض الاستكشاف، وتوظيف الاستدلال البايزي لتقدير مزايا المسار بشكل متين.

Longtian Qiu, Shan Ning, Jiaxuan Sun, Xuming He2026-04-08
💬 NLP

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

تقترح هذه الورقة "التفكير بالفيديو" كنموذج استدلال متعدد الوسائط جديد يستفيد من نماذج توليد الفيديو مثل Sora-2 كوسيط موحد للتغلب على قيود النهج القائم على النصوص والصور، مُثبتةً من خلال VideoThinkBench أن مثل هذه النماذج تحقق أداءً هو الأفضل في فئته في كل من مهام الاستدلال المتمحورة حول الرؤية والمتمحورة حول النص.

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Y (…)2026-04-08
💻 computer science

FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR

تقدم الورقة البحثية FinCriticalED، وهو معيار مرئي يتكون من 859 وثيقة مالية من العالم الحقيقي و9,481 حقيقة تم تعليقها من قبل خبراء، لتقييم وكشف الفجوة الكبيرة بين دقة التعرف الضوئي على الحروف (OCR) اللفظية وبين الحفاظ على الأدلة المالية الحاسمة لاتخاذ القرار في النماذج اللغوية الكبيرة متعددة الوسائط.

Yueru He, Xueqing Peng, Yupeng Cao, Yan Wang, Lingfei Qian, Haohang Li, Yi Han, Shuyao Wang, Ruoyu Xiang, Fan Zhang, Zhu (…)2026-04-08