💬 NLP

M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG

تقدم الورقة البحثية M4-RAG، وهو معيار قياسي ضخم النطاق يمتد عبر 42 لغة و189 دولة لتقييم التوليد المعزز بالاسترجاع متعدد الوسائط ومتعدد اللغات، كاشفةً أنه في حين يستفيد نظام RAG من النماذج اللغوية البصرية الصغيرة، إلا أنه غالباً ما يفشل في التوسع مع النماذج الأكبر ويعاني من تدهور كبير في الأداء في السياقات غير الإنجليزية.

David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata2026-03-24
💻 computer science

sim2art: Accurate Articulated Object Modeling from a Single Video using Synthetic Training Data Only

تقدم الورقة البحثية sim2art، وهو إطار عمل قائم على البيانات يستعيد بدقة تقسيم الأجزاء ثلاثية الأبعاد ومعلمات المفاصل للأجسام المفصلية من فيديو أحادي العدسة واحد عبر الاستفوتادة من تمثيل قوي لنقاط السطح لكل إطار تم تدريبه حصريًا على بيانات اصطناعية، مما يلغي الحاجة إلى تكييف النطاق أو التوصيفات الواقعية مع التفوق على الأساليب الحالية الرائدة.

Arslan Artykov, Tom Ravaud, Corentin Sautier, Vincent Lepetit2026-03-24
💻 computer science

Leveraging Multispectral Sensors for Color Correction in Mobile Cameras

تقترح هذه الورقة إطار عمل موحداً قائماً على التعلم يدمج بيانات مستشعرات RGB عالية الدقة والبيانات متعددة الأطياف منخفضة الدقة لإجراء تصحيح لوني شامل من الطرف إلى الطرف، محققاً انخفاضاً في الخطأ يصل إلى 50% مقارنة بالنماذج المرجعية الحالية.

Luca Cogo, Marco Buzzelli, Simone Bianco, Javier Vazquez-Corral, Raimondo Schettini2026-03-24
🤖 AI

Flowception: Temporally Expansive Flow Matching for Video Generation

يُعد Flowception إطار عمل جديد لتوليد الفيديو غير ذاتي التراجع ومتعدد الأطوال، حيث يدمج بين عمليات إدراج الإطارات المنفصلة وإزالة الضجيج المستمر لتقليل تكاليف التدريب، وتخفيف تراكم الأخطاء، وتوحيد مهام مثل توليد الفيديو من الصور وتوليد البينية للفيديو بسلاسة.

Tariq Berrada Ifriqi, John Nguyen, Karteek Alahari, Jakob Verbeek, Ricky T. Q. Chen2026-03-24
🤖 machine learning

VoroLight: Learning Voronoi Surface Meshes via Sphere Intersection

يُعد VoroLight إطار عمل قابل للتفاضل يحقق إعادة بناء سلسة ومنتظمة للأشكال ثلاثية الأبعاد من خلال ربط رؤوس أسطح فورونوي بكرات قابلة للتدريب وتحسين فقد تقاطع الكرات لتعزيز التدهور المنضبط مع الحفاظ على خصائص مخططات فورونوي ككتل مغلقة ومحدبة.

Jiayin Lu, Ying Jiang, Yumeng He, Yin Yang, Chenfanfu Jiang2026-03-24
🤖 AI

InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression

يقدم InfoTok إطاراً نظرياً للمعلومات وضابطاً تكيفياً قائماً على المحولات يقوم بتخصيص رموز الفيديو ديناميكياً بناءً على الثراء المعلوماتي، محققاً معدلات ضغط رائدة عالمياً مع الحفاظ على الأداء.

Haotian Ye, Qiyuan He, Jiaqi Han, Puheng Li, Jiaojiao Fan, Zekun Hao, Fitsum Reda, Yogesh Balaji, Huayu Chen, Sheng Liu (…)2026-03-24
🤖 AI

Vision-language models lag human performance on physical dynamics and intent reasoning

تقدم هذه الورقة مفهوم الذكاء التلي-المكاني (TSI) ومعيار EscherVerse لتوضيح أن نماذج الرؤية واللغة الحالية تتخلف بشكل كبير عن الأداء البشري في الاستنتاج المتعلق بالديناميكيات الفيزيائية والنوايا البشرية الكامنة، مما يكشف عن فجوة حرجة بين التعرف على الأنماط والفهم المتجسد الحقيقي.

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V2026-03-24
🤖 AI

Subimage Overlap Prediction: Task-Aligned Self-Supervised Pretraining For Semantic Segmentation In Remote Sensing Imagery

تقدم هذه الورقة البحثية "تنبؤ تداخل الصور الفرعية" (Subimage Overlap Prediction)، وهي مهمة تدريب مسبق ذاتية الإشراف جديدة لتقسيم الصور الاستشعارية عن بُعد، تحقق تقارباً أسرع وأداءً فائقاً مع استخدام بيانات تدريب وبيانات مصنفة أقل بكثير مقارنة بالطرق الحالية.

Lakshay Sharma, Alex Marin2026-03-24
💻 computer science

ObjectForesight: Predicting Future 3D Object Trajectories from Human Videos

يُعد ObjectForesight نموذجًا ديناميكيًا ثلاثي الأبعاد يعتمد على الأجسام وقابلًا للتوسع، يتنبأ بمسارات الأجسام المستقبلية ذات درجات الحرية الست (6-DoF) من مقاطع فيديو قصيرة بمنظور الشخص الأول عبر تمثيل هندسة العالم صراحةً على مستوى الأجسام، وقد تم تدريبه على مجموعة بيانات واسعة النطاق تضم مليوني مقطع فيديو ذات حقائق أرضية زائفة لتحقيق دقة وقدرة على التعميم تتفوق على النهج التقليدية القائمة على البكسل.

Rustin Soraki, Homanga Bharadhwaj, Ali Farhadi, Roozbeh Mottaghi2026-03-24
🤖 AI

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

تقدم الورقة البحثية "Goal Force"، وهو إطار عمل مبتكر يدرب نماذج توليد الفيديو على بدائيات سببية اصطناعية باستخدام ناقلات قوة صريحة كأهداف، مما يتيح تعميماً صفرياً للمهام الفيزيائية المعقدة في العالم الحقيقي ويعمل كمحاكي فيزيائي عصبي ضمني للتخطيط الدقيق.

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann (…)2026-03-24