🤖 AI

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

تقدم الورقة البحثية UniG2U-Bench، وهو معيار شامل لتقييم الانتقال من التوليد إلى الفهم عبر 30 مهمة فرعية، والذي كشف أنه بينما تتراجع النماذج متعددة الوسائط الموحدة عمومًا عن نماذج الرؤية واللغة الأساسية، إلا أنها تقدم مزايا محددة في الذكاء المكاني والاستنتاج متعدد الجولات، مما يسلط الضوء على الحاجة إلى تحسين بيانات ونماذج التدريب.

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Li (…)2026-03-04
💻 computer science

DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction

تُعد DuoMo طريقة توليدية متطورة تعيد بناء حركة بشرية متسقة عالمياً وفي فضاء العالم من فيديوهات غير مقيدة ومشوشة، وذلك عبر توظيف إطار عمل انتشار ثنائي يقوم أولاً بتقدير الحركة في فضاء الكاميرا ثم صقلها إلى مسار متماسك في فضاء العالم دون الاعتماد على النماذج البارامترية.

Yufu Wang, Evonne Ng, Soyong Shin, Rawal Khirodkar, Yuan Dong, Zhaoen Su, Jinhyung Park, Kris Kitani, Alexander Richard (…)2026-03-04
💻 computer science

Beyond Language Modeling: An Exploration of Multimodal Pretraining

تقدم هذه الورقة تجارب تدريب مسبق مضبوطة من الصفر باستخدام إطار عمل Transfusion لإثبات أن بنية "خليط من الخبراء" (Mixture-of-Experts) توفق بفعالية بين عدم التماثل في توسيع نطاق البيانات بين الرؤية واللغة، مما يتيح نماذج متعددة الوسائط موحدة ذات نمذجة عالمية فائقة وقدرات متكاملة.

Shengbang Tong, David Fan, John Nguyen, Ellis Brown, Gaoyue Zhou, Shengyi Qian, Boyang Zheng, Théophane Vallaeys, Junlin (…)2026-03-04
🤖 AI

Tether: Autonomous Functional Play with Correspondence-Driven Trajectory Warping

تُعد Tether إطار عمل روبوتي مستقلاً يستفيد من تشويه المسار القائم على المراسلة ونماذج الرؤية واللغة لتوليد بيانات لعب وظيفية متنوعة وعالية الجودة من عروض توضيحية دنيا، مما يُمكّن التحسين المستمر لسياسات التقليد للوصول إلى أداء مستوى الخبراء.

William Liang, Sam Wang, Hung-Ju Wang, Osbert Bastani, Yecheng Jason Ma, Dinesh Jayaraman2026-03-04
💻 computer science

Utonia: Toward One Encoder for All Point Clouds

تقدم الورقة البحثية Utonia، وهو مشفر محول نقاط ذاتي الإشراف يوحد مجالات السحب النقطية ثلاثية الأبعاد المتنوعة في فضاء تمثيل واحد متسق، مما يعزز قدرات الإدراك ويُمكّن من فوائد ناشئة لمهام الاستدلال المتجسد ومتعدد الوسائط.

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao2026-03-04
💻 computer science

RFAConv: Receptive-Field Attention Convolution for Improving Convolutional Neural Networks

تقدم هذه الورقة البحثية آلية "انتباه مجال الاستقبال" (RFA) ووحدة "RFAConv" المقابلة لها للتغلب على قيود آليات الانتباه المكاني الحالية في التعامل مع نوى الالتفاف الكبيرة من خلال معالجة مشاركة المعلمات بفعالية، مما يؤدي إلى تحسين أداء الشبكة بشكل كبير مع تكلفة حسابية ضئيلة.

Xin Zhang, Chen Liu, Degang Yang, Tingting Song, Yichen Ye, Ke Li, Yingze Song2026-03-03
🔬 optics

Task-Driven Lens Design

تقدم هذه الورقة البحثية "تصميم العدسات الموجه بالمهام"، وهو إطار تحسين مستقر يقوم بتجميد نموذج رؤية حاسوبية مُدرب مسبقاً لتحسين معلمات العدسة مباشرة لمهام رؤية حاسوبية محددة، مما ينتج عنه أنظمة بصرية مبتكرة تتفوق على العدسات التقليدية التي تهدف لتقليل الزيغ البصري باستخدام عدد أقل من العناصر.

Xinge Yang, Qiang Fu, Yunfeng Nie, Wolfgang Heidrich2026-03-03
⚡ electrical engineering

Towards Precision Cardiovascular Analysis in Zebrafish: The ZACAF Paradigm

تقدم هذه الورقة إطار عمل ZACAF، المعزز بتقنيات التعلم بنقل المعرفة وتعزيز البيانات، للتغلب على قيود نماذج التعلم العميق الخاضعة للإشراف من خلال تمكين التقييم الكمي القلبي الوعائي الآلي والقوي عبر مختلف إعدادات تصوير أسماك الزيبرا وتعديلات الطفرات، كما هو موضح في تحليل نماذج اعتلال عضلة القلب من نوع nrap.

Amir Mohammad Naderi, Jennifer G. Casey, Mao-Hsiang Huang, Rachelle Victorio, David Y. Chiang, Calum MacRae, Hung Cao, V (…)2026-03-03
🤖 AI

Changing the Training Data Distribution to Reduce Simplicity Bias Improves In-distribution Generalization

تقترح هذه الورقة طريقة USEFUL، التي تخفف من انحياز البساطة عبر زيادة أخذ عينات المجموعات البيانية غير الممثلة كفاية والمحددة مبكراً في التدريب بشكل استراتيجي، مما يحسن بشكل كبير من تعميم التوزيع الداخلي عبر مختلف البنيات والمجموعات البيانية عند دمجها مع نزول التدرج أو تقليل الحدة الواعي.

Dang Nguyen, Paymon Haddad, Eric Gan, Baharan Mirzasoleiman2026-03-03
🤖 AI

Towards Camera Open-set 3D Object Detection for Autonomous Driving Scenarios

تقدم الورقة البحثية OS-Det3D، وهو إطار تدريب ثنائي المراحل يستفيد من الإشارات الهندسية المستمدة من ليدار (LiDAR) ووحدة اختيار مشتركة لتمكين كواشف الأجسام ثلاثية الأبعاد القائمة على الكاميرا من اكتشاف وتحديد كل من الأجسام المعروفة وغير المعروفة بفعالية في سيناريوهات القيادة الذاتية.

Zhuolin He, Xinrun Li, Jiacheng Tang, Shoumeng Qiu, Wenfu Wang, Xiangyang Xue, Jian Pu2026-03-03