💻 computer science

Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning

يُعد Traffic-MLLM إطار عمل عصبيًا لا يعتمد على الاسترجاع، يعمل على تعزيز اتخاذ القرار في القيادة الذاتية من خلال دمج بيانات مرورية متعددة المصادر مع آلية صقل مدفوعة بالفضول لتعلم فضاء حالات مهيكل وقابل للتعميم من أجل استدلال قوي في سيناريوهات الحالات النادرة.

Waikit Xiu, Qiang Lu, Bingchen Liu, Chen Sun, Xiying Li2026-03-10
💻 computer science

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

تقدم هذه الورقة WHU-STree، وهي مجموعة بيانات مرجعية شاملة ومتعددة الوسائط تتميز بسحب نقطية متزامنة وصور عالية الدقة لأكثر من 21,000 شجرة شارع عبر مدينتين، صُممت للتغلب على القيود في مجموعات البيانات الحالية من خلال تمكين مهام جرد متنوعة وتعزيز البحث في دمج الوسائط المتعددة والتعميم عبر المجالات لإدارة أشجار المناطق الحضرية.

Ruifei Ding, Zhe Chen, Wen Fan, Chen Long, Huijuan Xiao, Yelu Zeng, Zhen Dong, Bisheng Yang2026-03-10
🤖 machine learning

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

تقدم هذه الورقة إطار عمل ومعيار ORIC لتقييم وتحسين قدرات نماذج الرؤية واللغة الكبيرة في التعرف على الأشياء في ظل عدم الاتساق السياقي، مما يثبت أن مثل هذه السيناريوهات تضعف الأداء بشكل كبير وأن الضبط الدقيق للتعزيز البصري المستهدف يمكن أن يخفف من هذه الإخفاقات بفعالية.

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su2026-03-10
💻 computer science

Efficient Construction of Implicit Surface Models From a Single Image for Motion Generation

تقدم هذه الورقة البحثية إطار عمل "Fast Image-to-Neural Surface" (FINS)، وهو إطار عمل خفيف الوزن يعيد بناء الأسطح الضمنية عالية الدقة وحقول وظائف المسافة الموقعة (SDF) بكفاءة من صورة واحدة خلال ثوانٍ معدودة عبر الاستفادة من شبكات الهاش متعددة الدقة والنماذج التأسيسية المدربة مسبقاً، متفوقاً بذلك على الطرق الحالية في السرعة والدقة لتطبيقات الروبوتات.

Wei-Teng Chu, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi2026-03-10
💻 computer science

Quantized Visual Geometry Grounded Transformer

تقدم هذه الورقة QuantVGGT، وهو أول إطار عمل للكمية (quantization) لـ محولات الهندسة البصرية المرتكزة (VGGTs) ذات المليارات من المعلمات، والذي يتغلب على تحديات المعايرة والتوزيع الفريدة من خلال التكميم دقيق التفاصيل مزدوج التنعيم والنمذجة المتنوعة منقاة الضجيج لتحقيق مكاسب كبيرة في الذاكرة والسرعة مع الحفاظ على دقة إعادة بناء عالية.

Weilun Feng, Haotong Qin, Mingqiang Wu, Chuanguang Yang, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michel (…)2026-03-10
💻 computer science

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

يُعد QuantSparse إطار عمل موحداً يجمع بفعالية بين تكميم النماذج وتخفيف كثافة الانتباه لنماذج محولات الانتشار للفيديو من خلال تقديم تقنيتي "تقطير الانتباه البارز متعدد المقاييس" و"إعادة تمثيل الانتباه المتناثر من الدرجة الثانية" للتخفيف من فقدان المعلومات، مما يحقق تقليلاً كبيراً في التخزين وتسريعاً في الاستدلال مع التفوق بشكل جوهري على النماذج المرجعية الحالية في جودة التوليد.

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michel (…)2026-03-10
💻 computer science

FVO: Fast Visual Odometry with Transformers

تقدم الورقة البحثية طريقة "تقدير المسار البصري السريع" (FVO)، وهي طريقة تعتمد على المحولات (Transformer) تستبدل خطوط معالجة التحسين الهجين البطيئة بتراجع مباشر للوضعية النسبية وتجميع مدرك للثقة لتحقيق سرعة فائقة ودقة تنافسية في تقدير المسار البصري أحادي الكاميرا.

Vlardimir Yugay, Duy-Kien Nguyen, Theo Gevers, Cees G. M. Snoek, Martin R. Oswald2026-03-10
💻 computer science

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

تقدم هذه الورقة البحثية Honey-Data-15M، وهي مجموعة بيانات عالية الجودة مكونة من 15 مليون زوج مع إثراء بمستوى مزدوج من تسلسل الأفكار (Chain-of-Thought)، إلى جانب خط معالجة البيانات HoneyPipe ونموذج Bee-8B، مما يثبت مجتمعاً أن التحسينات المنهجية في جودة البيانات يمكن أن تمكّن النماذج اللغوية الكبيرة متعددة الوسائط مفتوحة المصدر بالكامل من تحقيق أداء رائد ينافس النظراء شبه المفتوحين.

Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, Shi-Min (…)2026-03-10
💻 computer science

Unsupervised Deep Generative Models for Anomaly Detection in Neuroimaging: A Systematic Scoping Review

تجمع هذه المراجعة النطاقية المنهجية بين ثلاث وثلاثين دراسة حول نماذج التوليد العميق غير الخاضعة للإشراف للكشف عن الشذوذ في التصوير العصبي، مع تسليط الضوء على إمكاناتها في التوطين غير المرتبط بنوع الاعتلال في البيئات شحيحة البيانات، مع تحديد التحديات الرئيسية مثل التباين المنهجي ومحدودية التحقق الخارجي.

Youwan Mahé, Elise Bannier, Stéphanie Leplaideur, Elisa Fromont, Francesca Galassi2026-03-10
💻 computer science

Advances in 4D Representation: Geometry, Motion, and Interaction

تقدم هذه الدراسة المسحية منظوراً متميزاً حول التوليد وإعادة البناء رباعي الأبعاد (4D) من خلال تصنيف الأعمال التمثيلية إلى ثلاث ركائز أساسية — الهندسة، والحركة، والتفاعل — لتوجيه الباحثين في اختيار وتخصيص التمثيلات رباعية الأبعاد المناسبة للمهام المتنوعة، مع معالجة أيضاً أدوار وحدود النماذج اللغوية الكبيرة، والنماذج التأسيسية للفيديو، ومدى توفر مجموعات البيانات الحالية.

Mingrui Zhao, Sauradip Nag, Kai Wang, Aditya Vora, Guangda Ji, Peter Chun, Ali Mahdavi-Amiri, Hao Zhang2026-03-10