💻 computer science

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

للتغلب على تدهور الأداء في النماذج الحالية في توليد الصور متعددة المراجع الناتج عن نقص البيانات ذات السياق الطويل المنظمة، تقدم هذه الورقة MacroData، وهي مجموعة بيانات واسعة النطاق تضم 400 ألف عينة، وMacroBench، وهو معيار تقييم موحد، واللذان يُمكّنان معاً من تحقيق تحسينات جوهرية في توليد صور متماسكة من مراجع بصرية متعددة.

Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu2026-03-27
🤖 AI

Integrating Deep RL and Bayesian Inference for ObjectNav in Mobile Robotics

تقترح هذه الورقة إطار عمل هجين يدمج الاستدلال البايزي للحفاظ على خرائط الاعتقاد المكاني مع التعلم التعزيزي العميق لاختيار الإجراءات، مما يظهر تحسناً في معدلات النجاح وتقليلاً في جهد البحث في مهام الملاحة الذاتية للأجسام داخل البيئات الداخلية.

João Castelo-Branco, José Santos-Victor, Alexandre Bernardino2026-03-27
💻 computer science

CIAR: Interval-based Collaborative Decoding for Image Generation Acceleration

يُعد CIAR إطار عمل تعاوني بين السحابة والجهاز يعمل على تسريع التوليد الذاتي الانحدار للصور من خلال توظيف كمِّم لعدم اليقين في الرموز (tokens) على الجهاز باستخدام فترات احتمالية مستمرة لنقل الرموز غير المؤكدة فقط إلى السحابة، مما يحقق تسريعاً بمقدار 2.18 ضعفاً وانخفاضاً بنسبة 70% في طلبات السحابة مع الحفاظ على دقة بصرية عالية.

Keming Ye, Zhou Zhao, Fan Wu, Shengyu Zhang2026-03-27
💻 computer science

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

تُعد GridVAD خط تدفق عمل للكشف عن الشذوذ في الفيديو مفتوح المجموعة ولا يتطلب تدريباً، حيث يستفيد من نماذج الرؤية واللغة كجهات مقترحة للشذوذ يتم تنقيحها بواسطة توحيد الاتساق الذاتي وتأصيلها بواسطة نماذج الكشف والتجزئة لتحقيق أداء فائق على مستوى البكسل دون تدريب خاص بالمجال.

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed2026-03-27
💻 computer science

AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments

يُعد AdaSFormer إطار عمل محول متسلسل مبتكر يعالج تحديات إكمال المشهد الدلالي أحادي العدسة في الأماكن المغلقة من خلال مجالات استقبال تكيفية، وتشفير موضعي نسبي للمركز، وتطبيع طبقة معدل بالتلافيف، محققاً أداءً هو الأفضل في فئته على مجموعتي بيانات NYUv2 وOcc-ScanNet.

Xuzhi Wang, Xinran Wu, Song Wang, Lingdong Kong, Ziping Zhao2026-03-27
💻 computer science

RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models

تقدم الورقة البحثية RealRestorer، وهو نموذج مفتوح المصدر لترميم الصور يعد الأحدث في مجاله، تم تدريبه على مجموعة بيانات واسعة النطاق تضم تسعة أنواع من التدهور في العالم الحقيقي وتم تقييمه عبر RealIR-Bench الجديد، والذي يحقق أداءً يضاهي نماذج التحرير الضخمة مغلقة المصدر مع تقليل التكاليف الحسابية بشكل كبير.

Yufeng Yang, Xianfang Zeng, Zhangqi Jiang, Fukun Yin, Jianzhuang Liu, Wei Cheng, jinghong lan, Shiyu Liu, Yuqi Peng, Gan (…)2026-03-27
💻 computer science

Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training

تتناول هذه الورقة الارتباط السلبي المتأصل بين جودة المظهر البصري وجودة الحركة في بيانات الفيديو من خلال تقديم استراتيجية "فك الارتباط للجودة المدرك للخطوات الزمنية" (TQD)، وهي استراتيجية تدريب مبتكرة تختار عينات البيانات عند خطوات زمنية محددة في عملية الانتشار لتمكين النماذج من تحقيق أداء فائق حتى دون الوصول إلى بيانات "ذهبية" مثالية.

Xiangyang Luo, Qingyu Li, Yuming Li, Guanbo Huang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Shao-Lun Huang2026-03-27
🤖 machine learning

Insights on back marking for the automated identification of animals

تستخدم هذه الدراسة شبكة عصبية من نوع ResNet-50 لتحليل كيفية تأثير ضبابية الحركة، وزوايا الرؤية، والانسدادات على التعرف على علامات الظهر في الخنازير، مما يوفر إرشادات حاسمة لتصميم معرفات غير غامضة ومتوافقة مع التعلم الآلي لدعم مراقبة الحيوانات على مستوى الفرد.

David Brunner, Marie Bordes, Elisabeth Mayrhuber, Stephan M. Winkler, Viktoria Dorfer, Maciej Oczak2026-03-27
💻 computer science

PAWS: Perception of Articulation in the Wild at Scale from Egocentric Videos

تُعد PAWS طريقة مبتكرة تعالج قيود القابلية للتوسع في تقنيات إدراك التمفصل الحالية من خلال الاستخراج المباشر لحركة الأجسام وبنيتها من فيديوهات المنظور الشخصي واسعة النطاق والواقعية عبر تفاعلات اليد مع الأشياء، مما يُظهر تحسينات ملحوظة في مجموعات البيانات العامة وفوائد لمهام الروبوتات والتنبؤ ثلاثي الأبعاد اللاحقة.

Yihao Wang, Yang Miao, Wenshuai Zhao, Wenyan Yang, Zihan Wang, Joni Pajarinen, Luc Van Gool, Danda Pani Paudel, Juho Kan (…)2026-03-27
💻 computer science

Towards Comprehensive Real-Time Scene Understanding in Ophthalmic Surgery through Multimodal Image Fusion

تقدم هذه الورقة إطار عمل للتعلم العميق متعدد الوسائط في الوقت الفعلي، يقوم بدمج بيانات المجهر الجراحي والتصوير المقطعي المتماسك داخل العمليات عبر وحدات الانتباه المتقاطع والوحدات الزمنية لتعزيز تتبع الأدوات وتقدير المسافة بين الأداة والأنسجة بدقة دون المليمتر في جراحة الشبكية والزجاجي بشكل كبير.

Nikolo Rohrmoser, Ghazal Ghazaei, Michael Sommersperger, Nassir Navab2026-03-27