💻 computer science

RegionReasoner: Region-Grounded Multi-Round Visual Reasoning

تقدم هذه الورقة البحثية RegionReasoner، وهو إطار عمل للتعلم التعزيزي يفرض استدلالاً بصرياً متعدد الجولات ومبنياً على أسس واقعية من خلال اشتراط الاستشهاد الصريح بمربعات الإحاطة والاتساق الدلالي العالمي والمحلي، إلى جانب معيار جديد يسمى RegionDial-Bench، لتحسين دقة الاستدلال والتمركز المكاني في نماذج الرؤية واللغة بشكل كبير.

Wenfang Sun, Hao Chen, Yingjun Du, Yefeng Zheng, Cees G. M. Snoek2026-03-11
💻 computer science

Pathwise Test-Time Correction for Autoregressive Long Video Generation

تقدم هذه الورقة طريقة "تصحيح وقت الاختبار" (TTC)، وهي طريقة لا تتطلب تدريباً تعمل على تثبيت توليد الفيديو للمتواليات الطويلة في النماذج ذات التوليد الذاتي المقطرة، وذلك باستخدام الإطار الأول كمرجع مرساة لمعايرة الحالات المتوسطة، مما يتغلب على تراكم الأخطاء ويمدد أطوال التوليد دون المساس بالجودة.

Xunzhi Xiang, Zixuan Duan, Guiyu Zhang, Haiyu Zhang, Zhe Gao, Junta Wu, Shaofeng Zhang, Tengfei Wang, Qi Fan, Chunchao G (…)2026-03-11
🤖 AI

Monocular Normal Estimation via Shading Sequence Estimation

تقدم هذه الورقة البحثية RoSE، وهو نهج مبتكر يعيد صياغة تقدير المتجهات العمودية أحادية العدسة كتقدير لتسلسل التظليل باستخدام نماذج توليدية من صورة إلى فيديو للتغلب على مشكلات عدم المحاذاة ثلاثية الأبعاد وتحقيق أداء هو الأفضل في فئته في الاختبارات المعيارية الواقعية.

Zongrui Li, Xinhua Ma, Minghui Hu, Yunqing Zhao, Yingchen Yu, Qian Zheng, Chang Liu, Xudong Jiang, Song Bai2026-03-11
🤖 AI

Energy-Aware Spike Budgeting for Continual Learning in Spiking Neural Networks for Neuromorphic Vision

تقترح هذه الورقة إطار عمل لميزانية النبضات يراعي استهلاك الطاقة، يدمج إعادة تشغيل الخبرة، ومعلمات العصبونات القابلة للتعلم، ومجدولاً تكيفياً للتخفيف بفعالية من النسيان الكارثي مع تحسين كل من الدقة وكفاءة الطاقة في الشبكات العصبية النبضية عبر مختلف معايير الرؤية العصبية القائمة على الإطارات والقائمة على الأحداث.

Anika Tabassum Meem, Muntasir Hossain Nadid, Md Zesun Ahmed Mia2026-03-11
💻 computer science

Multimodal Classification via Total Correlation Maximization

تتناول هذه الورقة مسألة التنافس بين الأنماط في التعلم متعدد الوسائط من خلال التحليل النظري للعلاقة بين النهجين المشترك والأحادي النمط، واقتراح TCMax، وهو طريقة خالية من المعلمات الفائقة تعمل على تعظيم الارتباط الكلي بين الميزات متعددة الوسائط والتسميات لتحقيق أداء تصنيف هو الأفضل في حالته.

Feng Yu, Xiangyu Wu, Yang Yang, Jianfeng Lu2026-03-11
💻 computer science

Temporal Consistency-Aware Text-to-Motion Generation

تقترح هذه الورقة البحثية إطار عمل TCA-T2M، وهو إطار عمل مبتكر يعزز توليد الحركة من النص عبر تقديم مشفر تلقائي كمي مكاني (VQ-VAE) واعٍ بالاتساق الزمني وكتلة قيود حركية لمعالجة عدم المحاذاة الزمنية عبر التسلسلات وعدم المعقولية الفيزيائية، محققاً أداءً هو الأفضل في فئته على معايير HumanML3D وKIT-ML.

Hongsong Wang, Wenjing Yan, Qiuxia Lai, Xin Geng2026-03-11
⚡ electrical engineering

Exploiting Completeness Perception with Diffusion Transformer for Unified 3D MRI Synthesis

تقدم هذه الورقة CoPeDiT، وهو إطار عمل موحد لتخليق صور الرنين المغناطيسي ثلاثية الأبعاد يستفيد من نموذج انتشار كامن ذاتي الإدراك مع مطالبات مدركة للاكتمال لتوليد صور عالية الدقة ومتسقة هيكلياً دون الاعتماد على توجيه يدوي خارجي للبيانات المفقودة.

Junkai Liu, Nay Aung, Theodoros N. Arvanitis, Joao A. C. Lima, Steffen E. Petersen, Le Zhang2026-03-11
💻 computer science

ChimeraLoRA: Multi-Head LoRA-Guided Synthetic Datasets

يعالج ChimeraLoRA ندرة البيانات في المهام دقيقة التفاصيل من خلال تخليق صور متنوعة وغنية بالتفاصيل عبر بنية هجينة تجمع بين LoRA مشتركة للفئة من أجل الأولويات الدلالية وLoRAs لكل صورة للخصائص المحددة، بتوجيه من التعزيز الدلالي واستراتيجية مزيج قائمة على توزيع ديريكليه لتحسين دقة التصنيف في المهام اللاحقة.

Hoyoung Kim, Minwoo Jang, Jabin Koo, Sangdoo Yun, Jungseul Ok2026-03-11
🤖 AI

Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1

تقترح هذه الورقة إطار عمل ثنائي المسار لتجزئة صور الطيور يستفيد من هيكل SAM 2.1 المجمد مع إما كاشف Grounding DINO 1.5 بنمط zero-shot أو كاشف YOLOv11 مضبوط بدقة تحت الإشراف، محققاً أداءً هو الأفضل في فئته على مجموعة بيانات CUB-200-2011 مع إلغاء الحاجة إلى إعادة تدريب نموذج التجزئة عبر الأنواع أو النطاقات المختلفة.

Abhinav Munagala2026-03-11
🤖 AI

Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation

تُعد Pri4R طريقة بسيطة وفعالة تعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) بفهم ضمني لديناميكيات العالم من خلال تدريبها على التنبؤ بمسارات النقاط ثلاثية الأبعاد باستخدام معلومات رباعية الأبعاد متميزة، مما يحسن بشكل كبير من أداء المناولة الفيزيائية دون إضافة أي عبء إضافي عند الاستنتاج.

Jisoo Kim, Jungbin Cho, Sanghyeok Chu, Ananya Bal, Jinhyung Kim, Gunhee Lee, Sihaeng Lee, Seung Hwan Kim, Bohyung Han, H (…)2026-03-11