🤖 AI

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

تقدم الورقة البحثية Med-CMR، وهو معيار شامل يتكون من أكثر من 20,000 زوج من أسئلة وأجوبة بصرية (VQA) دقيقة عبر 11 نظامًا عضويًا و12 نمطًا تصويريًا لتقييم قدرات الفهم البصري والاستدلال السريري متعدد الخطوات لنماذج اللغات الكبيرة متعددة الوسائط الطبية (MLLMs) بشكل منهجي، كاشفةً أنه في حين يتصدر GPT-5 حاليًا، فإن النماذج الطبية المتخصصة لا تتفوق باستمرار على النماذج العامة وتعاني بشكل كبير من التعميم في الحالات النادرة (long-tail generalization).

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jian (…)2026-04-01
💻 computer science

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

تقدم هذه الورقة البحثية Know-Show، وهو معيار جديد وطريقة خالية من التدريب تسمى GRAM، لتقييم وتحسين قدرات الاستنتاج المكاني-الزماني المرتبط بالتموضع في نماذج اللغة والفيديو من خلال توحيد الاستنتاج مع التموضع البصري والزماني عبر سيناريوهات متنوعة.

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando2026-04-01
💻 computer science

A Conditional Generative Framework for Synthetic Data Augmentation in Segmenting Thin and Elongated Structures in Biological Images

تقترح هذه الورقة إطار عمل توليدي شرطي يعتمد على Pix2Pix، معزز بخسارة هيكلية مدركة للخيوط، لتوليد صور مجهرية اصطناعية واقعية من أقنعة ثنائية، وذلك لمعالجة ندرة البيانات المشروحة وتحسين تجزئة الهياكل البيولوجية الرفيعة والمستطيلة مثل الأنيبيبات الدقيقة وخيوط الأكتين.

Yi Liu, Yichi Zhang2026-04-01
💻 computer science

EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories

تقدم هذه الورقة EMMA، وهو معيار شامل يقيم تقنيات محو المفاهيم عبر خمسة مجالات باستخدام 13 مقياساً للكشف عن أوجه قصورها في التعامل مع المطالبات غير المباشرة، والمفاهيم المتشابهة بصرياً، والتحيزات المحتملة.

Lu Wei, Yuta Nakashima, Noa Garcia2026-04-01
💻 computer science

Guiding a Diffusion Transformer with the Internal Dynamics of Itself

تقترح هذه الورقة البحثية "التوجيه الداخلي" (Internal Guidance - IG)، وهي استراتيجية بسيطة وفعالة تستفيد من الديناميكيات الداخلية لـ "محولات الانتشار" (Diffusion Transformers) عبر إدخال إشراف مساعد على الطبقات المتوسطة أثناء التدريب واستقراء مخرجات الطبقات أثناء أخذ العينات، مما يحقق جودة توليد وكفاءة تدريب رائدة في مجموعة بيانات ImageNet.

Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu2026-04-01
💻 computer science

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

تقدم هذه الورقة MVGGT، وهو إطار عمل فعال وشامل (end-to-end) لتجزئة التعبيرات المرجعية ثلاثية الأبعاد متعددة المشاهد، والذي يستعيد بنية المشهد ويجزئ الكائنات من مناظر RGB متفرقة باستخدام تصميم محول ثنائي الفروع واستراتيجية تحسين مبتكرة للتغلب على تخفيف تدرج المقدمة، مدعوماً بمقياس MVRefer الجديد.

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao2026-04-01
💻 computer science

AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation

يُعد AGILE إطار عمل قويًا يعيد بناء التفاعلات الديناميكية بين اليد والجسم من مقاطع فيديو أحادية العين عبر الانتقال من إعادة البناء التقليدية إلى نموذج توليدي وكيل، وذلك باستخدام نموذج رؤية ولغة لتخليق شبكات مجسمة كاملة للأجسام واستراتيجية "المرساة والتتبع" لتجاوز مرحلة التهيئة الهشة القائمة على بنية الحركة من متعدد الصور، مما ينتج أصولاً جاهزة للمحاكاة ذات دقة هندسية عالية ومعقولية فيزيائية.

Jin-Chuan Shi, Binhong Ye, Tao Liu, Xiaoyang Liu, Yangjinhui Xu, Junzhe He, Zeju Li, Hao Chen, Chunhua Shen2026-04-01
🤖 AI

Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

تتناول هذه الورقة المقايضة بين التوليد والفهم في النماذج متعددة الوسائط من خلال اقتراح إطار عمل "السبب-التأمل-التحسين" (R3)، الذي يعيد صياغة التوليد كعملية متعددة الخطوات من "التوليد-الفهم-إعادة التوليد" لتعزيز كلتا القدرتين في آن واحد.

Sen Ye, Mengde Xu, Shuyang Gu, Di He, Liwei Wang, Han Hu2026-04-01
💻 computer science

Human-level 3D shape perception emerges from multi-view learning

تُثبت هذه الورقة أن الإدراك البشري لمستوى الأشكال ثلاثية الأبعاد يمكن أن ينبثق من شبكات عصبية مُدربة حصرياً على بيانات بصرية مكانية متعددة المشاهد وطبيعية، محققةً تطابقاً في مرحلة "الصفر" (zero-shot) مع دقة البشر، وأنماط الخطأ، وأوقات الاستجابة دون تدريب خاص بالمهمة أو انحيازات استقرائية متعلقة بالأجسام.

Tyler Bonnen, Jitendra Malik, Angjoo Kanazawa2026-04-01
💻 computer science

StreetTree: A Large-Scale Global Benchmark for Fine-Grained Tree Species Classification

تقدم هذه الورقة البحثية StreetTree، وهو أول مجموعة بيانات مرجعية عالمية واسعة النطاق في العالم تحتوي على أكثر من 12 مليون صورة لأكثر من 8,300 نوع من أشجار الشوارع عبر 133 دولة، والمصممة للنهوض بتصنيف الأشجار دقيق التفاصيل ودعم أبحاث العلوم الحضرية من خلال معالجة تحديات مثل التشابه البصري، والتباين الموسمي، وظروف التصوير المتنوعة.

Jiapeng Li, Yingjing Huang, Fan Zhang, Yu liu2026-04-01