🤖 AI

The Geometry of Transfer: Unlocking Medical Vision Manifolds for Training-Free Model Ranking

تقترح هذه الورقة إطار عمل جديد لتقدير قابلية النقل القائم على الطوبولوجيا ولا يتطلب تدريباً، والذي يستفيد من المقاييس الطوبولوجية العالمية والمحلية لتصنيف النماذج التأسيسية الطبية بدقة لمهام التجزئة، متفوقاً بشكل كبير على الأساليب القائمة على التصنيف في معيار OpenMind.

Jiaqi Tang, Shaoyang Zhang, Xiaoqi Wang, Jiaying Zhou, Yang Liu, Qingchao Chen2026-03-02
💻 computer science

SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

يُعد SwitchCraft إطار عمل لا يتطلب تدريباً يعمل على تعزيز توليد الفيديو متعدد الأحداث من خلال تقديم تقنية توجيه الاستعلام المتوافق مع الأحداث لربط المطالبات بإطارات محددة، وتقنية حل قوة التوازن التلقائي للحفاظ على الاتساق الزمني، مما يمنع انهيار المشهد في السرديات المعقدة.

Qianxun Xu, Chenxi Song, Yujun Cai, Chi Zhang2026-03-02
💻 computer science

Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought

تقترح هذه الورقة البحثية "سلسلة التفكير البصري الرقمي" (NV-CoT)، وهو إطار عمل يُمكّن النماذج اللغوية الكبيرة متعددة الوسائط من إجراء استدلال دقيق مرتبط بالمنطقة من خلال توليد إحداثيات عددية مستمرة كأفعال، مما يتغلب على قيود النهج القائم على النصوص المتقطعة أو الرقع الثابتة مع تحسين دقة التحديد وكفاءة التدريب.

Kesen Zhao, Beier Zhu, Junbao Zhou, Xingyu Zhu, Zhongqi Yue, Hanwang Zhang2026-03-02
💻 computer science

MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation

تقدم هذه الورقة MSVBench، وهو أول معيار شامل مصمم لتقييم توليد الفيديو متعدد اللقطات من خلال سيناريوهات هرمية وإطار عمل هجين يجمع بين النماذج اللغوية الكبيرة متعددة الوسائط والخبراء، مما يكشف أن النماذج الحالية تفتقر إلى قدرات حقيقية في نمذجة العالم رغم تحقيقها توافقاً شبه مثالي مع الأحكام البشرية.

Haoyuan Shi, Yunxin Li, Nanhao Deng, Zhenran Xu, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang2026-03-02
🤖 AI

MINT: Multimodal Imaging-to-Speech Knowledge Transfer for Early Alzheimer's Screening

تقترح الورقة البحثية إطار عمل MINT، وهو إطار عمل مبتكر ثلاثي المراحل ينقل معرفة المؤشرات الحيوية من التصوير بالرنين المغناطني الهيكلي إلى تحليل الكلام أثناء التدريب، مما يتيح فحصاً مبكراً لمرض الزهايمر غير جراحي ومبنياً على أسس بيولوجية على نطاق سكاني دون الحاجة إلى التصوير العصبي عند الاستنتاج.

Vrushank Ahire, Yogesh Kumar, Anouck Girard, M. A. Ganaie2026-03-02
💻 computer science

Ordinal Diffusion Models for Color Fundus Images

تقترح هذه الورقة نموذج انتشار كامن رتبي يستفيد من الطبيعة المستمرة والمرتبة لشدة اعتلال الشبكية السكري لتوليد صور قاع عين ملونة أكثر واقعية واتساقاً سريرياً مقارنة بنماذج الانتشار الشرطية الفئوية القياسية.

Gustav Schmidt, Philipp Berens, Sarah Müller2026-03-02
🤖 AI

Interpretable Debiasing of Vision-Language Models for Social Fairness

تقدم هذه الورقة DeBiasLens، وهو إطار عمل قابل للتفسير ومستقل عن النموذج يستخدم المشفرات التلقائية المتفرقة لتحديد وتعطيل عصبونات السمات الاجتماعية بشكل انتقائي داخل نماذج الرؤية واللغة، مما يؤدي إلى تخفيف التحيزات الاجتماعية دون المساس بالمعرفة الدلالية.

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim2026-03-02
💻 computer science

Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection

تقترح هذه الورقة SteerVAD، وهو إطار عمل جديد لا يتطلب ضبطاً يعزز الكشف عن الشذوذ في الفيديو في النماذج اللغوية الكبيرة متعددة الوسائط المجمدة، وذلك من خلال تحديد خبراء الشذوذ الكامنين واستخدام متحكم ميتا هرمي لتوجيه وتصحيح تمثيلاتها الداخلية ديناميكياً، مما يحقق أداءً يضاهي أحدث ما توصل إليه العلم بأقل قدر من بيانات التدريب.

Zhaolin Cai, Fan Li, Huiyu Duan, Lijun He, Guangtao Zhai2026-03-02
💻 computer science

Spatio-Temporal Garment Reconstruction Using Diffusion Mapping via Pattern Coordinates

تقدم هذه الورقة إطاراً موحداً لإعادة بناء الملابس ثلاثية الأبعاد عالية الدقة من الصور ومقاطع الفيديو أحادية العدسة عبر الجمع بين أنماط الخياطة الضمنية ونموذج انتشار توليدي في مساحة UV لتعلم أولويات الشكل التعبيرية وفرض الاتساق المكاني والزماني، مما يتيح استعادة دقيقة للملابس الضيقة والفضفاضة مع تفاصيل هندسية دقيقة.

Yingxuan You, Ren Li, Corentin Dumery, Cong Cao, Hao Li, Pascal Fua2026-03-02
💬 NLP

Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification

تقدم هذه الورقة إطار عمل للتحقق العصبي الرمزي يستخدم أدوات حل مسائل التبعية (SMT) وقواعد المعرفة السريرية لإجراء تدقيق رسمي وضمان الاتساق المنطقي لتقارير الأشعة المولدة بواسطة نماذج الرؤية واللغة، مما يحدد بفعالية الهلوسات والإخفاقات الاستنتاجية التي تغفل عنها المقاييس التقليدية.

Vikash Singh, Debargha Ganguly, Haotian Yu, Chengwei Zhou, Prerna Singh, Brandon Lee, Vipin Chaudhary, Gourav Datta2026-03-02