🔢 mathematics

Identifying Memorization of Diffusion Models through pp-Laplace Analysis: Estimators, Bounds and Applications

تقترح هذه الورقة طريقة مبتكرة لتحديد بيانات التدريب المحفوظة في نماذج الانتشار من خلال الاستفادة من مؤثرات لابلاس-pp المستمدة من دالات السكور المقدرة، مما يوفر حدود خطأ نظرية وتحققاً تجريبياً على نماذج تحويل النص إلى صورة حيث نجح النهج في اكتشاف الحفظ حتى دون الوصول إلى النص الشرطي.

Jonathan Brokman, Itay Gershon, Amit Giloni, Omer Hofman, Roman Vainshtein, Hisashi Kojima, Guy Gilboa2026-02-26
🤖 AI

Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection

تقدم الورقة البحثية إطار عمل PROGRESS، وهو إطار عمل فعال من حيث البيانات والحوسبة لنماذج الرؤية واللغة، يقوم ديناميكياً بإعطاء الأولوية لعينات ضبط التعليمات بناءً على تقدم التعلم القائم على الخطأ النسبي، مما يتيح أداءً فائقاً باستخدام بيانات وإشراف أقل بكثير مقارنة بالنماذج المرجعية المتطورة.

Shivam Chandhok, Qian Yang, Oscar Manas, Kanishk Jain, Leonid Sigal, Aishwarya Agrawal2026-02-26
💻 computer science

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

تقترح هذه الورقة البحثية V2^2Drop، وهي طريقة لإسقاط الرموز الديناميكية القائمة على التباين، تعمل على تسريع استدلال نماذج الرؤية واللغة الكبيرة بشكل كبير من خلال الإزالة التدريجية للرموز البصرية ذات التباين الضئيل، مما يحقق تقليلاً جوهرياً في زمن الاستجابة مع الحفاظ على أداء قريب من الأداء الأصلي في مهام فهم الصور والفيديو.

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen2026-02-26
🤖 machine learning

MedicalPatchNet: A Patch-Based Self-Explainable AI Architecture for Chest X-ray Classification

تُعد MedicalPatchNet بنية هندسية مبتكرة للتعلم العميق ذاتية التفسير بطبيعتها لتصنيف صور الأشعة السينية للصدر، حيث تحقق أداءً يضاهي نموذج EfficientNetV2-S مع تحسين ملحوظ في قابلية التفسير التشخيصي ودقة تحديد مكان الاعتلالات من خلال آلية تجميع قائمة على الرقع (patches) تتسم بالشفافية، مما يعزز الثقة والسلامة السريرية.

Patrick Wienholt, Christiane Kuhl, Jakob Nikolas Kather, Sven Nebelung, Daniel Truhn2026-02-26
💻 computer science

Hallucination Filtering in Radiology Vision-Language Models Using Discrete Semantic Entropy

تُظهر هذه الدراسة أن تطبيق الإنتروبيا الدلالية المنفصلة لتصفية الأسئلة ذات عدم اليقين العالي يحسن بشكل كبير من دقة التشخيص لنماذج الرؤية واللغة الصندوقية السوداء في الأشعة عبر الكشف بفعالية عن الهلوسات ورفضها.

Patrick Wienholt, Sophie Caselitz, Robert Siepmann, Philipp Bruners, Keno Bressem, Christiane Kuhl, Jakob Nikolas Kather (…)2026-02-26
🤖 AI

World Simulation with Video Foundation Models for Physical AI

تقدم الورقة البحثية Cosmos-Predict2.5 وCosmos-Transfer2.5، وهي عائلة موحدة من النماذج التأسيسية للعالم التي تستفيد من بنيات التدفق والتعلم التعزيزي لتقديم توليد فيديو عالي الدقة ومتوافق مع التعليمات وترجمة للعالم، وذلك من أجل النهوض بالذكاء الاصطناعي الفيزيائي، والروبوتات، والذكاء المتجسد.

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Eli (…)2026-02-26
💻 computer science

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

تقدم هذه الورقة QTSplus، وهي وحدة اختيار رموز خفيفة الوزن وواعية بالاستعلام، تقوم بتصفية الرموز المرئية ديناميكيًا بناءً على تعقيد الاستعلام النصي لتقليل التكاليف الحسابية وزمن الاستجابة بشكل كبير في النماذج اللغوية متعددة الوسائط للفيديوهات الطويلة، مع الحفاظ على الأداء أو تعزيزه في مهام الفهم الزمني.

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang (…)2026-02-26
💻 computer science

RobustGait: Robustness Analysis for Appearance Based Gait Recognition

تقدم هذه الورقة البحثية RobustGait، وهو إطار عمل شامل يقيم بشكل منهجي متانة أنظمة التعرف على المشية القائمة على المظهر ضد مختلف التشويهات في العالم الحقيقي وتحيزات استخراج الصور الظلية عبر مجموعات بيانات متعددة، مما يكشف عن ثغرات حرجة ويقترح استراتيجيات فعالة لتعزيز الجاهزية للنشر.

Reeshoon Sayera, Akash Kumar, Sirshapan Mitra, Prudvi Kamtam, Yogesh S Rawat2026-02-26
💻 computer science

MIRA: Multimodal Iterative Reasoning Agent for Image Editing

تُعد MIRA وكيلًا متعدد الوسائط خفيف الوزن وقابلًا للتشغيل المباشر، يعمل على تعزيز تحرير الصور الموجه بالتعليمات من خلال توظيف حلقة تكرارية من الإدراك والاستدلال والعمل لتفكيك الطلبات المعقدة إلى خطوات ذرية، مما يحسن بشكل كبير الاتساق الدلالي والجودة الإدراكية عند اقترانه بنماذج التحرير مفتوحة المصدر الحالية.

Ziyun Zeng, Hang Hua, Jiebo Luo2026-02-26
💬 NLP

VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding

تقدم هذه الورقة VULCA-Bench، وهو معيار مرجعي متعدد الثقافات للرؤية واللغة يضم 7,410 زوجًا ثنائي اللغة من الصور والنقد عبر ثمانية تقاليد ثقافية وإطار تقييم خماسي الطبقات لتقييم وكشف قصور النماذج الحالية في الفهم الثقافي رفيع المستوى بما يتجاوز الإدراك البصري الأساسي.

Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi2026-02-26