💻 computer science

SiLVR: A Simple Language-based Video Reasoning Framework

إن SilVR هو إطار عمل بسيط، ومرن، ولا يتطلب تدريباً، يعزز قدرات النماذج اللغوية الكبيرة متعددة الوسائط في الاستدلال بالفيديو من خلال تفكيك المهام المعقدة إلى مرحلتين: تحويل الفيديو الخام إلى تمثيلات لغوية متعددة الحواس، والاستفادة من النماذج اللغوية الكبيرة القوية مع تقليل السياق التكيفي لتحقيق أداء رائد في مختلف اختبارات قياس الفيديو.

Ce Zhang, Yan-Bo Lin, Ziyang Wang, Mohit Bansal, Gedas Bertasius2026-04-16
🤖 AI

Visual Sparse Steering (VS2): Unsupervised Adaptation for Image Classification using Sparsity-Guided Steering Vectors

تُعد طريقة التوجيه البصري المتناثر (VS2) وسيلة خفيفة الوزن وغير خاضعة للإشراف للتكيف أثناء وقت الاختبار، حيث تعمل على تحسين دقة تصنيف الصور من خلال بناء نواقل توجيه من ميزات المشفر التلقائي المتناثر دون تحديث أوزان النموذج أو الحاجة إلى بيانات مصنفة، مع توفير تشخيص للموثوقية لضمان العودة الآمنة إلى النموذج الأساسي.

Gerasimos Chatzoudis, Zhuowei Li, Gemma E. Moran, Hao Wang, Dimitris N. Metaxas2026-04-16
🤖 AI

Frozen Forecasting: A Unified Evaluation

تقدم هذه الورقة إطار تقييم موحداً لتقدير قدرات التنبؤ للنماذج الرؤيوية الأساسية المجمدة من خلال تدريب نماذج الانتشار الكامن على التنبؤ بالميزات المستقبلية في فضاء التمثيل، مما يكشف أن النماذج المدربة مسبقاً على الفيديو تتفوق على تلك المدربة على الصور، وأن القدرة على التنبؤ ترتبط ارتباطاً وثيقاً بالجودة الإدراكية بينما تقدم الإشراف اللغوي فوائد غير متسقة.

Jacob C Walker, Pedro Vélez, Luisa Polania Cabrera, Guangyao Zhou, Sayna Ebrahimi, Rishabh Kabra, Carl Doersch, Maks Ovs (…)2026-04-16
📊 statistics

Heavy-Tailed Class-Conditional Priors for Long-Tailed Generative Modeling

تقدم هذه الورقة البحثية نموذج C-t3t^3VAE، وهو نموذج توليدي يستخدم توزيعات "ستودنت t" (Student's tt) المشتركة لكل فئة وهدف تباعد γ\gamma للتغلب على الانحيازات الهندسية الكامنة في التوزيعات ذات الذيول الطويلة، محققاً بذلك قدرة فائقة على التوليد المتوازن بين الفئات وتغطية الأنماط في مجموعات البيانات شديدة عدم التوازن مقارنة بنماذج VAE المرجعية الحالية.

Aymene Mohammed Bouayed, Samuel Deslauriers-Gauthier, Adrian Iaccovelli, David Naccache2026-04-16
💬 NLP

RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows

يُعد RadAgents إطار عمل جديداً متعدد الوكلاء يعزز تفسير صور الأشعة السينية للصدر من خلال دمج الأوليات السريرية، والاستدلال متعدد الوسائط المدرك للمهام، وآليات التأسيس لمحاكاة سير عمل أخصائي الأشعة، مما ينتج مخرجات تشخيصية متوافقة سريرياً، ومؤسسة بصرياً، وقابلة للتحقق.

Kai Zhang, Corey D Barrett, Jangwon Kim, Lichao Sun, Tara Taghavi, Krishnaram Kenthapadi2026-04-16
💻 computer science

AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning

تقدم هذه الورقة البحثية AIM-CoT، وهو إطار عمل جديد لسلسلة الأفكار المتداخلة الأنماط (Interleaved-Modal Chain-of-Thought)، يعزز الاستدلال بين الرؤية واللغة من خلال معالجة أوجه القصور في آليات اختيار الأدلة وتحفيزها الحالية عبر توليد خرائط انتباه معززة بالسياق، والاستقصاء البصري النشط، ومحفز تحول الانتباه الديناميكي.

Xiping Li, Jianghong Ma2026-04-16
💻 computer science

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

تقدم الورقة البحثية إطار عمل HAMLET، وهو إطار عمل قابل للتوسع يعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) من خلال دمج رموز لحظات التباين الزمني ووحدة ذاكرة خفيفة الوزن للاستفادة بفعالية من السياق التاريخي، مما يحسن بشكل كبير أداء التلاعب الروبوتي في المهام طويلة المدى والمهام المعتمدة على التاريخ.

Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin2026-04-16
💻 computer science

Getting the Numbers Right\unicodex2014\unicode{x2014}Modelling Multi-Class Object Counting in Dense and Varied Scenes

تقدم هذه الورقة أول نهج قائم على محولات الرؤية (vision-transformer) لعد الأجسام متعدد الفئات، والذي يجمع بين هيكل Twins-SVT مع فك تشفير CNN متعدد المقاييس ووحدة تجزئة مساعدة لتحقيق أداء هو الأفضل في حالته عبر كل من المشاهد الكثيفة والمنتشرة، متفوقاً بشكل كبير على مقدرات الكثافة والكواشف الحالية.

Villanelle O'Reilly, Jonathan Cox, Georgios Leontidis, Marc Hanheide, Petra Bosilj, James M. Brown2026-04-16
🤖 machine learning

A Function-Centric Perspective on Flat and Sharp Minima

تتحدى هذه الورقة الرؤية التقليدية التي تفترض أن النهايات الصغرى المسطحة تضمن بطبيعتها تعميماً أفضل، محاججةً من خلال دراسات تجريبية مكثفة بأن الحدة هي خاصية تعتمد على الدالة — حيث غالباً ما ترتبط النهايات الصغرى الأكثر حدة بتحسين الأداء والمتانة والمعايرة عندما يتم تنظيم النماذج بشكل صحيح، رغم أن التمييز بين الحدة المدفوعة بالمهمة والحدة المدفوعة بالحفظ يظل سؤالاً عملياً مفتوحاً.

Israel Mason-Williams, Gabryel Mason-Williams, Helen Yannakoudakis2026-04-16✓ Author reviewed
⚡ electrical engineering

Person Re-Identification via Generalized Class Prototypes

تقترح هذه الورقة طريقة عامة لاختيار نماذج الفئات لعملية إعادة تحديد هوية الأشخاص، والتي تتجاوز مراكز الفئات التقليدية لتختار تمثيلات مثالية ديناميكيًا أثناء عملية الاسترجاع، محققةً بذلك أداءً هو الأفضل في فئته من خلال الموازنة بين الدقة ومتوسط الدقة المتوسطة عبر مختلف نماذج التضمين.

Md Ahmed Al Muzaddid, William J. Beksi2026-04-16