💻 computer science

RiskProp: Collision-Anchored Self-Supervised Risk Propagation for Early Accident Anticipation

يُعد RiskProp إطار عمل جديداً للتعلم الذاتي غير الخاضع للإشراف للتنبؤ المبكر بالحوادث، حيث يلغي الحاجة إلى تعليقات توضيحية ذاتية حول بداية الشذوذ من خلال الاستفادة فقط من إطارات التصادم الموثوقة وتوظيف تنظيم الإطارات المستقبلية جنباً إلى جنب مع قيود الرتابة التكيفية لنمذجة تطور المخاطر الزمنية، مما يحقق أداءً رائداً في هذا المجال وقدرة محسنة على التفسير.

Yiyang Zou, Tianhao Zhao, Peilun Xiao, Hongyu Jin, Longyu Qi, Yuxuan Li, Liyin Liang, Yifeng Qian, Chunbo Lai, Yutian Li (…)2026-03-31
💻 computer science

MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence

تقدم الورقة البحثية MEDIC-AD، وهو نموذج رؤية-لغة طبي يعتمد على مراحل لتعزيز الذكاء السريري من خلال دمج رموز (tokens) قابلة للتعلم واعية بالتشوهات للكشف عن الآفات، ورموز فروق ما بين الصور لتتبع تطور الأعراض، ومرحلة تفسيرية مخصصة لتوليد خرائط حرارية بصرية متسقة، مما يحقق أداءً فائقاً في مراقبة المرضى ودعم اتخاذ القرار في العالم الحقيقي.

Woohyeon Park, Jaeik Kim, Sunghwan Steve Cho, Pa Hong, Wookyoung Jeong, Yoojin Nam, Namjoon Kim, Ginny Y. Wong, Ka Chun (…)2026-03-31
💻 computer science

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

تقدم هذه الورقة COSMIC، وهو معيار لتقييم كيفية تعاون النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) عبر الحوار لبناء فهم مكاني مشترك من رؤى جزئية، مما يكشف أنه بينما تستطيع النماذج تحديد الأشياء المشتركة، إلا أنها تتخلف بشكل كبير عن البشر في الاستدلال العلاقاتي والحفاظ على نماذج ذهنية متسقة عالميًا للبيئة.

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal2026-03-31
💻 computer science

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

تقترح هذه الورقة البحثية خوارزمية "تحسين السياسة الزمنية العالمية" (TGPO)، وهي خوارزمية تعلم تعزيزي تحفز الوعي الزمني في النماذج اللغوية الكبيرة متعددة الوسائط من خلال المقارنة بين إطارات الفيديو المرتبة والمبعثرة لقمع الاختصارات المكانية وتحسين الاستدلال في فيديوهات المنظور الشخصي.

Zhiyang Xu, Tian Qin, Bowen Jin, Zhengfeng Lai, Meng Cao, Lifu Huang, Peng Zhang2026-03-31
💻 computer science

MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation

يقدم MotionRFT إطار عمل موحداً للضبط الدقيق بالتعزيز يتميز بنموذج مكافأة غير متجانس التمثيل يُدعى MotionReward وطريقة تحسين دقيقة وفعالة في استهلاك الذاكرة تُسمى EasyTune، وذلك لتعزيز توليد الحركة من النص بشكل كبير عبر تحسين الاتساق الدلالي، والواقعية، والكفاءة الحسابية عبر مختلف تمثيلات الحركة.

Xiaofeng Tan, Wanjiang Weng, Hongsong Wang, Fang Zhao, Xin Geng, Liang Wang2026-03-31
💻 computer science

Kα\alphaLOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks

تقدم الورقة البحثية Kα\alphaLOS، وهو خوارزمية ميتا (meta-algorithm) منهجية تعمل على حل التوافق المكاني قبل تقييم الاتفاق لتوفير إطار عمل معياري وقوي لقياس الاتساق بين الملحّظين والتمييز بين تحسينات النموذج وضجيج الملصقات في المهام البصرية المعقدة.

David Tschirschwitz, Volker Rodehorst2026-03-31
💬 NLP

LightMover: Generative Light Movement with Color and Intensity Controls

يُعد LightMover إطار عمل مبتكر يستفيد من مسبقات الانتشار بالفيديو وآلية تقليم الرموز التكيفية لتمكين التحكم الدقيق والواقعي فيزيائياً في موضع الضوء ولونه وكثافته في الصور الفردية دون الحاجة إلى إعادة رندرة المشهد.

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott (…)2026-03-31
🤖 AI

EuraGovExam: A Multilingual Multimodal Benchmark from Real-World Civil Service Exams

تقدم الورقة البحثية EuraGovExam، وهو معيار مرجعي متعدد اللغات والوسائط يتسم بالتحدي ويضم أكثر من 8,000 سؤال حقيقي من امتحانات الخدمة المدنية من خمس مناطق أوراسية، صُمم لتقييم قدرات الاستدلال العابر للغات والمدرك للتخطيط لدى نماذج الرؤية واللغة في السيناريوهات عالية المخاطر والقائمة على الصور.

JaeSeong Kim, Chaehwan Lim, Sang Hyun Gil, Suan Lee2026-03-31
🤖 AI

Zero-shot Vision-Language Reranking for Cross-View Geolocalization

تقترح هذه الورقة إطار عمل لتحديد الموقع الجغرافي عبر الرؤى (cross-view) يتكون من مرحلتين، يستفيد من نماذج الرؤية واللغة ذات التعلم الصفري (zero-shot Vision-Language Models) في استراتيجية مقارنة زوجية لتحسين دقة "المركز الأول" (Top-1 accuracy) بشكل كبير، مما يثبت أنه بينما تخفق هذه النماذج في التقييم النقطي المطلق، فإنها تتفوق في الحكم البصري النسبي الدقيق.

Yunus Talha Erzurumlu, John E. Anderson, William J. Shuart, Charles Toth, Alper Yilmaz2026-03-31
⚡ electrical engineering

MD-RWKV-UNet: Scale-Aware Anatomical Encoding with Cross-Stage Fusion for Multi-Organ Segmentation

تقترح الورقة البحثية MD-RWKV-UNet، وهي بنية مشفر-فك تشفير خفيفة الوزن تستفيد من كتلة MD-RWKV ديناميكية والدمج عبر المراحل لتحقيق أفضل النتائج في تقسيم الأعضاء المتعددة من خلال النمذجة الفعالة لتباين المقاييس والاعتمادات التشريحية طويلة المدى.

Zhuoyi Fang2026-03-31