💻 computer science

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

تقدم هذه الورقة StepSTEM، وهو معيار مرجعي صارم بمستوى الدراسات العليا يضم 283 مسألة وإطار تقييم جديد على مستوى الخطوات مصمم لتقييم الاستدلال متعدد الوسائط دقيق التفاصيل في النماذج اللغوية الكبيرة متعددة الوسائط، مما يكشف أن النماذج الحالية الرائدة لا تزال تعتمد بشكل كبير على الاختصارات النصية بدلاً من التكامل الحقيقي بين المرئي والنصي.

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, T (…)2026-05-12
💻 computer science

SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation

يُعد SwiftI2V إطار عمل فعالاً لتوليد الفيديو من الصور بدقة عالية (2K)، حيث يتغلب على قيود الذاكرة وزمن الاستجابة من خلال الجمع بين مرجع حركة منخفض الدقة واستراتيجية تركيب مجزأة تعتمد بقوة على الصورة، محققاً جودة مماثلة في نهاية العملية مع تقليل زمن وحدة معالجة الرسومات بمقدار 202 ضعفاً.

YaoYang Liu, Yuechen Zhang, Wenbo Li, Yufei Zhao, Rui Liu, Long Chen2026-05-12
💻 computer science

AdpSplit: Error-Driven Adaptive Splitting for Faster Geometry Discovery in 3D Gaussian Splatting

تقدم الورقة البحثية AdpSplit، وهو عامل تقسيم تكيفي مدفوع بالخطأ لتقنية الـ 3D Gaussian Splatting، والذي يحدد ديناميكيًا عدد الأبناء المقسمين بناءً على إحصائيات خطأ البكسل، مما يقلل وقت التدريب بشكل كبير مع الحفاظ على جودة الرندرة مقارنة بطرق التقسيم القياسية ذات العدد الثابت.

Yongjae Lee, Jingxing Li, Abhay Kumar Yadav, Rama Chellappa, Deliang Fan2026-05-12
💻 computer science

TriDE: Triangle-Consistent Translation Directions for Global Camera Pose Estimation

تقدم الورقة البحثية TriDE، وهي طريقة تعزز تقدير وضع الكاميرا العالمي من خلال تحسين اتجاهات الإزاحة الزوجية عبر تمرير الرسائل الفعال القائم على اتساق المثلث، مما يحقق دقة ومتانة أعلى دون الاعتماد على التحسين غير الخطي العالمي المكلف.

Francisco Chen, Yiran Wang, Yunpeng Shi2026-05-12
💻 computer science

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

تقدم هذه الورقة البحثية تخصيص الخطوات غير المتجانس (HSA)، وهو خوارزمية استنتاج خالية من التدريب تسرع نماذج محولات الانتشار (Diffusion Transformers) لتوليد الفيديو عبر تخصيص خطوات إزالة ضجيج أقل ديناميكيًا للرموز ذات السرعة المنخفضة، مع الحفاظ على السياق العالمي والجودة من خلال آلية مبتكرة لمزامنة ذاكرة التخزين المؤقت لـ KV وتحديثات أويلر المخزنة مؤقتًا.

Ernie Chu, Vishal M. Patel2026-05-12
💻 computer science

Advancing Reliable Synthetic Video Detection: Insights from the SAFE Challenge

تقدم هذه الورقة تحدي SAFE، وهو تقييم شامل لطرق كشف الفيديو الاصطناعي أُجري في مؤتمر ICCV 2025، والذي استخدم مجموعة بيانات واسعة النطاق تضم 6,000 فيديو ليكشف أنه على الرغم من تحسن التعميم عبر المولدات المختلفة، إلا أن نماذج الكشف الحالية تظل عرضة لعمليات المعالجة اللاحقة الشائعة.

Kirill Trapeznikov, Gabriel Mancino-Ball, Jonathan Li, Paul Cummer, Jai Aslam, Danial Samadi Vahdati, Tai Nguyen, Matthe (…)2026-05-12
💻 computer science

Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

تقدم هذه الورقة البحثية FuScore، وهو إطار عمل مبتكر لتقييم جودة دمج الصور بالأشعة تحت الحمراء والمرئية، يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط لتوليد درجات جودة مستمرة ويستخدم هدفاً ثلاثي الأجزاء مع تسميات ناعمة، مما يحقق ارتباطاً متطوراً مع التفضيلات البصرية البشرية من خلال التغلب على قيود طرق التقييم الحالية المنفصلة والعددية.

Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su2026-05-12
💻 computer science

Learning to Track Instance from Single Nature Language Description

تقدم هذه الورقة البحثية \tracker، وهو متتبع رؤية-لغة ذاتي الإشراف ومبتكر يحقق تتبع المثيل من خلال الأوصاف اللغوية الطبيعية دون الحاجة إلى تعليقات توضيحية لصناديق الإحاطة، وذلك عبر توظيف وحدة تجميع الرموز الديناميكية لدمج الرموز البصرية واللغوية بشكل انتقائي لتعزيز المحاذاة الدلالية والانتشار الزمني.

Yaozong Zheng, Bineng Zhong, Qihua Liang, Shuimu Zeng, Haiying Xia, Shuxiang Song2026-05-12
💻 computer science

Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models

تُثبت هذه الورقة أن نماذج الرؤية واللغة تمتلك تمثيلاً طوبولوجياً ثلاثي الأبعاد كامناً محجوباً بالدلالات البصرية، والذي يمكن عزله، وتشكيله رياضياً ليتطابق مع الفضاء الفيزيائي، وتعزيزه عبر تنظيم طاقة ديريكليه لتحسين أداء الاستدلال المكاني بشكل كبير.

Haoming Wang, Wei Gao2026-05-12
💻 computer science

PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition

تقدم الورقة البحثية PRIMED، وهو إطار عمل مبتكر لتجزئة الصوت والمرئيات المرجعية يستفيد من نظرية المنافسة المنحازة لتثبيط الوسائط غير ذات الصلة تكيفياً من خلال وحدة فك تشفير الأولوية للوسائط ومقطر الرموز، محققاً أداءً هو الأفضل في فئته عبر ضبط الانتباه ديناميكياً بناءً على الاحتياجات المحددة لكل تعبير مرجعي.

Yuchen He, Jing Zhang2026-05-12