💻 computer science

VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

يعالج VideoSEAL مشكلة "عدم توافق الأدلة" في فهم الفيديو الطويل الوكيل عبر تقديم إطار عمل منفصل من المخطط والمفتش يفصل بين التخطيط طويل الأمد وسلطة الإجابة، مما يتطلب تحققًا على مستوى البكسل لضمان دعم الإجابات بالأدلة المسترجعة وتحقيق أداء رائد في عدة معايير مرجعية.

Chenhao Qiu (Mango TV), Yechao Zhang (Nanyang Technological University), Xin Luo (Mango TV), Shien Song (Mango TV), Xush (…)2026-05-14
💻 computer science

Improving Diffusion Posterior Samplers with Lagged Temporal Corrections for Image Restoration

تقدم هذه الورقة البحثية LAMP، وهو ملحق معياري للنماذج القائمة على الانتشار لترميم الصور، يستفيد من التجزئة من الدرجة الثانية والتصحيحات الزمنية المتأخرة لتحسين دقة واستقرار أخذ عينات اللاحقة دون زيادة التكلفة الحسابية.

Davide Evangelista, Elena Morotti, Francesco Pivi, Maurizio Gabbrielli2026-05-14
💻 computer science

3D Primitives are a Spatial Language for VLMs

تقدم هذه الورقة البحثية نماذج هندسية ثلاثية الأبعاد معبر عنها برمجياً كلغة مكانية قوية لنماذج الرؤية واللغة، مبرهنةً من خلال معيار SpatialBabel، واستراتيجية استدلال Code-CoT الخالية من التدريب، وطريقة الضبط الدقيق ذاتية الإشراف S3^{3}-FT، أن هذا التمثيل الوسيط يعزز بشكل كبير الاستدلال المكاني ويتعمم عبر بنيات نماذج الرؤية واللغة المتنوعة دون الحاجة إلى تسميات بشرية.

Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini (…)2026-05-14
💻 computer science

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

يقدم TrackCraft3R أول متتبع ثلاثي الأبعاد كثيف يعمل بنظام التغذية الأمامية يعيد توظيف نماذج محولات الانتشار بالفيديو مسبقة التدريب من خلال توظيف تمثيل ثنائي الكامن ومحاذاة دوران الموضع الزمني (RoPE) للتغلب على قيودها المرتبطة بالإطارات، محققاً أداءً هو الأفضل في فئته مع كفاءة فائقة في السرعة والذاكرة في اختبارات تتبع الفيديو أحادي العدسة.

Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim2026-05-14
💻 computer science

Action Emergence from Streaming Intent

تقدم هذه الورقة البحثية "النية المتدفقة" (Streaming Intent)، وهو إطار عمل جديد للقيادة الذاتية من طرف إلى طرف يتيح ظهور الأفعال عبر اشتقاق النية المتدفقة دلاليًا عبر آلية سلسلة من الأفكار لتوجيه مولد أفعال قائم على مطابقة التدفق، محققًا أداءً تنافسيًا وقدرة تحكم غير مسبوقة في الوفاء بالنية على معيار وايمو (Waymo).

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Xie Yan, Benjin Zhu2026-05-14
💻 computer science

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

يقدم MindVLA-U1 أول بنية موحدة للبث الرؤيوي-اللغوي-الحركي للقيادة الذاتية تدمج الاستدلال اللغوي التوليدي ذاتي الانحدار مع توليد الحركة المستمرة عبر مطابقة التدفق من خلال عمود فقري وقناة ذاكرة مشتركة، مما يتيح التحكم في المسار بتوجيه لغوي يتفوق على الأداء البشري في معيار WOD-E2E مع الحفاظ على معدل إنتاجية في الوقت الفعلي.

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li2026-05-14
💻 computer science

Driving Intents Amplify Planning-Oriented Reinforcement Learning

تقدم الورقة البحثية إطار عمل DIAL، وهو إطار عمل ثنائي المراحل يجمع بين مطابقة التدفق المشروطة بالنية وبين التعلم المعزز القائم على تفضيلات النوايا المتعددة للتغلب على انهيار النمط في سياسات القيادة ذات الإجراءات المستمرة، مما يمكنها من تجاوز كل من النماذج السابقة ذات الأداء العالي والقيادة البشرية في الأداء.

Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu2026-05-14
💻 computer science

MambaPanoptic: A Vision Mamba-based Structured State Space Framework for Panoptic Segmentation

يُعد MambaPanoptic إطار عمل جديد للتقسيم البانوبتيكي يستفيد من بنية Vision Mamba لتحقيق تمثيل للميزات متعدد المقاييس ومتماسك عالميًا بتعقيد حسابي خطي، وبذلك يتفوق على الأساليب الحالية القائمة على التلافيف والمحولات في الدقة والكفاءة.

Qing Cheng, Damiano Bertolini, Wei Zhang, Dong Wang, Niclas Zeller, Daniel Cremers2026-05-14
💻 computer science

DIVER:Diving Deeper into Distilled Data via Expressive Semantic Recovery

تقترح الورقة البحثية DIVER، وهو إطار عمل جديد لتقطير البيانات ثنائي المراحل يستفيد من نماذج الانتشار سابقة التدريب لاستعادة الدلالات التعبيرية من خلال الوراثة والتوجيه والدمج، مما يتغلب على قيود الإفراط في التخصيص والتعميم عبر البنى المختلفة التي تعاني منها الطرق التقلية أحادية المرحلة مع الحفاظ على كفاءة عالية.

Qianxin Xia, Zhiyong Shu, Wenbo Jiang, Jiawei Du, Jielei Wang, Guoming Lu2026-05-14
💻 computer science

CRAFT: Clinical Reward-Aligned Finetuning for Medical Image Synthesis

تقدم الورقة البحثية إطار عمل CRAFT، وهو إطار للضبط الدقيق المتوافق مع المكافأة السريرية يستفيد من درجة توافق سريري (CAS) مبتكرة ومعرفة متعددة الوسائط لتقليل الهلوسات غير المنطقية سريرياً بشكل كبير وتحسين جودة تخليق الصور الطبية عبر مختلف الوسائط.

Yunsung Chung, Alex El Darzi, Carlo El Khoury, Han Feng, Nassir Marrouche, Jihun Hamm2026-05-14