💻 computer science

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

يُعد FlowLong طريقةً للاستدلال في وقت التشغيل، وهي خالية من التدريب ومستقلة عن البنية الهيكلية، تقوم بتوليد فيديوهات طويلة عبر دمج نوافذ منزلقة متداخلة بواسطة مطابقة "تودي" المقيدة بالمتشعب وأخذ عينات مرحلية مبكرة عشوائية لضمان الاتساق الزمني والدقة البصرية دون تدريب إضافي للنموذج.

Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye2026-05-21
💻 computer science

Preserve, Reveal, Expand: Faithful 4D Video Editing with Region-Aware Conditioning

تقدم الورقة البحثية PREX، وهو إطار عمل مدرك للمناطق يعالج عدم التطابق بين الأدلة والأدوار في تحرير الفيديو رباعي الأبعاد من خلال تفكيك الأحجام الزمكانية إلى أدوار الحفاظ (Preserve)، والكشف (Reveal)، والتوسيع (Expand) لتخليق المحتوى المحجوب بوفاء مع الحفاظ على اتساق المصدر، جنباً إلى جنب مع معيار PREBench للتقييم.

Zhangchi Hu, Wenzhang Sun, Xiangchen Yin, Jiahui Yuan, Chunfeng Wang, Hao Li, Kun Zhan, Xiaoyan Sun2026-05-21
💻 computer science

Towards UAV Detection in the Real World: A New Multispectral Dataset UAVNet-MS and a New Method

تقدم هذه الورقة البحثية UAVNet-MS، وهي أول مجموعة بيانات متعددة الأطياف للكشف الدقيق عن الطائرات بدون طيار الصغيرة، وتقترح طريقة MFDNet التي تستفيد من الإشارات الطيفية المتكاملة لتتفوق بشكل كبير على الأنظمة الحالية التي تعتمد على الأشعة المرئية (RGB) فقط في السيناريوهات الواقعية الصعبة.

Yihang Luo, Jun Chen, Chao Xiao, Yingqian Wang, Zhaoxu Li, Qiang Ling, Xu He, Nuo Chen, Gaowei Guo, Hongge Li, Miao Li (…)2026-05-21
💻 computer science

Towards Integrated Rock Support Visualisation in 3D Point Cloud of Underground Mines

تقدم هذه الدراسة إطار عمل مؤتمت يدمج بين تحديد براغي الصخور، ورسم خرائط الانقطاعات، وتحليل التوجه ضمن السحب النقطية ثلاثية الأبعاد لتمكين التقييم البصري الشامل لفعالية دعم الصخور في المناجم تحت الأرض دون الحاجة إلى قياسات يدوية.

Dibyayan Patra, Simit Raval, Pasindu Ranasinghe, Bikram Banerjee, Ismet Canbulat2026-05-21
💻 computer science

CHOIR: Contact-aware 4D Hand-Object Interaction Reconstruction

تقدم الورقة البحثية CHOIR، وهو إطار عمل يعيد بناء التفاعلات بين اليد والجسم في أربعة أبعاد من مقاطع فيديو أحادية العدسة عبر الاستفادة من التلامس كإشارة اقتران صريحة لتصحيح عدم المحاذاة وفرض الاتساق الهندسي والزمني، مما يتيكن من التعدين القابل للتوسع للنماذج الأولية القابلة لإعادة الاستخدام من المشاهد ذات العالم المفتوح.

Hao Xu, Yilin Liu, Yinqiao Wang, Chi-Wing Fu, Niloy J. Mitra2026-05-21
💻 computer science

LiteViLNet: Lightweight Vision-LiDAR Fusion Network for Efficient Road Segmentation

تقدم الورقة البحثية LiteViLNet، وهي شبكة خفيفة الوزن متعددة الأنماط تدمج بيانات RGB وLiDAR بكفاءة باستخدام مشفر ثنائي المسار، ووحدة دمج الميزات متعددة المقاييس، وجسر ذي نواة كبيرة لتحقيق دقة حالة الفن في تقسيم الطرق مع الحد الأدنى من المعلمات وسرعات استدلال في الوقت الفعلي مناسبة للأجهزة الطرفية محدودة الموارد.

Daojie Peng, Bingtao Wang, Fulong Ma, Liang Zhang, Jun Ma2026-05-21
💻 computer science

DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation

يُعد DySink إطار عمل قائم على الاسترجاع لتوليد الفيديوهات الطويلة ذات التوليد ذاتي الانحدار، حيث يستبدل ركائز الإطارات المبكرة الثابتة بإطارات تاريخية مختارة ديناميكيًا وذات صلة بصريًا، ويستخدم بوابة شذوذ "البالوعة" (sink anomaly gate) لمنع انهيار الانتباه، مما يؤدي إلى تحسين كل من الاستمرارية الديناميكية والجودة الزمنية.

Bo Ye, Xinyu Cui, Jian Zhao, Tong Wei, Min-Ling Zhang2026-05-21
🤖 machine learning

Multimodal LLMs under Pairwise Modalities

تقترح هذه الورقة إطار عمل ثنائي المراحل يُمكّن من تدريب النماذج اللغوية الكبيرة متعددة الوسائط باستخدام بيانات ثنائية الوسائط فقط، وذلك عبر التحليل النظري لقابلية تحديد التمثيل وتعلم فضاء كامن مشترك من خلال إعادة البناء والتعلم التبايني، مما يحقق انتقالاً وتوليداً قوياً عبر الوسائط دون الحاجة إلى مجموعات بيانات متعددة الوسائط متوافقة تماماً.

Yan Li, Yunlong Deng, Yuewen Sun, Gongxu Luo, Kun Zhang, Guangyi Chen2026-05-21
💻 computer science

Q-ARVD: Quantizing Autoregressive Video Diffusion Models

تقدم هذه الورقة Q-ARVD، وهو إطار عمل تكميم مبتكر مصمم للتغلب على التحديات الفريدة لنماذج انتشار الفيديو ذات الترتيب الذاتي - وتحديداً عدم توازن الحساسية لكل إطار ووجود القيم المتطرفة غير المتجانسة للأوزان - من خلال آلية لترجيح الإطارات تراعي الجودة النهائية واستراتيجية تكميم تكيفية ثنائية المقياس مدركة للقيم المتطرفة، مما يتيح توليد فيديو فعال ودقيق في الوقت الفعلي.

Siao Tang, Xinyin Ma, Gongfan Fang, Xingyi Yang, Xinchao Wang2026-05-21
🤖 machine learning

SpectralEarth-FM: Bringing Hyperspectral Imagery into Multimodal Earth Observation Pretraining

تقدم هذه الورقة البحثية نموذج SpectralEarth-FM، وهو نموذج محول هرمي (hierarchical transformer) ومعه مجموعة بيانات SpectralEarth-MM التي تبلغ سعتها 40 تيرابايت، واللذان يُمكّنان من التدريب المسبق المشترك والأحدث للصور فائقة الطيف مع البيانات متعددة الأطياف، ورادار الفتحة الاصطناعية (SAR)، والبيانات الحرارية لمراقبة الأرض للتغلب على قيود النماذج التأسيسية أحادية المستشعر أو أحادية النمط.

Nassim Ait Ali Braham, Aaron Banze, Conrad M. Albrecht, Julien Mairal, Jocelyn Chanussot, Xiao Xiang Zhu2026-05-21