💻 computer science

Versatile Video Representation via Feed-Forward 2D Gaussian Splatting Tokenization

تقدم الورقة البحثية "Gaussian Video Transformer" (GVT)، وهو إطار عمل متعدد الاستخدامات لتمثيل الفيديو يعتمد على ترميز "Gaussian Splatting" ثنائي الأبعاد بنظام التغذية الأمامية مع قابلية التكيف المكاني-الزماني وفصل صريح بين العناصر الثابتة والديناميكية، وذلك لتحقيق أداء رائد في مجالات إعادة بناء الفيديو، والضغط، والتعرف على الأفعال، والتوليد.

Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu2026-08-07
💻 computer science

Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval

تقترح هذه الورقة شبكة "إزالة الضجيج ثم الاسترجاع" (DRNet)، وهي نموذج جديد يحسن استرجاع لحظات الفيديو من خلال توظيف وحدة إزالة ضجيج مشروطة بالنص لتصفية مقاطع الفيديو غير ذات الصلة، ووحدة تغذية راجعة لإعادة بناء النص للإشراف المساعد، مما يحقق أداءً هو الأفضل في فئته على مجموعات البيانات المرجعية.

Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian2026-08-07
💻 computer science

Ultrasound Tomography of Musculoskeletal Tissues with Generative Neural Physics

تقدم هذه الورقة إطار عمل فيزيائي عصبي توليدي يتغلب على القيود الحسابية والاضطرابات التي تواجه عملية قلب الموجة الكاملة التقليدية، مما يتيح تصويراً طبياً ثلاثي الأبعاد عالي الدقة وسريعاً وخالياً من الإشعاع للأنسجة العضلية الهيكلية بدقة تضاهي دقة التصوير بالرنين المغناطيسي.

Zhijun Zeng, Youjia Zheng, Chang Su, Qianhang Wu, Hao Hu, Zeyuan Dong, Yang Lv, Ligang Cui, Zhiyong Hou, Weijun Lin, Zuo (…)2026-08-07
🤖 machine learning

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

تقترح هذه الورقة تمثيلاً للهدف يعتمد على قناع كائن ديناميكي لتعلم التعزيز البصري المشروط بالهدف، مما يلغي الحاجة إلى معلومات الحالة المتميزة عبر استخدام معالجة الصور القياسية أو الكواشف مسبقة التدريب لتوليد إشارات بصرية غير مرتبطة بالكائنات، وبالتالي تحقيق معدلات نجاح عالية، وتعميم قوي على الكائنات غير المرئية، ونقل ناجح من المحاكاة إلى الواقع على الأذرع الروبوتية.

Fahim Shahriar, Cheryl Wang, Alireza Azimi, Gautham Vasan, Hany Hamed, Abhishek Naik, A. Rupam Mahmood, Colin Bellinger2026-08-07
💻 computer science

A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages

تقترح الورقة البحثية "خبراء متعددي اللغات" (MuEx)، وهو إطار عمل مبتكر يستفيد من بنية "خليط الخبراء الموجهة بالفونيم" وآلية "محاذاة الفونيم والفيزيم" للربط بين الوسائط السمعية والبصرية، مما يتيح توليد وجوه متحدثة عالية الجودة ومتزامنة عبر لغات متعددة مع قدرات قوية على التعميم في حالة الصفر (zero-shot generalization).

Zibo Su, Kun Wei, Jiahua Li, Jing Kong, Xu Yang, Cheng Deng2026-08-07
💻 computer science

SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models

تقدم هذه الورقة SOVABench، وهو معيار استرجاع من العالم الحقيقي مصمم لتقييم قدرة النماذج اللغوية الكبيرة متعددة الوسائط على التمييز بين إجراءات المراقبة المتعلقة بالمركبات وفهم الاتجاه الزمني، مما يثبت أن إطار عمل خالٍ من التدريب يستفيد من الأوصاف التي تولدها النماذج اللغوية الكبيرة متعددة الوسائط يتفوق على النماذج الرؤيوية-اللغوية التباينية الحالية في هذه المهام الصعبة.

Oriol Rabasseda, Zenjie Li, Kamal Nasrollahi, Sergio Escalera2026-08-07
💻 computer science

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

تقترح الورقة البحثية إطار عمل VISA، وهو إطار تدقيق دلالي أثناء مرحلة التدريب يستفيد من نماذج الرؤية واللغة غير المتصلة بالإنترنت لتوليد فرضيات فئات وسمات مهيكلة وموزونة بالموثوقية لنماذج الكائنات ثلاثية الأبعاد، مما يؤدي إلى تحسين أداء الإشغال للمجموعات المغلقة والفئات النادرة في النماذج العالمية دون تغيير عملية الاستدلال.

Ruiqi Xian, Yuehan Xian, Jing Liang, Xuewei Qi, Dinesh Manocha2026-08-07
🤖 machine learning

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

تقدم هذه الورقة أكبر دراسة تحكم في التوسع لنماذج التأسيس المعتمدة على بكسلات صور رصد الأرض، كاشفةً أن فقد التدريب المسبق يعد مؤشراً ضعيفاً للأداء في المهام اللاحقة، ومثبتةً قاعدة لتخصيص الحوسبة تتيح إنشاء نماذج طالب مدمجة وعالية الأداء تتفوق على المنتجات الحالية مع دعم تضمينات "ماتريوشكا" المرنة ومنخفضة التكلفة.

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Cleme (…)2026-08-07
💻 computer science

DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding

تقدم هذه الورقة البحثية DishSeg24k، وهو معيار مرجعي واسع النطاق لتجزئة الأطعمة يضم 24,096 صورة و278 فئة دقيقة، إلى جانب FEAST، وهو نموذج محول (transformer) مبتكر يستفيد من خليط الخبراء الموجه بالتعلم المعزز وفك تشفير الخبراء العشوائي لتحقيق أداء رائد في سيناريوهات تناول الطعام المعقدة وطويلة الذيل.

Yilin Wang, Haochen Shi, Guanyu Chen, Weiqing Min, Jinkai Zheng, Chenggang Yan, Shuqiang Jiang2026-08-07
💻 computer science

MapTCL: Temporal Consistency Learning via Bidirectional Alignment for Vectorized HD Map Construction

تُعد MapTCL استراتيجية تدريب متعددة الاستخدامات وسهلة الدمج (plug-and-play) تعزز الاستقرار الزمني لبناء خرائط عالية الدقة (HD maps) متجهة عبر الإنترنت من خلال إدخال خسارة مساعدة قائمة على المحاذاة ثنائية الاتجاه لمعاقبة الضجيج الهندسي والارتجاج بين الإطارات المتتالية بشكل صريح، مما يحقق مكاسب كبيرة في الأداء على المعايير القياسية دون أي عبء إضافي أثناء الاستدلال.

Hyeonseo Kim, Juyeb Shin, Hyeonjun Jeong, Hiwon Shin, Dongsuk Kum2026-08-07