💻 computer science

FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding

يُعد FLoC إطار عمل لا يتطلب تدريباً ومستقلاً عن النماذج، حيث يستفيد من دالة تحديد الموقع (facility location function) وخوارزمية جشعة كسولة (lazy greedy algorithm) لاختيار مجموعة فرعية مدمجة ومتنوعة من الرموز المرئية (visual tokens) لفهم الفيديو الطويل بكفاءة، مما يقلل التكاليف الحسابية بشكل كبير مع الحفاظ على أداء يقارب المثالية عبر مختلف المعايكات.

Janghoon Cho, Jungsoo Lee, Munawar Hayat, Kyuwoong Hwang, Fatih Porikli, Sungha Choi2026-03-06
💻 computer science

DAP: A Discrete-token Autoregressive Planner for Autonomous Driving

يُعد DAP مخططاً تكرارياً مدمجاً يعتمد على الرموز المنفصلة، يقوم بالتنبؤ المشترك بالدلالات في منظور الرؤية من الأعلى (BEV) ومسارات المركبة ذاتية القيادة مع الضبط الدقيق باستخدام التعلم التعزيزي، محققاً أداءً هو الأفضل في فئته على معايير قياس القيادة الذاتية رغم ميزانية محدودة تبلغ 160 مليون معلمة.

Bowen Ye, Bin Zhang, Hang Zhao2026-03-06
💻 computer science

Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach

تقدم هذه الورقة FlashCache، وهو إطار عمل لضغط ذاكرة التخزين المؤقت لـ KV موجه بنطاق التردد يعمل على تحديد وحفظ "قيم KV الشاذة" الحرجة مع الاستفاء من الترشيح منخفض التردد وتخصيص الميزانية الديناميكي لتحقيق تسريع كبير في الاستدلال وتقليل الذاكرة في النماذج اللغوية الكبيرة متعددة الوسائط دون المساس بالأداء.

Yaoxin Yang, Peng Ye, Xudong Tan, Chongjun Tu, Maosen Zhao, Jia Hao, Tao Chen2026-03-06
💻 computer science

Observer-Actor: Active Vision Imitation Learning with Sparse-View Gaussian Splatting

تقدم الورقة البحثية "المراقب-المؤدي" (ObAct)، وهو إطار عمل جديد للرؤية النشطة في تعلم التقليد للروبوتات ثنائية الأذرع، والذي يقوم ديناميكياً بتعيين ذراع واحدة لبناء تمثيل "Gaussian Splatting" ثلاثي الأبعاد وتحديد زوايا الرؤية المثلى للذراع الأخرى، مما يعزز بشكل كبير من قوة الأداء وكفاءة السياسة من خلال تقليل حالات الحجب مقارنة بإعدادات الكاميرا الثابتة.

Yilong Wang, Cheng Qian, Ruomeng Fan, Edward Johns2026-03-06
💻 computer science

RadarVLM: A Vision-Language Model Approach for Radar Scene Understanding

يقدم RadarVLM إطار عمل موحداً للرؤية واللغة لفهم مشاهد الرادار، والذي يستفيد من مجموعة بيانات واسعة النطاق من أزواج الرادار والتعليقات النصية ومن هدف CLIP المرتكز مكانياً والمبتكر لتحقيق تحسينات كبيرة في الاستدلال المكاني وأداء التجزئة عبر سيناريوهات القيادة المتنوعة.

Pushkal Mishra, Kshitiz Bansal, Dinesh Bharadia2026-03-06
💻 computer science

PowerCLIP: Powerset Alignment for Contrastive Pre-Training

يُعد PowerCLIP إطار عمل جديدًا للتدريب المسبق التبايني يعزز الفهم التركيبي من خلال المحاذاة الشاملة لمجموعات القوى الخاصة بمناطق الصور مع الأشجار الإعرابية النصية، مستخدمًا مجمعات غير خطية فعالة للتغلب على التكلفة الحسابية الأسية لبناء مجموعات القوى الساذجة مع تحقيق أداء رائد في مهام الرؤية واللغة الصفرية.

Masaki Kawamura, Nakamasa Inoue, Rintaro Yanagi, Hirokatsu Kataoka, Rio Yokota2026-03-06
💻 computer science

EgoCampus: Egocentric Pedestrian Eye Gaze Model and Dataset

تقدم هذه الورقة مجموعة بيانات EgoCampus ونموذج EgoCampusNet لمعالجة تحدي التنبؤ بنظرة عين المشاة من منظور الشخص الأول في الملاحة الخارجية في العالم الحقيقي، وذلك عبر الاستفادة من مجموعة واسعة ومتنوعة من مقاطع الفيديو المسجلة والموسومة ببيانات نظرة العين والتي تم التقاطها عبر نظارات Project Aria من Meta.

Ronan John, Aditya Kesari, Vincenzo DiMatteo, Kristin Dana2026-03-06
💻 computer science

FluenceFormer: Transformer-Driven Multi-Beam Fluence Map Regression for Radiotherapy Planning

تقدم هذه الورقة FluenceFormer، وهو إطار عمل مكون من مرحلتين يعتمد على الـ Transformer، يستفيد من فقدان الانحدار المدرك للتدفق (Fluence-Aware Regression loss) والمستند إلى الفيزياء، لتحقيق تنبؤ متفوق لخرائط التدفق (fluence maps) مدرك للهندسة في التخطيط للعلاج الإشعاعي، متفوقاً بشكل ملحوظ على طرق الشبكات العصبية الالتفافية (CNN) والطرق أحادية المرحلة في الحفاظ على الطاقة والدقة الهيكلية.

Ujunwa Mgboh, Rafi Ibn Sultan, Joshua Kim, Kundan Thind, Dongxiao Zhu2026-03-06
💻 computer science

Parallel Diffusion Solver via Residual Dirichlet Policy Optimization

تقدم هذه الورقة البحثية EPD-Solver، وهو حلّال معادلات تفاضلية عادية (ODE) متوازٍ ومبتكر يعمل على تسريع عملية أخذ عينات نماذج الانتشار من خلال الاستفادة من تقييمات التدرج المتوازية المستقلة وإطار عمل للتعلم التعزيزي كفء في المعلمات لتقليل أخطاء البتر بشكل كبير مع الحفاظ على جودة الصور في توليد الصور من النصوص.

Ruoyu Wang, Ziyu Li, Beier Zhu, Liangyu Yuan, Hanwang Zhang, Xun Yang, Xiaojun Chang, Chi Zhang2026-03-06
💻 computer science

Agentic Very Long Video Understanding

تقدم هذه الورقة البحثية EGAgent، وهو إطار عمل وكيل يعتمد على الرسوم البيانية لمشاهد الكيانات وأدوات بحث هجينة لتمكين الاستدلال التركيبي واسترجاع المعلومات بمستوى رائد فوق تدفقات الفيديو من منظور الشخص الأول المستمرة والمتعددة الأيام، معالجةً بذلك أوجه القصور في النماذج الحالية في فهم الفيديو طويل المدى.

Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak, Yuning Chai, Yong Jae Lee, Hyo Jin Kim2026-03-06