💻 computer science

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

تقترح الورقة البحثية CoRDS، وهي طريقة تعتمد على المجموعات الجوهرية (coreset) لفهم الفيديو المتدفق، والتي تُحسن من عملية التقليم الاستدلالي القائم على الرموز (token-wise heuristic pruning) عبر اختيار مجموعة فرعية مدمجة ومتنوعة وممثلة من ذاكرة التخزين المؤقت للمفاتيح والقيم (key-value cache) من خلال هدف ثنائي المعايير ومعيار تنوع مدفوع بالتعامد، مما يعزز الأداء عبر نماذج رؤية-لغة متعددة ومعايير قياسية تحت ميزانيات ذاكرة ثابتة.

Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal2026-05-15
💻 computer science

TurboVGGT: Fast Visual Geometry Reconstruction with Adaptive Alternating Attention

يُعد TurboVGGT إطار عمل جديداً متكاملاً (end-to-end) يحقق إعادة بناء ثلاثية الأبعاد عالية الجودة وسريعة لعدة زوايا من خلال توظيف محول هندسة بصرية فعال مع انتباه تبادلي تكيُّفي، والذي يتعلم ديناميكياً رموزاً تمثيلية بمستويات تفاوت في الندرة لموازنة النمذجة الهندسية العالمية وتجميع التفاصيل المحلية بفعالية.

David Huang, Guile Wu, Chengjie Huang, Bingbing Liu, Dongfeng Bai2026-05-15
💻 computer science

D2-CDIG: Controlled Diffusion Remote Sensing Image Generation with Dual Priors of DEM and Cloud-Fog

تقترح الورقة البحثية إطار عمل D2-CDIG، وهو إطار عمل جديد لتوليد صور الاستشعار عن بعد يستفيد من نموذج الانتشار مع معطيات ثنائية من نماذج الارتفاعات الرقمية (DEM) ومعلومات السحب والضباب لتحقيق تحكم دقيق وعالي الجودة وواقعي في كل من التضاريس والظواهر الجوية.

Zuopeng Zhao, Ying Liu, Kanyaphakphachsorn Pharksuwan, Su Luo, Xiaoyu Li, Maocai Ning2026-05-15
💻 computer science

InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation

يُعد InsightTok إطار عمل للترميز البصري المنفصل يعمل على تحسين وضوح النصوص ودقة ملامح الوجه بشكل كبير في التوليد الصوري ذاتي الانحدار، وذلك عبر إدخال خسائر إدراكية موضعية ومعتمدة على المحتوى للتغلب على قيود أهداف الضغط الموحدة القياسية.

Yang Yue, Fangyun Wei, Tianyu He, Jinjing Zhao, Zanlin Ni, Zeyu Liu, Jiayi Guo, Lei Shi, Yue Dong, Li Chen, Ji Li, Gao H (…)2026-05-15
💻 computer science

AnyBand-Diff: A Unified Remote Sensing Image Generation and Band Repair Framework with Spectral Priors

تقدم هذه الورقة AnyBand-Diff، وهو إطار عمل انتشار جديد موجه بأولويات طيفية يجمع بين عمود فقري شرطي مقنع، وأخذ عينات موجه بالفيزياء، وفقدان فيزيائي متعدد المقاييس لتوليد صور استشعار عن بعد متسقة إشعاعياً وتحقيق إعادة بناء طيفية قوية من مجموعات فرعية عشوائية من النطاقات مع الالتزام بالقوانين الفيزيائية الجوهرية.

Zuopeng Zhao, Ying Liu, Xiaoyu Li, Su Luo, Lu Li, Wenwen Liu2026-05-15
💻 computer science

Analogical Trajectory Transfer

تقدم هذه الورقة طريقة خالية من التدريب لنقل المسارات التناظري، تقوم بتفكيك المشاهد ثلاثية الأبعاد إلى مجموعات متمحورة حول الأشياء وتستخدم تنبؤ خريطة سلسة هرمي مع سمات النماذج التأسيسية ثلاثية الأبعاد لتوليد عمليات نقل حركة متسقة دلالياً وخالية من الاصطدام بين بيئات متنوعة.

Junho Kim, Eun Sun Lee, Gwangtak Bae, Seunggu Kang, Young Min Kim2026-05-15
💻 computer science

SceneForge: Structured World Supervision from 3D Interventions

يُعد SceneForge إطار عمل قائمًا على التدخل، يقوم بتوليد إشراف متعدد الوسائط مهيكل ومتسق من خلال نمذجة المشاهد كعوالم ثلاثية الأبعاد قابلة للتعديل ذات تبعات دلالية وهندسية وفيزيائية، مما يتيح إنشاء بيانات مضادة للواقع ومتعددة الزوايا متوافقة تعمل على تحسين الأداء في مهام إزالة الأشياء والمشاهد.

Jizhizi Li, Jiayang Ao, Danny Wicks, Petru-Daniel Tudosiu2026-05-15
💬 NLP

Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture

تقترح الورقة البحثية إطار "التفكير عند الحاجة" (TWN)، وهو إطار توحيدي للتمثيل المتعدد الوسائط يستخدم بنية "LoRA" مزدوجة وآلية توجيه تكيفية لتقرير متى يتم توليد تسلسل الأفكار (chain-of-thought) بشكل ديناميكي، مما يحقق أداء استرجاع رائد مع تقليل كبير في عبء المعلمات وتكاليف الاستدلال مقارنة بالطرق الحالية.

Longxiang Zhang, Weilong Dai, Guanghao Zhang, Hao Jiang, Pipei Huang2026-05-15
💻 computer science

ClickRemoval: An Interactive Open-Source Tool for Object Removal in Diffusion Models

ClickRemoval هو أداة تفاعلية مفتوحة المصدر تتيح إزالة الكائنات بدقة واستعادة الخلفية بشكل طبيعي في المشاهد المعقدة باستخدام نقرات المستخدم ونماذج Stable Diffusion المدربة مسبقاً فقط، مما يلغي الحاجة إلى الأقنعة اليدوية، أو المطالبات النصية، أو التدريب الإضافي.

Ledun Zhang, Yatu Ji, Xufei Zhuang, Xinying Yao2026-05-15
💻 computer science

Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos

تقدم هذه الورقة HA-HOI، وهو إطار عمل يعيد بناء التفاعلات بين الإنسان والأشياء رباعية الأبعاد ذات المعقولية الفيزيائية من فيديوهات أحادية العدسة عبر اعتماد صياغة "الإنسان أولاً، والشيء يتبع" لضمان اتساق التلامس وتمكين المحاكاة المستندة إلى الفيزياء بشكل مستقر.

Yubo Zhao, Yujin Chai, Yunao Dong, Chengfeng Zhao, Zijiao Zeng, Yuan Liu, Chi-Keung Tang2026-05-15