💻 computer science

From Ideal to Real: Stable Video Object Removal under Imperfect Conditions

تقدم الورقة البحثية إطار عمل "إزالة الكائنات من الفيديو المستقر" (SVOR)، وهو إطار عمل قوي يحقق إزالة لكائنات الفيديو خالية من الوميض وبأداء هو الأفضل في فئته تحت ظروف العيوب الواقعية، وذلك عبر توظيف استراتيجية "اتحاد القناع" (Mask Union) لضمان المسح المستقر، ورأس "تجزئة مدرك لإزالة الضجيج" (Denoising-Aware Segmentation) لتحديد المواقع بدقة، ونهج "تدريب منهجي ذي مرحلتين" (Curriculum Two-Stage training) للتعامل مع الظلال، والحركة المفاجئة، والأقنعة المعيبة.

Jiagao Hu, Yuxuan Chen, Fuhao Li, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan2026-03-11
💻 computer science

Learning Convex Decomposition via Feature Fields

تقدم هذه الورقة نهجاً جديداً لتعلم حقل الميزات ذاتي الإشراف، مما يتيح أول نموذج تغذية أمامية لتفكيك التحدب ثلاثي الأبعاد في العالم المفتوح، منتجاً نتائج عالية الجودة وقابلة للتعميم عبر تمثيلات متنوعة مثل المشبكات (meshes)، ونماذج التصميم بمساعدة الحاسوب (CAD models)، والـ Gaussian splats، وذلك لتسريع تطبيقات مثل كشف التصادم.

Yuezhi Yang, Qixing Huang, Mikaela Angelina Uy, Nicholas Sharp2026-03-11
💻 computer science

Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking

تقدم الورقة البحثية MDTrack، وهو إطار عمل جديد لتتبع الكائنات متعدد الوسائط يحقق أداءً هو الأفضل في فئته من خلال توظيف "خليط من الخبراء" للدمج التكيفي المدرك للوسائط، واستخدام نماذج فضاء الحالة المفككة مع آليات الانتباه المتقاطع من أجل انتشار زمني مستقل ومتآزر في آن واحد.

Shilei Wang, Pujian Lai, Dong Gao, Jifeng Ning, Gong Cheng2026-03-11
🤖 AI

DenoiseSplat: Feed-Forward Gaussian Splatting for Noisy 3D Scene Reconstruction

تقترح الورقة البحثية DenoiseSplat، وهي طريقة تغليف غاوسي ثلاثي الأبعاد (3D Gaussian splatting) ذات تغذية أمامية، تحقق تركيباً متيناً للمناظر الجديدة من صور متعددة الزوايا مشوبة بالضجيج عبر التدريب من الطرف إلى الطرف على معيار مرجعي جديد تم إنشاؤه للصور المشوبة بالضجيج والنظيفة دون الحاجة إلى بيانات حقيقية ثلاثية الأبعاد.

Fuzhen Jiang, Zhuoran Li, Yinlin Zhang2026-03-11
🤖 AI

CLoE: Expert Consistency Learning for Missing Modality Segmentation

تقترح الورقة البحثية إطار عمل CLoE، وهو إطار عمل قائم على الاتساق يعزز تقسيم الصور الطبية ذات الأنماط المفقودة من خلال فرض اتفاق على مستوى القرار بين خبراء الأنماط في كل من المناطق العالمية والمناطق الأمامية ذات الأهمية السريرية، مما يحسن المتانة والتعميم مقارنة بالطرق المتطورة.

Xinyu Tong, Meihua Zhou, Bowu Fan, Haitao Li2026-03-11
💻 computer science

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

تقدم هذه الورقة البحثية OddGridBench، وهو معيار يكشف أن النماذج اللغوية الكبيرة متعددة الوسائط الحالية تقصر بشكل كبير عن البشر في اكتشاف التباينات البصرية دقيقة التفاصيل، وتقترح OddGrid-GRPO، وهو إطار عمل للتعلم المعزز يعمل بفعالية على تعزيز هذه الحساسية من خلال التعلم المنهجي والمكافآت المدركة للمسافة.

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming2026-03-11
🤖 AI

Beyond Scaling: Assessing Strategic Reasoning and Rapid Decision-Making Capability of LLMs in Zero-sum Environments

تقدم هذه الورقة معيار الاستدلال التكتيكي الاستراتيجي (STAR)، وهو إطار عمل متعدد الوكلاء لتقييم النماذج اللغوية الكبيرة في بيئات الصفرية، والذي يكشف عن مقايضة حرجة حيث تتفوق النماذج كثيفة الاستدلال في الإعدادات القائمة على الأدوار ولكنها غالباً ما تضعف الأداء في السيناريوهات التي تعمل بالوقت الفعلي بسبب زمن الاستجابة، مما يسلط الضوء على الحاجة إلى موازنة العمق الاستراتيجي مع التنفيذ السريع.

Yang Li, Xing Chen, Yutao Liu, Gege Qi, Yanxian BI, Zizhe Wang, Yunjian Zhang, Yao Zhu2026-03-11
🤖 AI

M3GCLR: Multi-View Mini-Max Infinite Skeleton-Data Game Contrastive Learning For Skeleton-Based Action Recognition

تقترح هذه الورقة البحثية إطار عمل M3GCLR، وهو إطار تعلم تبايني قائم على نظرية الألعاب يعالج أوجه القصور في أساليب التعرف على الأفعال القائمة على الهيكل العظمي الحالية من خلال إنشاء نموذج لعبة بيانات هيكلية لانهائية باستخدام استراتيجية تحسين "ميني-ماكس" (min-max) ومُحسِّن توازن ثنائي الخسارة للتعامل بفعالية مع تباينات الرؤية، والآليات التنافسية، واضطرابات التعزيز، محققاً بذلك أداءً هو الأفضل في فئته على العديد من المعايير المرجعية.

Yanshan Li, Ke Ma, Miaomiao Wei, Linhui Dai2026-03-11
💻 computer science

EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation

يُعد EventVGGT إطار عمل مبتكر يعالج ندرة تعليقات العمق وعدم الاتساق الزمني في تقدير العمق أحادي العدسة القائم على الأحداث، وذلك من خلال معاملة تدفقات الأحداث كمتواليات فيديو متماسكة واستخلاص الأوليات الهندسية المكانية-الزمانية ومتعددة الرؤى من محول الهندسة البصرية المرتكز (VGGT) عبر استراتيجية تقطير ثلاثية المستويات، محققاً بذلك أداءً هو الأفضل في فئته وقدرة قوية على التعميم في حالة الصفر (zero-shot generalization).

Yinrui Ren, Jinjing Zhu, Kanghao Chen, Zhuoxiao Li, Jing Ou, Zidong Cao, Tongyan Hua, Peilun Shi, Yingchun Fu, Wufan Zha (…)2026-03-11
💻 computer science

RiO-DETR: DETR for Real-time Oriented Object Detection

يُعد RiO-DETR أول محول (transformer) للكشف عن الأجسام الموجهة في الوقت الفعلي يعالج تحديات تقدير الزاوية، والدورية، والتقارب من خلال تصميمات مبتكرة مثل تقدير الزاوية المدفوع بالمحتوى والتحسين الدوري المنفصل، محققاً توازناً جديداً بين السرعة والدقة في مجموعات بيانات الاختبار.

Zhangchi Hu, Yifan Zhao, Yansong Peng, Wenzhang Sun, Xiangchen Yin, Jie Chen, Peixi Wu, Hebei Li, Xinghao Wang, Dongshen (…)2026-03-11