💻 computer science

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

تقدم هذه الورقة نموذج عالم فيديو متمحور حول الإنسان يتيح بيئات افتراضية ذات منظور شخصي تفاعلية من خلال ربط توليد الفيديو بوضعيات الرأس واليد المتتبعة، مما يحسن بشكل كبير أداء المهام والتحكم المدرك مقارنة بالنماذج المرجعية الحالية.

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein2026-08-25
💻 computer science

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

يقدم ShotVerse إطار عمل "التخطيط ثم التحكم" (Plan-then-Control) الذي يستفيد من مخطط يعتمد على نماذج اللغة والرؤية (VLM) ومتحكم متخصص، مدعومًا بمجموعة بيانات جديدة تم تنسيقها بدقة عالية، لتمكين التوليد الآلي والدقيق والمتسق لمقاطع الفيديو السينمائية متعددة اللقطات من النصوص الوصفية.

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Ra (…)2026-08-25
💻 computer science

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

تقدم هذه الورقة نموذج رفع حركي-بصري مع إطار تحكم موجه هرمياً ومعياراً مرجعياً جديداً مشروحاً لتحقيق توليد فيديو جراحي عالي الدقة، وفعال، ومتسق فيزيائياً، ومشروط بالأفعال.

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenju (…)2026-08-25
💻 computer science

GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training

يُعد GeoMix إطار عمل للتحديد البصري للمواقع يعتمد على عدم استخدام الواصفات، وهو يعمل على تحسين الدقة بشكل كبير من خلال تعزيز التمييز الهندسي عبر التضمينات المكانية المحلية، وتجميع السياق العالمي عبر آلية الانتباه المتقاطع، والتدريب متعدد الكواشف، مما يؤدي إلى تقليص فجوة الأداء مع خطوط المعالجة القائمة على الواصفات.

Yejun Zhang, Xinjue Wang, Zihan Wang, Esa Rahtu, Juho Kannala2026-08-25
💻 computer science

Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing

تقترح هذه الورقة إطار عمل للتلقين البصري الجنائي التركيبي القائم على العناصر الأولية، والذي يستفيد من نموذج محول رؤية (ViT) مجمد لتعلم وتجميع عناصر أولية جنائية دقيقة قابلة لإعادة الاستخدام ديناميكيًا من رقع الصور، مما يتيح مكافحة تزييف الوجه في العالم المفتوح بمتانة ضد الهجمات غير المرئية عبر التقاط أدلة دقيقة ومتباينة مكانيًا دون الاعتماد على التوجيه الدلالي أو اللغوي.

Fangling Jiang, Qi Li, Bing Liu, Weining Wang, Quilin Huang, Zhenan Sun, Ming-Hsuan Yang2026-08-25
💻 computer science

RoboShape: Information-Theoretic Point Cloud Representations for Privacy-Aware Robot Perception

تقدم الورقة البحثية RoboShape، وهو إطار عمل قائم على نظرية المعلومات يعمل على ضغط تمثيلات السحابة النقطية للروبوت لتقليل حجم البيانات وتكاليف الإرسال بشكل كبير مع الحفاظ على فائدة التعرف على الأشياء وكبح تسرب السياق المكاني الحساس بفعالية.

Oguzhan Baser, Mirac Sozen, Kaan Kale, Sandeep Chinchali, Sriram Vishwanath2026-08-25
💻 computer science

Selective Cross-View Consistency for World Action Models: Held-Out Viewpoint Robustness Without Test-Time Camera Information

تقترح هذه الورقة استراتيجية "الاتساق الانتقائي بين الرؤى" (SCVC)، وهي استراتيجية تدريب تعمل على تحسين متانة نماذج الأفعال العالمية تجاه زوايا الكاميرا المحجوبة من خلال تطبيق خسائر الاتساق حصرياً على المخرجات غير المتغيرة بتغير الرؤية (مثل الأفعال) بدلاً من المخرجات المتغيرة بتغير الرؤية (مثل إطارات الفيديو)، مما يتجنب تقليص المحتوى المشروع الخاص برؤية معينة دون الحاجة إلى تسميات للكاميرا أو معلومات خارجية.

Bingqi Huang, Bingchuan Wei, Yingkai Cai, Zhaokui Wang2026-08-25
💻 computer science

Topology of a Smile: Persistent Homology in Dental Imaging

تقترح هذه الورقة طريقة مؤتمتة لتصوير الأسنان تجمع بين التماثل المستمر من تحليل البيانات الطوبولوجية وآلات ناقلات الدعم لتصنيف الأسنان وتشخيص الأمراض في فحوصات التصوير المقطعي المحوسب ذو الحزمة المخروطية، محققةً دقة أعلى بكثير (97.67% و96.77%) من الشبكة العصبية التلافيفية المماثلة.

Leon Dahlmeier, Sara Kališnik, Albert Mehl, Bastian Rieck2026-08-25
💻 computer science

WorldMind: Decoupled Game World Model for State-Aware NPC Behavior

تقدم الورقة البحثية WorldMind، وهو إطار عمل منفصل يفصل نمذجة عالم اللعبة إلى طبقات الفهم، واتخاذ القرار، والتحكم، والتوليد لتمكين سلوك الشخصيات غير القابلة للعب المدركة للحالة، مدعوماً بمجموعة بيانات BOSS-140K، ويُظهر تماسكاً تكتيكياً فائقاً مقارنة بالنماذج المرجعية الحالية.

Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin2026-08-25
💻 computer science

Text-Guided Visual Dependency Graph Learning with Cross-Modal Attention Priors

تقترح الورقة البحثية CM-GLasso، وهو إطار عمل مبتكر يدمج تعلم التبعية البصرية الموجه بالنص مع نماذج غاوس البيانية المتفرقة عبر أولويات الانتباه عبر الوسائط لتحقيق أداء رائد في التصنيف والتقسيم مع توليد رسوم بيانية للتبعية الشرطية قابلة للتفسير في الوقت ذاته.

Fei Wang, Yutong Zhang, Yang Ye, Jinxian Chen, Wang Wenshuai, Xiong Wang2026-08-25