💻 computer science

MOSA: Motion-Guided Semantic Alignment for Dynamic Scene Graph Generation

تقترح هذه الورقة إطار عمل MoSA، وهو إطار محاذاة دلالي موجه بالحركة يعزز توليد الرسوم البيانية للمشاهد الديناميكية من خلال دمج سمات حركة أزواج الكائنات مع الميزات المكانية، ومحاذاة التمثيلات المرئية مع التضمينات النصية عبر المطابقة عبر الوسائط، واستخدام فقدان مرجح بالفئات لتحسين نمذجة العلاقات الذيلية.

Xuejiao Wang, Bohao Zhang, Changbo Wang, Gaoqi He2026-04-22
💻 computer science

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

تقترح الورقة البحثية CreatiParser، وهو إطار عمل توليدي هجين يعمل على تفكيك تصميمات الرسوم النقطية (raster graphics) إلى طبقات قابلة للتحرير تشمل النص والخلفية والملصقات باستخدام نموذج رؤية-لغة وبنية انتشار متعددة الفروع، معززة بآلية مكافأة متوافقة مع التفضيلات البشرية لتحقيق أداء تحليل فائق وقابلية تعديل عالية.

Weidong Chen, Dexiang Hong, Zhendong Mao, Yutao Cheng, Xinyan Liu, Lei Zhang, Yongdong Zhang2026-04-22
💻 computer science

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

يُعد CoInteract إطار عمل متكاملًا يقوم بتخليق مقاطع فيديو لتفاعل الإنسان مع الأشياء تتسم بالاتساق الفيزيائي، وذلك عبر دمج "خليط خبراء مدرك للبشر" لضمان الدقة الهيكلية، و"نموذج توليد مشترك ذي بنية مكانية" لفرض أولويات هندسة التفاعل، مما يتغلب على قيود الاستقرار وواقعية التلامس التي تعاني منها النماذج الانتشارية الحالية.

Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma2026-04-22
💻 computer science

InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement

تقدم الورقة البحثية InHabit، وهو إطار عمل آلي بالكامل وقابل للتوسع يستفيد من النماذج التأسيسية للصور ثنائية الأبعاد لإنشاء مجموعة بيانات ضخمة وتفاعلية بين الإنسان والمشهد ثلاثية الأبعاد وواقعية للغاية، مما يعالج ندرة البيانات في العالم الحقيقي ويحسن بشكل كبير مهام إعادة البناء البشري ثلاثي الأبعاد وتقدير التلامس.

Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll2026-04-22
💻 computer science

IR-Flow: Bridging Discriminative and Generative Image Restoration via Rectified Flow

يُعد IR-Flow إطار عمل مبتكر لترميم الصور يعتمد على التدفق المصحح (Rectified Flow)، حيث يوحد بين النماذج التمييزية والتوليدية عبر بناء تدفقات لتوزيع البيانات متعددة المستويات وحقول سرعة تراكمية لتحقيق ترميم عالي الجودة وبخطوات قليلة مع توازن ممتاز بين التشوه والإدراك.

Zihao Fan, Xin Lu, Jie Xiao, Dong Li, Jie Huang, Xueyang Fu2026-04-22
💻 computer science

Face Anything: 4D Face Reconstruction from Any Image Sequence

تقدم هذه الورقة "Face Anything"، وهي طريقة موحدة تعتمد على المحولات ذات التغذية الأمامية (feed-forward transformer) تحقق أداءً هو الأفضل في حالته في إعادة بناء وتتبع الوجه رباعي الأبعاد من أي تسلسل صور عبر التنبؤ بإحداثيات الوجه المعيارية لحل الغموض الهندسي وضمان الاتساق الزمني.

Umut Kocasari, Simon Giebenhain, Richard Shaw, Matthias Nießner2026-04-22
💻 computer science

AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model

إن AnyReon هو إطار عمل قابل للتوسع يتيح إعادة بناء ثلاثية الأبعاد قوية من مدخلات متفرقة عشوائية وغير مرتبة، وذلك عبر الاستفادة من نموذج انتشار فيديو معزز بذاكرة مشهد عالمية مستمرة، وتكييف مدرك للهندسة، وتحسينات للكفاءة لضمان الاتساق الهندسي عبر فجوات زوايا الرؤية الكبيرة.

Yutian Chen, Shi Guo, Renbiao Jin, Tianshuo Yang, Xin Cai, Yawen Luo, Mingxin Yang, Mulin Yu, Linning Xu, Tianfan Xue2026-04-22
🤖 machine learning

Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback

تقترح هذه الورقة الاستفادة من نماذج الرؤية واللغة لتوفير تغذية راجعة من الذكاء الاصطناعي الإدراكي من أجل تحسين توليد النص إلى الفيديو، مما يثبت أن هذا النهج يحسن بشكل كبير من واقعية تفاعلات الأجسام الديناميكية والالتزام بالقوانين الفيزيائية مقارنة بالطرق الحالية.

Hiroki Furuta, Heiga Zen, Dale Schuurmans, Aleksandra Faust, Yutaka Matsuo, Percy Liang, Sherry Yang2026-04-21
🤖 machine learning

ENTIRE: Learning-based Volume Rendering Time Prediction

تقدم الورقة البحثية إطار عمل ENTIRE، وهو إطار عمل قائم على التعلم العميق يتنبأ بدقة وكفاءة بأوقات تصيير الحجم من خلال الجمع بين ميزات الحجم الهيكلية المستخرجة ومعلمات التصيير، مما يتيح التحسين الديناميكي لضمان استقرار معدلات الإطارات وتوازن الأحمال عبر مختلف الأجهزة والتكوينات.

Zikai Yin, Hamid Gadirov, Jiri Kosinka, Steffen Frey2026-04-21
💻 computer science

Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation

تقترح هذه الورقة البحثية طريقة مبتكرة لتوليد الإمكانيات البشرية المعتمدة على السياق، تستخدم آلية انتباه متبادلة عبر الوسائط ومساراً مفككاً من المشفرات التلقائية المتغيرة والمصنفات للتنبؤ بالوضعيات والأفعال البشرية الصالحة ضمن مشاهد ثنائية الأبعاد معقدة، مما يتفوق بشكل كبير على النماذج المرجعية الحالية.

Prasun Roy, Saumik Bhattacharya, Subhankar Ghosh, Umapada Pal, Michael Blumenstein2026-04-21