💻 computer science

Déjà View: Looping Transformers for Multi-View 3D Reconstruction

تقدم الورقة البحثية نموذج Déjà View، وهو نموذج لإعادة البناء ثلاثي الأبعاد يتميز بكفاءة في المعلمات عبر استبدال مجموعات المحولات (transformer stacks) العميقة ذات التغذية الأمامية بكتلة حلقية واحدة تُطبق بشكل متكرر، مما يثبت أن التكرار الصريح يعمل كتحيز استقرائي متفوق لإعادة البناء متعدد المشاهد مقارنة بمجرد زيادة سعة النموذج.

Alessandro Burzio, Tobias Fischer, Sven Elflein, Qunjie Zhou, Riccardo de Lutio, Jiawei Ren, Jiahui Huang, Shengyu Huang (…)2026-05-29
💻 computer science

BullingerDB: A Dataset for Handwritten Text Recognition and Writer Retrieval

تقدم الورقة البحثية BullingerDB، وهي مجموعة بيانات ضخمة متعددة اللغات تضم ما يقرب من 21,000 صفحة تاريخية من مراسلات هاينريش بولينجر، وتقيم فائدتها في التعرف على النصوص المكتوبة بخط اليد واسترجاع الكاتب المراعي للزمن، مع تسليط الضوء على كل من أداء النماذج والتحديات التي تفرضها التباينات الأسلوبية طويلة الأمد.

Marco Peer, Anna-Scius Bertrand, Patricia Scheurer, Andreas Fischer2026-05-29
💻 computer science

Ambient-robust Inverse Rendering using Active RGB-NIR Imaging

تقدم هذه الورقة طريقة لإعادة التصوير العكسي متينة تجاه الإضاءة المحيطة، تستفيد من التصوير النشط بالأشعة تحت الحمراء القريبة (RGB-NIR) ومن مسار معالجة مبتكر ثلاثي المراحل لتحقيق إعادة بناء دقيقة للهندسة والانعكاسية عبر استخدام إضاءة وميض الأشعة تحت الحمراء القريبة لتثبيت التظليل ضد ظروف الإضاءة المحيطة المتغيرة.

Hoon-Gyu Chung, Jinnyeong Kim, Hyunwoo Kang, Seung-Hwan Baek2026-05-29
💻 computer science

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

تقدم هذه الورقة البحثية VideoFDB، وهو أول معيار مرجعي مُصمم لتقييم وكلاء المحادثة السمعية البصرية ثنائيي الاتجاه (full-duplex) من خلال تحليل التفاعلات الثنائية في العالم الحقيقي، كاشفةً أن الأنظمة الحالية تفشل في دمج الإشارات البصرية المتدفقة بفعالية من أجل التواصل غير اللفظي الطبيعي رغم قدرتها على التعامل مع الأسئلة البصرية الصريحة.

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini (…)2026-05-29
💻 computer science

Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning

يُعد Stable-Layers إطار عمل للتعلم التعزيزي يقوم بضبط نماذج تفكيك طبقات الصور بدقة باستخدام تغذية راجعة مُقيمة بواسطة نماذج الرؤية واللغة (VLM) عبر مسار تقييم ثنائي المرحلة للتغلب على ضغط المكافأة، مما يؤدي إلى جودة فائقة في فصل الطبقات وإعادة البناء دون الحاجة إلى إشراف مقترن.

Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss2026-05-29
💻 computer science

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

تقدم الورقة البحثية minWM، وهو إطار عمل مفتوح المصدر متكامل يحول نماذج الفيديو التأسيسية ثنائية الاتجاه الحالية إلى نماذج عالمية ذاتية الانحدار، تعمل في الوقت الفعلي، وقابلة للتحكم عبر الكاميرا، وتتطلب خطوات قليلة، من خلال مسار شامل من الضبط الدقيق، والتدريب القسري السببي، والتقطير.

Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan L (…)2026-05-29
🤖 AI

PhyGenHOI: Physically-Aware 4D Generation of Dynamic Human-Object Interactions

يُعد PhyGenHOI إطار عمل مبتكرًا يولد تفاعلات بشرية-شيئية ديناميكية رباعية الأبعاد دقيقة فيزيائيًا ومخلصة بصريًا من خلال ربط نموذج انتشار حركة (Motion Diffusion Model) لحركة الإنسان مع محاكاة فيزيائية قائمة على طريقة النقطة المادية (Material Point Method)، وكل ذلك موحد عبر نقاط غاوس ثلاثية الأبعاد (3D Gaussian Splats) وتحت إشراف آليات فقدان متخصصة لضمان واقعية التلامس ونقل الزخم.

Omer Benishu, Gal Fiebelman, Sagie Benaim2026-05-29
⚡ electrical engineering

Boosting Image Quality Assessment Performance: Unsupervised Score Fusion by Deep Maximum a Posteriori Estimation

تقترح هذه الورقة إطار عمل عاماً غير خاضع للإشراف لدمج درجات تقييم جودة الصور (IQA) بناءً على تقدير الاحتمال الأقصري العميق (deep Maximum a Posteriori estimation)، والذي يعزز دقة التنبؤ ويقلل من عدم اليقين من خلال إجراء تقدير دقيق لعدم اليقين ورفض النماذج الرديئة بفعالية.

Zhongling Wang, Raymond Zhou, Shahrukh Athar, Wenbo Yang, Zhou Wang2026-05-29
💻 computer science

Grounded 3D-Aware Spatial Vision-Language Modeling

تقدم الورقة البحثية نموذج GR3D، وهو نموذج رؤية ولغة مكاني موحد يدمج التأسيس ثنائي الأبعاد الصريح، والتأسيس ثنائي الأبعاد الضمني، والتأسيس ثلاثي الأبعاد أحادي المنظور لتفكيك الاستدلال المكاني المعقد إلى إدراك مُؤصل واستدلال ثلاثي الأبعاد، مما يعزز بشكل كبير قدرات الفهم المكاني العام.

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molch (…)2026-05-29
🤖 AI

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

تقدم هذه الورقة البحثية نموذج "Archon"، وهو نموذج متعدد الوسائط موحد مدرب مسبقاً بالكامل يدمج سبع وسائط ويستخدم تقنيات مبتكرة مثل إعادة تمثيل الفيديو الموفرة للذاكرة و"التفكير في الوسائط" (Thinking in Modality) لتحقيق توليد بشر رقميين عالي الدقة، وقابل للتحكم، وشامل عبر مهام متنوعة.

Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guo (…)2026-05-29