💻 computer science

Tango3D: Towards Alignment for Global and Local 2D-3D Correspondence

يُعد Tango3D نموذجاً تأسيسياً جديداً ثلاثي الأبعاد يوحد بين الاسترجاع الدلالي العالمي والمراسلة الدقيقة بين البكسل والنقطة عبر رسم خرائط لقطع الصور ثنائية الأبعاد ورموز السحابة النقطية ثلاثية الأبعاد في مساحة مشتركة من خلال عمود فقري مدرك للهندسة واستراتيجية تدريب تصاعدية مكونة من ثلاث مراحل.

Zebin He, Mingxin Yang, Shuhui Yang, Hanxiao Sun, Xintong Han, Chunchao Guo, Wenhan Luo2026-05-20
💻 computer science

Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls

تقدم الورقة البحثية **Aero-World**، وهي طريقة تعمل على تكييف نماذج الانتشار (diffusion models) المدربة مسبقاً لتحويل الصور إلى فيديو لإنتاج فيديوهات جوية قابلة للتحكم من خلال إشارات التحكم بالقصور الذاتي عبر حقن رموز الحركة (action tokens) والاستفادة من مسبار فيزيائي (Physics Probe) مجمد في الفضاء الكامن للإشراف، جنباً إلى جنب مع معيار **AeroBench** لتقييم محاذاة الحركة والاتساق الفيزيائي.

Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang, Mubarak Shah, Yu Tian2026-05-20
💻 computer science

CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models

تقدم هذه الورقة البحثية CPC-VAR، وهو إطار عمل موحد يعالج النسيان الكارثي وتشابك الميزات في النماذج التوليدية البصرية ذاتية الانحدار من خلال توظيف اختيار عصبون المفهوم القائم على التدرج للتعلم المستمر للمفهوم الواحد، واستراتيجية تركيب مدركة للسياق لتخليق متعدد المفاهيم قابل للتحكم.

Junhao Li, Xinhao Zhong, Yi sun, Yuxia Qiao, Bin Chen, Shu-Tao Xia, Yaowei Wang2026-05-20
💻 computer science

Mechanisms of Object Localization in Vision-Language Models

تستخدم هذه الورقة أدوات التفسير الآلي للكشف عن أن تحديد مواقع الأشياء في نماذج الرؤية واللغة يعتمد على آلية "الاحتواء" التي تقودها مجموعة ضيقة من رؤوس الانتباه المتخصصة في الطبقات المبكرة إلى المتوسطة أو المتوسطة إلى المتأخرة، والتي تحدد الامتدادات المكانية بشكل مستقل إلى حد كبير عن دلالات الرموز الداخلية.

Timothy Schaumlöffel, Martina G. Vilas, Gemma Roig2026-05-20
💻 computer science

Depth2Pose: A Pose-Based Benchmark for Monocular Depth Estimation without Ground-Truth Depth

تقدم هذه الورقة Depth2Pose، وهو معيار ومجموعة بيانات جديدة تقيم نماذج تقدير العمق أحادي العين بناءً على قدرتها على دعم تقدير وضعية الكاميرا النسبية اللاحقة، مما يوفر بديلاً قائماً على المهام لمقاييس العمق التقليدية القائمة على الحقيقة الأرضية، وهو أمر فعال بشكل خاص للمشاهد الصعبة حيث لا تتوفر تعليقات توضيحية كثيفة للعمق.

Viktor Kocur, Sithu Aung, Gabrielle Flood, Yaqing Ding, Lukas Bujnak, Torsten Sattler, Zuzana Kukelova2026-05-20
🤖 AI

Stitched Value Model for Diffusion Alignment

يقدم البحث إطار عمل StitchVM، وهو إطار عمل لدمج النماذج خفيف الوزن يقوم بنقل نماذج المكافأة مسبقة التدريب من فضاء البكسل بكفاءة إلى الفضاءات الكامنة المشوشة عبر إلحاق عمود فقري لنموذج انتشار مجمد، مما يتيح محاذاة دقيقة وفعالة حاسوبياً لنماذج الانتشار دون التحيز لتقديرات "توييدي" (Tweedie) أو التكلفة العالية لعمليات "مونت كارلو" المتكررة (Monte Carlo rollouts).

Hyojun Go, Hyungjin Chung, Prune Truong, Goutam Bhat, Li Mi, Zhaochong An, Zixiang Zhao, Dominik Narnhofer, Serge Belong (…)2026-05-20
💬 NLP

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

تقدم هذه الورقة FineBench، وهو معيار واسع النطاق للأنشطة البشرية دقيق التفاصيل مع تعليقات توضيحية كثيفة على مقاطع الفيديو طويلة المدى، وتقترح FineAgent، وهو إطار عمل معياري يعزز بشكل كبير قدرات الاستدلال المكاني وفهم الأفعال في النماذج اللغوية البصرية مفتوحة المصدر.

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu2026-05-20
💻 computer science

Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding

تقترح هذه الورقة طريقة تعزز متانة نماذج الرؤية واللغة في فهم الوثائق المرئية خارج نطاق التوزيع عبر حقن كيانات التخطيط المكتشفة مسبقًا كعلامات وثائق (DocTags) مهيكلة داخل المطالبة، مما يحل بفعالية مشكلة عنق الزجاجة ثنائية الخطوات ويحسن دقة التحليل الهيكلي بشكل كبير دون تغيير بنية النموذج الأساسي.

Peter El Hachem, Ahmed Nassar, A. Said Gurbuz, Christoph Auer, Peter W. J. Staar2026-05-20
🤖 AI

Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification

تقدم هذه الورقة نظاماً سلبياً لمراقبة سلامة البناء في نهاية المناوبة يدمج بين كشف YOLO11 الدقيق، وتجزئة SAM 3، وبروتوكول تسلسل أفكري تنافسي قائم على الشخصية ومسند إلى Qwen3-VL-8B، وذلك لتحسين دقة التحقق من الامتثال وتقليل الهلوسة بشكل كبير مع إنشاء تقارير سلامة مرتبطة بمعايير OSHA من منظور العامل ومن لقطات الكاميرا الثابتة.

Ananth Sriram, Neel Mokaria, Rajveer Singh2026-05-20
💻 computer science

GoTTA be Diverse: Rethinking Memory Policies for Test-Time Adaptation

تقدم هذه الورقة معياراً منهجياً يثبت أن التنوع داخل الفئة الواحدة هو عامل حاسم لفعالية سياسات ذاكرة التكيف وقت الاختبار، مما أدى إلى تطوير إطار عمل "التكيف وقت الاختبار القائم على الملاحظة الموجهة" (GOTTA)، الذي يجمع بين التخصيص المتوازن للفئات والتنوع في فضاء السمات لتحسين متانة النموذج بشكل كبير تحت تدفقات البيانات غير المستقلة والموزعة غير متماثلة (non-i.i.d.) والقيود المفروضة على ميزانيات الذاكرة.

Shyma Alhuwaider, Yasmeen Alsaedy, Merey Ramazanova, Silvio Giancola, Bernard Ghanem2026-05-20