💻 computer science

Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models

تقدم هذه الورقة البحثية SymPL، وهو إطار عمل يعيد صياغة مهام الاستدلال المكاني المرتكزة على المنظور الخارجي (allocentric) الصعبة إلى تمثيلات تخطيطية رمزية مهيكلة، مما يعزز بشكل كبير أداء ومتانة النماذج اللغوية البصرية في كل من بيئات المنظور الخارجي والمنظور الذاتي (egocentric).

Jaeyun Jang, Seunghui Shin, Taeho Park, Hyoseok Hwang2026-02-25
💻 computer science

TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding

تقدم الورقة البحثية TraceVision، وهو نموذج رؤية-لغة متكامل (end-to-end) مبتكر يدمج الفهم المكاني المدرك للمسار من خلال وحدة إدراك بصري مدركة للمسار ومسار تدريب متخصص، محققاً أداءً رائدًا في مهام مثل الوصف، والتحديد الموضعي، والتقطيع عبر محاكاة مسارات الانتباه البصري البشري.

Fan Yang, Shurong Zheng, Hongyin Zhao, Yufei Zhan, Xin Li, Yousong Zhu, Chaoyang Zhao Ming Tang, Jinqiao Wang2026-02-25
💻 computer science

De-rendering, Reasoning, and Repairing Charts with Vision-Language Models

تقدم هذه الورقة إطار عمل يستفيد من نماذج الرؤية واللغة لإزالة عناصر الرسوم البيانية (de-render)، والاستنتاج حول عيوب التصميم باستخدام مبادئ التصور المرئي الراسخة، واقتراح تحسينات قابلة للتنفيذ بشكل تكراري لتعزيز جودة التصور المرئي والقدرة على قراءته.

Valentin Bonas, Martin Sinnona, Viviana Siless, Emmanuel Iarussi2026-02-25
💻 computer science

N4MC: Neural 4D Mesh Compression

يُعد N4MC إطاراً عصبياً مبتكراً يحقق أداءً فائقاً في معدل التشوه لضغط الشبكات رباعية الأبعاد عبر تحويل تسلسلات الشبكات غير المنتظمة إلى موترات رباعية الأبعاد منتظمة والاستفادة من تعويض الحركة القائم على المحولات لاستغلال التكرار الزمني من أجل فك تشفير فعال وفي الوقت الفعلي.

Guodong Chen, Huanshuo Dong, Mallesham Dasari2026-02-25
🤖 AI

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

تقدم هذه الورقة أول إطار عمل لتتبع الدوائر الشفاف في نماذج الرؤية واللغة، باستخدام المحولات (transcoders) ورسوم العزو البيانية للكشف عن الدوائر السببية المسؤولة عن الاستدلال متعدد الوسائط الهرمي والارتباطات عبر الوسائط والتحقق منها والتحكم فيها.

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu2026-02-25
💻 computer science

Large-scale Photorealistic Outdoor 3D Scene Reconstruction from UAV Imagery Using Gaussian Splatting Techniques

تقدم هذه الورقة مساراً متكاملاً (end-to-end) يدمج تدفقات الفيديو الملتقطة بواسطة الطائرات بدون طيار مع تقنية "Gaussian Splatting" ثلاثية الأبعاد لتحقيق إعادة بناء للمشاهد ثلاثية الأبعاد عالية الدقة ومنخفضة زمن التأخير في الوقت الفعلي، بما يتناسب مع تطبيقات الواقع المعزز والواقع الافتراضي الغامرة، متفوقةً بذلك على النهج التقليدية القائمة على "NeRF" من حيث سرعة التصيير وزمن التأخير مع الحفاظ على جودة بصرية تنافسية.

Christos Maikos, Georgios Angelidis, Georgios Th. Papadopoulos2026-02-25
💻 computer science

BiRQA: Bidirectional Robust Quality Assessment for Images

يُعد BiRQA نموذجاً مدمجاً لتقييم جودة الصور يعتمد على المرجعية الكاملة وثنائي الاتجاه، حيث يحقق دقة تضاهي أحدث ما توصل إليه العلم وسرعة في الوقت الفعلي، مع تعزيز متانة النموذج بشكل كبير ضد الهجمات العدائية من خلال استراتيجية التدريب العدائي المرتكز المبتكرة.

Aleksandr Gushchin, Dmitriy S. Vatolin, Anastasia Antsiferova2026-02-25
💻 computer science

3DSPA: A 3D Semantic Point Autoencoder for Evaluating Video Realism

تقدم الورقة البحثية 3DSPA، وهو إطار تقييم آلي غير معتمد على المراجع يستخدم مشفرًا تلقائيًا للنقاط في الفضاء الثلاثي الأبعاد والزماني يدمج مسارات الحركة، والعمق، والميزات الدلالية لتقييم واقعية الفيديو، والاتساق الزمني، والمعقولية الفيزيائية بقوة، متفوقًا بذلك على الأساليب الحالية في التوافق مع الأحكام البشرية.

Bhavik Chandna, Kelsey R. Allen2026-02-25
💻 computer science

Aesthetic Camera Viewpoint Suggestion with 3D Aesthetic Field

تقدم هذه الورقة مجالاً جمالياً ثلاثي الأبعاد مرتكزاً على الهندسة يتم تعلمه عبر تقنية "Gaussian Splatting" ثلاثية الأبعاد ذات التغذية الأمامية من لقطات متفرقة، مما يتيح اقتراحات فعالة لوجهات النظر خالية من التعلم المعزز (RL-free) تتفوق على الأساليب الحالية في التأطير والتكوين.

Sheyang Tang, Armin Shafiee Sarvestani, Jialu Xu, Xiaoyu Xu, Zhou Wang2026-02-25
💻 computer science

SimLBR: Learning to Detect Fake Images by Learning to Detect Real Images

تقدم الورقة البحثية إطار عمل SimLBR، وهو إطار عمل عالي الكفاءة يحسن التعميم عبر المولدات في كشف الصور المزيفة من خلال تعلم حد قرار ضيق حول الصور الحقيقية عبر تنظيم المزج الكامن (Latent Blending Regularization)، بينما يدعو أيضاً إلى مقاييس تقييم أكثر موثوقية ومعدلة حسب المخاطر.

Aayush Dhakal, Subash Khanal, Srikumar Sastry, Jacob Arndt, Philipe Ambrozio Dias, Dalton Lunga, Nathan Jacobs2026-02-25