💻 computer science

Parameter-Efficient Architectural Modifications for Translation-Invariant CNNs

تقترح هذه الورقة استراتيجية "بنية عبر الإنترنت" (Online Architecture) فعالة في المعلمات، تقوم بإدراج طبقات التجميع المتوسط العالمي (Global Average Pooling) في الشبكات العصبية الالتفافية (CNNs) لتحقيق ضغط هائل للنماذج وتعزيز الثبات تجاه الإزاحة (translation invariance)، مما يثبت أن مثل هذه التعديلات الهيكلية تحقق أداءً قويًا وتقييمًا فائقًا لجودة الصور الإدراكية دون الاعتماد على تعزيز البيانات التقليدي.

Nuria Alabau-Bosque, Jorge Vila-Tomas, Paula Dauden-Oliver, Valero Laparra, Jesus Malo2026-05-01
💻 computer science

Frequency-Aware Semantic Fusion with Gated Injection for AI-generated Image Detection

تقترح هذه الورقة البحثية FGINet، وهو إطار عمل مبتكر يعزز تعميم كشف الصور المولدة بواسطة الذكاء الاصطناعي من خلال التخفيف من تحيز الاختصار الترددي وصراعات التمثيل عبر النطاقات من خلال مشفر تردد مقنع بالنطاق، وحقن تردد بوابي على مستوى الطبقة، وتعلم التماسك الفائق للكرة.

Shuchang Zhou, Shangkun Wu, Jiwei Wei, Ke Liu, Ran Ran, Caiyan Qin, Yang Yang2026-05-01
💻 computer science

HiMix: Hierarchical Artifact-aware Mixup for Generalized Synthetic Image Detection

تقترح هذه الورقة HiMix، وهو إطار عمل موحد يعمل على تحسين تعميم كشف الصور الاصطناعية من خلال الجمع بين وحدة تعزيز توزيعي مدفوعة بـ Mixup لتوسيع نطاق التغطية التدريبية، ووحدة تمثيل هرمي مدركة للآثار لاستخراج ميزات تزييف تمييزية عبر مختلف المولدات.

Shuchang Zhou, Kaiwen Shen, Jiwei Wei, Yuyang Zhou, Peng Wang, Yang Yang2026-05-01
🤖 AI

The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models

تستقصي هذه الورقة كيف يؤثر التمهيد البصري، بما في ذلك التصور السلوكي ومصفوفات المكافآت المرمزة بالألوان، على اتخاذ القرار التعاوني في نماذج الرؤية واللغة في معضلة السجين المتكررة، مما يكشف عن قابلية كبيرة للتأثر بالإشارات البصرية وتباين فعالية استراتيجيات التخفيف عبر النماذج المختلفة.

Kenneth J. K. Ong2026-05-01
💻 computer science

ClimateVID -- Social Media Videos Analysis and Challenges Involved

تقيم هذه الورقة قدرات نماذج الرؤية واللغة وتقنيات التجميع القائمة على تضمين الصور لتحليل فيديوهات وسائل التواصل الاجتماعي حول تغير المناخ، وتجد أنه بينما تعاني نماذج الرؤية واللغة الحالية مع خطاب مناخي محدد، فإن التجميع غير الخاضع للإشراف باستخدام نماذج مثل DINOv2 وConvNeXt V2 ينجح في كشف أنماط بصرية وهياكل موضوعية متميزة.

Shiqi Xu, Moritz Burmester, Katharina Prasse, Isaac Bravo, Stefanie Walter, Margret Keuper2026-05-01
💻 computer science

FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting

تقدم هذه الورقة FineState-Bench، وهو معيار مرجعي شامل يضم ٢٢٠٩ حالة ومسار تشخيص مبتكر مكون من أربع مراحل يكشف عن قصور كبير في قدرة النماذج اللغوية البصرية الكبيرة (LVLMs) الحالية على تحقيق تفاعلات واجهة مستخدم رسومية (GUI) دقيقة ومشروطة بالحالة، مع إثبات أن تحسين التأسيس البصري يمكن أن يعزز الأداء بشكل كبير.

Fengxian Ji, Jingpu Yang, Zirui Song, Yuanxi Wang, Zhexuan Cui, Yuke Li, Qian Jiang, Xiuying Chen2026-05-01
🤖 machine learning

Faster 3D Gaussian Splatting Convergence via Structure-Aware Densification

تقدم هذه الورقة إطار عمل للتكثيف المدرك للبنية لتقنية "Gaussian Splatting" ثلاثية الأبعاد، والذي يعمل على تسريع التقارب وتحسين جودة إعادة البناء من خلال استخدام تحليل التردد متعدد المقاييس لتوجيه الانقسام متباين الخواص بناءً على تفاصيل النسيج المحلية، بدلاً من الاعتماد على تدرجات الفضاء الشاشي القياسية.

Linjie Lyu, Ayush Tewari, Jianchun Chen, Thomas Leimkühler, Christian Theobalt2026-05-01
💻 computer science

FreeOcc: Training-Free Embodied Open-Vocabulary Occupancy Prediction

يُعد FreeOcc إطار عمل مبتكرًا لا يتطلب تدريبًا، حيث يستفيد من مسار معالجة مكون من أربع طبقات لتوليد خرائط إشغال ذات مفردات مفتوحة من تسلسلات أحادية العين أو RGB-D دون الحاجة إلى تمثيلات ثلاثية الأبعاد أو وضعيات حقيقية، محققًا أداءً هو الأفضل في فئته على المعايير المرجعية للبيئات الداخلية.

Zeyu Jiang, Changqing Zhou, Xingxing Zuo, Changhao Chen2026-05-01
🤖 machine learning

Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces

تقترح الورقة البحثية إطار عمل S2^2VAE، وهو إطار تعلم كامن يعتمد على الهندسة أولاً، يستخدم توزيعات القوة الكروية (Power Spherical) ضمن محول مرئي مرتكز على الهندسة (Visual Geometry Grounded Transformer) للتفوق على عنق الزجاجة الغاوسي التقليدي في الحفاظ على الهندسة ثلاثية الأبعاد وديناميكيات الكاميرا تحت ضغط عالي.

Andrew Bond, Ilkin Umut Melanlioglu, Erkut Erdem, Aykut Erdem2026-05-01
🤖 machine learning

PhyCo: Learning Controllable Physical Priors for Generative Motion

إن PhyCo هو إطار عمل يوسع نماذج انتشار الفيديو بحركات قابلة للتحكم ومتسقة فيزيائياً من خلال مجموعة بيانات محاكاة ضخمة، والضبط الدقيق الخاضع للإشراف الفيزيائي باستخدام ControlNet، وتحسين المكافأة الموجه بواسطة نماذج اللغة والرؤية (VLM) لتوليد سلوكيات فيزيائية واقعية دون الحاجة إلى أجهزة محاكاة أو إعادة بناء هندسي أثناء الاستنتاج.

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker2026-05-01