💻 computer science

DPMambaIR: All-in-One Image Restoration via Degradation-Aware Prompt State Space Model

تقترح الورقة البحثية DPMambaIR، وهو إطار عمل لاستعادة الصور بنظام "الكل في واحد" يدمج مستخرج تدهور دقيق التفاصيل مع نموذج فضاء الحالة المعتمد على التلميحات المدرك للتدهور وكتلة تعزيز التردد العالي لتحقيق أداء فائق عبر أنواع متعددة من التدهور من خلال التكيف ديناميكيًا مع ميزات التدهور دقيقة التفاصيل.

Zhanwen Liu, Sai Zhou, Yuchao Dai, Yang Wang, Yisheng An, Xiangmo Zhao2026-02-06
💻 computer science

LookWhere? Efficient Visual Recognition by Learning Where to Look and What to See from Self-Supervision

تقدم الورقة البحثية LookWhere، وهي طريقة ذاتية الإشراف تعالج بكفاءة التعرف البصري عالي الدقة من خلال التعلم المشترك لاختيار مناطق الصور ذات الصلة واستخراج الميزات عبر مُنتقي منخفض الدقة ومستخرج عالي الدقة، مما يحقق تخفيضات كبيرة في التكلفة الحسابية مع الحفاظ على الدقة أو تحسينها عبر مهام متنوعة.

Anthony Fuller, Yousef Yassin, Junfeng Wen, Daniel G. Kyrollos, Tarek Ibrahim, James R. Green, Evan Shelhamer2026-02-06
💻 computer science

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

تقدم هذه الورقة البحثية "Many-for-Many"، وهو إطار عمل موحد يستخدم محولات خفيفة الوزن واستراتيجية تعلم مشتركة للصور والفيديو لتدريب نموذج تأسيسي واحد قادر على أداء أكثر من عشر مهام متنوعة للتوليد والمعالجة البصرية، محققاً أداءً تنافسياً مع الاستفادة من البيانات من مصادر متعددة للتغلب على التكلفة العالية للتدريب الخاص بكل مهمة.

Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang2026-02-06
💻 computer science

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

تقدم هذه الورقة GIQ، وهو معيار شامل يستخدم مجسمات متعددة الوجوه متنوعة، اصطناعية وحقيقية، لتقييم نماذج الرؤية والنماذج اللغوية البصرية التأسيسية، مما يكشف عن أوجه قصور كبيرة في قدراتها على الاستدلال الهندسي عبر مهام مثل إعادة البناء ثلاثي الأبعاد، وكشف التماثل، وتصنيف الأشكال.

Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guh (…)2026-02-06
🤖 AI

BioLite U-Net: Edge-Deployable Semantic Segmentation for In Situ Bioprinting Monitoring

تقدم هذه الورقة BioLite U-Net، وهو إطار عمل خفيف الوزن للتجزئة الدلالية يستخدم التلافيف القابلة للفصل بعمق ومجموعة بيانات مشروحة مبتكرة لتمكين المراقبة الدقيقة في الوقت الفعلي تقريبًا في الموقع لعمليات الطباعة الحيوية على أجهزة الحافة محدودة الموارد مثل Raspberry Pi 4B.

Usman Haider, Lukasz Szemet, Daniel Kelly, Vasileios Sergis, Andrew C. Daly, Karl Mason2026-02-06
💻 computer science

Spectral Prefiltering of Neural Fields

تقدم هذه الورقة طريقة سريعة وغير مرتبطة ببنية معينة للترشيح المسبق للمجالات العصبية في تمريرة أمامية واحدة عن طريق القياس التحليلي لتمثيلات سمات فورييه مع الاستجابة الترددية للمرشح، مما يتيح التعميم على مرشحات بارامترية غير مرئية مثل "بوكس" (Box) و"لانزوس" (Lanczos) دون قيود تدريب إضافية.

Mustafa B. Yaldiz, Ishit Mehta, Nithin Raghavan, Andreas Meuleman, Tzu-Mao Li, Ravi Ramamoorthi2026-02-06
💻 computer science

Active Perception Agent for Omnimodal Audio-Video Understanding

يقدم OmniAgent أول وكيل إدراك نشط بالكامل يقوم بتنسيق أدوات أحادية النمط متخصصة ديناميكياً ويستخدم نموذجاً مبتكراً موجهاً صوتياً من الخشن إلى الناعم لتحقيق فهم صوتي وفيديو شامل ومتعدد الأنماط يتصدر المعايير الحالية دون الحاجة للتدريب.

Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang2026-02-06
💻 computer science

Deep Probabilistic Supervision for Image Classification

تقترح الورقة البحثية الإشراف الاحتمالي العميق (DPS)، وهو إطار عمل مبني على أسس سليمة يقوم ببناء توزيعات مستهدفة خاصة بكل عينة عبر الاستدلال الإحصائي على تنبؤات النموذج نفسه للتخلص من الاعتماد على الأهداف الصارمة، مما يؤدي إلى تحسين دقة الاختبار، والمعايرة، والمتانة بشكل كبير مقارنة بطرق التقطير الذاتي الحالية.

Anton Adelöw, Matteo Gamba, Atsuto Maki2026-02-06
🤖 AI

SIRR-LMM: Single-image Reflection Removal via Large Multimodal Model

تقدم هذه الورقة البحثية SIRR-LMM، وهو نهج مبتكر يجمع بين إطار عمل لتوليد بيانات اصطناعية دقيق فيزيائياً ونموذج لغوي كبير متعدد الوسائط مضبوط بدقة لتحقيق أداء رائد في إزالة وفصل الانعكاسات من صورة واحدة.

Yu Guo, Zhiqiang Lao, Xiyun Song, Yubin Zhou, Heather Yu2026-02-06
💻 computer science

Robust automatic brain vessel segmentation in 3D CTA scans using dynamic 4D-CTA data

تقدم هذه الدراسة منهجية تعلم عميق قوية لتجزئة الأوعية الدموية الدماغية ثلاثية الأبعاد في فحوصات التصوير المقطعي المحوسب للأوعية (CTA) تستفيد من بيانات (4D-CTA) الديناميكية لتعزيز كفاءة التوسيم اليدوي وتوسيع مجموعة بيانات التدريب، مما أدى إلى نموذج يتفوق بشكل كبير على المعايير المرجعية الحالية من حيث الدقة، والدقة المورفولوجية، والحساسية الطوبولوجية.

Alberto Mario Ceballos-Arroyo, Shrikanth M. Yadav, Chu-Hsuan Lin, Jisoo Kim, Geoffrey S. Young, Lei Qin, Huaizu Jiang2026-02-06