💬 NLP

Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering

تقترح الورقة البحثية "تقطير المطالبات التكيفي الميتاوي" (Meta-Adaptive Prompt Distillation)، وهو إطار عمل للتعلم الميتاوي يعمل على تقطير الميزات البصرية ذات الصلة بالمهام إلى مطالبات ناعمة قابلة للتكيف عبر وحدة خريطة الانتباه، مما يتفوق بشكل كبير على التعلم السياقي القياسي والضبط الدقيق كفء المعلمات لمهام الإجابة على الأسئلة البصرية في النماذج متعددة الوسائط الكبيرة ضمن سيناريوهات التعلم من أمثلة قليلة.

Akash Gupta, Amos Storkey, Mirella Lapata2026-03-03
💻 computer science

BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation

يقدم BitVLA نموذج رؤية-لغة-فعل (Vision-Language-Action) أصليًا بالكامل بدقة 1-بت للمناولة الروبوتية، يحقق أداءً يضاهي النماذج المرجعية ذات الدقة الكاملة مع تقليل بصمة الذاكرة وزمن الاستجابة بشكل كبير من خلال تصميم بارامترات ثلاثي أصلي واستراتيجية "الكمّنة ثم التقطير" (Quantize-then-Distill) مبتكرة للعمود الفقري للرؤية.

Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen2026-03-03
🤖 AI

VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models

تقدم VITA طريقة لتعلم دالة القيمة بنمط التعلم الصفري (zero-shot) تعزز من قدرة نماذج الرؤية واللغة المجمدة على التعميم والاستدلال الزمني من خلال التكيف في وقت الاختبار وأخذ العينات القائم على عدم التشابه، مما يتيح أداءً قويًا في المهام الروبوتية المتنوعة ويحسن سياسات التعلم المعزز غير المتصل بالإنترنت.

Christos Ziakas, Alessandra Russo2026-03-03
💬 NLP

VINCIE: Unlocking In-context Image Editing from Video

تقدم الورقة البحثية VINCIE، وهو محول انتشار سببي-كتلي (block-causal diffusion transformer) تم تدريبه حصرياً على تسلسلات متعددة الوسائط مستمدة من الفيديو من خلال ثلاث مهام وسيطة، والذي يحقق أداءً هو الأفضل في فئته في تحرير الصور ضمن السياق ويظهر قدرات قوية في تركيب المفاهيم المتعددة وتوليد القصص.

Leigang Qu, Feng Cheng, Ziyan Yang, Qi Zhao, Shanchuan Lin, Yichun Shi, Yicong Li, Wenjie Wang, Tat-Seng Chua, Lu Jiang2026-03-03
⚡ electrical engineering

NIC-RobustBench: A Comprehensive Open-Source Toolkit for Neural Image Compression and Robustness Analysis

تقدم هذه الورقة البحثية **NIC-RobustBench**، وهو إطار عمل مفتوح المصدر مصمم لتقييم المتانة العدائية لنماذج ضغط الصور العصبية وتأثيرها على المهام اللاحقة، مما يعالج الفجوة الحالية في المعايوهات التي تركز بشكل أساسي فقط على أداء معدل التشويه.

Georgii Bychkov, Khaled Abud, Egor Kovalev, Alexander Gushchin, Sergey Lavrushkin, Dmitriy Vatolin, Anastasia Antsiferov (…)2026-03-03
💻 computer science

MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion

يقدم MonoFusion طريقة لإعادة بناء المشاهد الديناميكية من فيديوهات ذات زوايا رؤية شحيحة عبر محاذاة عمليات إعادة البناء أحادية العدسة المستقلة لتحقيق نتائج عالية الجودة ومتسقة زمنياً ومن حيث زاوية الرؤية دون الحاجة إلى إعدادات كاميرات متعددة كثيفة ومكلفة.

Zihan Wang, Jeff Tan, Tarasha Khurana, Neehar Peri, Deva Ramanan2026-03-03
🤖 AI

Learning Robust Intervention Representations with Delta Embeddings

تقترح هذه الورقة طريقة لتحسين المتانة تجاه البيانات خارج التوزيع من خلال تعلم "تضمينات دلتا السببية" (Causal Delta Embeddings) ثابتة ومتفرقة لتمثيل التدخلات في الفضاء الكامن، مما يتيح التعلم غير الخاضع للإشراف للتمثيلات السببية من أزواج الصور، وهو ما يتفوق بشكل كبير على النماذج المرجعية في كل من الاختبارات المعيارية الاصطناعية والواقعية.

Panagiotis Alimisis, Christos Diou2026-03-03
💬 NLP

Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

يقدم Uni-CoT إطار عمل موحداً لسلسلة الأفكار (Chain-of-Thought) يستفيد من نموذج استدلال ثنائي المستويات وتدريب مهيكل لتمكين الاستدلال متعدد الوسائط بكفاءة وتماسك عبر النصوص والرؤية، محققاً أداءً هو الأفضل في فئته على معايير توليد الصور وتحريرها بموارد حوسبية محدودة.

Luozheng Qin, Jia Gong, Yuqing Sun, Tianjiao Li, Mengping Yang, Xiaomeng Yang, Chao Qu, Zhiyu Tan, Hao Li2026-03-03
⚡ electrical engineering

Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution

تقترح هذه الورقة البحثية نموذج TADSR، وهو شبكة انتشار أحادية الخطوة واعية بالزمن تعمل على تعزيز عملية تحسين دقة الصور في العالم الحقيقي من خلال تقديم مشفر VAE واعٍ بالزمن وفقدان VSD واعٍ بالزمن للاستفادة الكاملة من الأولويات التوليدية لنماذج الانتشار المستقرة مسبقة التدريب عبر خطوات زمنية مختلفة، مما يحقق أداءً هو الأفضل في فئته مع توازنات يمكن التحكم فيها بين الدقة والواقعية في خطوة واحدة.

Tianyi Zhang, Zheng-Peng Duan, Peng-Tao Jiang, Bo Li, Ming-Ming Cheng, Chun-Le Guo, Chongyi Li2026-03-03
💻 computer science

TrueSkin: Towards Fair and Accurate Skin Tone Recognition and Generation

تقدم هذه الورقة TrueSkin، وهي مجموعة بيانات شاملة تضم 7,299 صورة موزعة على ست فئات من درجات لون البشرة، لتقييم وتحسين العدالة والدقة في النماذج متعددة الوسائط والنموذجية الضخمة الحالية، والتي تعاني حالياً من تحيزات منهجية في التعرف على لون البشرة وتوليدها.

Haoming Lu2026-03-03