💬 NLP

Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space

تقترح هذه الورقة إطار عمل DMLR، وهو إطار عمل وقت الاختبار يحاكي الإدراك البشري من خلال التداخل الديناميكي بين الاستنتاج والإدراك في الفضاء الكامن عبر التحسين الموجه بالثقة وحقن الميزات المرئية التكيفي، مما يعزز أداء الاستنتاج متعدد الوسائط مع الحفاظ على كفاءة الاستدلال.

Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang2026-04-10
💻 computer science

LumiCtrl : Learning Illuminant Prompts for Lighting Control in Personalized Text-to-Image Models

تُعد LumiCtrl طريقة مبتكرة لتخصيص نماذج تحويل النص إلى صورة تتيح تحكماً دقيقاً في الإضاءة من خلال تعلم مطالبات المضيء من صورة كائن واحدة عبر التعزيز القائم على الفيزياء، وفك الارتباط بين المطالبات الموجهة بالحواف، وفقد إعادة البناء المقنع، مما يؤدي إلى دقة فائقة في المضيء وجودة جمالية تتفوق على النماذج المرجعية الحالية.

Muhammad Atif Butt, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer2026-04-10
💻 computer science

Adversarial Evasion Attacks on Computer Vision using SHAP Values

تقترح هذه الورقة هجوماً تفادياً من نوع الصندوق الأبيض (white-box) على نماذج الرؤية الحاسوبية يستفيد من قيم SHAP لتحديد أهمية المدخلات، مما يثبت متانته الفائقة مقارنة بطريقة "إشارة التدرج السريع" (Fast Gradient Sign Method) في توليد تصنيفات خاطئة غير محسوسة، لا سيما في سيناريوهات إخفاء التدرج.

Frank Mollard, Marcus Becker, Florian Roehrbein2026-04-10
💻 computer science

AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors

تقترح الورقة البحثية AnomalyVFM، وهو إطار عمل عام يحول نماذج الرؤية التأسيسية المدربة مسبقاً إلى كواشف شذوذ ذات قدرة فائقة في التعرف الصفري (zero-shot) من خلال الجمع بين مخطط توليد بيانات اصطناعية قوي ثلاثي المراحل وآلية تكيف فعالة من حيث المعلمات، مما يتفوق بشكل كبير على الأساليب الحالية عبر مجموعات بيانات متنوعة.

Matic Fučka, Vitjan Zavrtanik, Danijel Skočaj2026-04-10
💻 computer science

PANC: Prior-Aware Normalized Cut via Anchor-Augmented Token Graphs

تُعد PANC طريقةً خالية من التدريب ومعتمدة على المعرفة المسبقة، تعمل على تعزيز التجزئة غير الخاضعة للإشراف من رقع صور (patches) نماذج ViT ذات التعلم الذاتي عبر دمج مرسات (anchors) يقدمها المستخدم في إطار عمل "القطع الطبيعي المعزز بالمرساة" (anchor-augmented Normalized Cut)، مما يحقق أقنعة قوية وقابلة للتوجيه مع مكاسب كبيرة في الأداء على مجموعات البيانات الصعبة.

Juan Gutiérrez, Victor Gutiérrez-García, José Luis Blanco-Murillo2026-04-10
💻 computer science

Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

يُعد Lang2Act إطار عمل مبتكر يعزز الاستدلال البصري دقيق التفاصيل لنماذج الرؤية واللغة عبر استبدال الأدوات الخارجية المحددة مسبقاً والجامدة بسلاسل أدوات لغوية ذاتية الظهور، والتي يتم تحسينها من خلال عملية تعلم تعزيزي مكونة من مرحلتين للحفاظ على المعلومات البصرية وتحقيق مكاسب كبيرة في الأداء.

Yuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu2026-04-10
💻 computer science

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

يقدم UniLACT نموذجاً للرؤية واللغة والعمل يعتمد على المحولات (transformer-based)، والذي يستفيد من إطار عمل موحد لتعلم العمل الكامن (UniLARN) لدمج البنية الهندسية المدركة للعمق في مرحلة ما قبل التدريب، مما يحسن بشكل كبير من الأولويات المكانية وأداء المعالجة مقارنة بالنماذج المرجعية التي تعتمد على RGB فقط في كل من بيئات المحاكاة والواقع الفعلي.

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das2026-04-10
🤖 AI

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

تقدم هذه الورقة البحثية SUPERGLASSES، وهو أول معيار للأسئلة والأجوبة المرئية من منظور الشخص الأول في العالم الحقيقي للنظارات الذكية، وتقترح SUPERLENS، وهو وكيل متعدد الوسائط يدمج بين اكتشاف الأشياء والبحث عبر الويب لتحقيق أداء رائد في تطبيقات النظارات الذكية الذكية.

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li2026-04-10
💻 computer science

VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents

يُعد VAREX معياراً مرجعياً جديداً لتقييم النماذج التأسيسية متعددة الوسائط في استخراج البيانات المهيكلة من النماذج الحكومية، حيث يتميز بمسار تعليق عكسي فريد، وأربعة أنماط مدخلات متميزة، ونتائج تسلط الضوء على أن النص المحافظ على التنسيق هو أكثر تنسيقات المدخلات فعالية، مع تحديد الامتثال للمخطط كعائق رئيسي للنماذج التي يقل حجمها عن 4 مليارات معلمة.

Udi Barzelay, Ophir Azulai, Inbar Shapira, Idan Friedman, Foad Abo Dahood, Madison Lee, Abraham Daniels2026-04-10
💻 computer science

Personalizing Text-to-Image Generation to Individual Taste

تقدم هذه الورقة PAMELA، وهي مجموعة بيانات وإطار عمل تنبؤي مبتكر مصمم لنمذجة وتحسين توليد الصور من النصوص وفقاً لتفضيلات المستخدم الفردية، مما يثبت أن نماذج المكافأة الشخصية يمكنها التنبؤ بالأحكام الجمالية الذاتية بدقة أكبر من الأساليب الحالية القائمة على مستوى المجموعات.

Anne-Sofie Maerten, Juliane Verwiebe, Shyamgopal Karthik, Ameya Prabhu, Johan Wagemans, Matthias Bethge2026-04-10