🤖 AI

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

تقدم هذه الورقة البحثية "دلالات المهام المرئية" (VTS) للكشف عن فجوة أداء كبيرة في النماذج متعددة الوسائط عندما تُدمج التعليمات كبكسلات بدلاً من نصوص، وتقترح طريقة لربط منطقة التلقين (prompt-region grounding) تسد بفعالية فجوة القناة الدلالية هذه دون الحاجة إلى التعرف الضوئي على الحروف (OCR) أو بيانات وصف المناطق أثناء الاستدلال.

Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang2026-08-06
💬 NLP

Simile Understanding in Text-to-Image Models: An Evaluation Framework

تقترح هذه الورقة إطار عمل تقييمي قابل للتوسع لتقييم وتشخيص الفشل المستمر لنماذج تحويل النص إلى صورة في تفسير التشبيهات بشكل صحيح، مما يكشف عن فجوة بين فهم اللغة المجازية والتجسيد البصري من خلال مجموعات بيانات محكومة، ومقاييس كشف تلقائية، وتحليل لطبقات الترميز.

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe2026-08-06
🤖 AI

FUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening

تقدم هذه الورقة FUSEP، وهو أول مجموعة بيانات مرجعية متعددة المراكز متاحة للجمهور وتتكون من 4,017 صورة بالموجات فوق الصوتية لأجنة في مراحل الحمل المبكرة مع 45,820 تعليقاً خبيراً عبر 14 بنية تشريحية، صُممت لتعزيز أبحاث التشخيص الآلي المساعد وتكيف النطاق في فحص الأجنة.

Bin Pu, Jiewen Yang, Liwen Wang, Ying Tan, Guannan He, Xingbo Dong, Qika Lin, Jiarong Guo, Lixian Yang, Zuozhu Liu, Shen (…)2026-08-06
💻 computer science

On the Effectiveness of Adaptation Strategies for VLM-Based Federated Learning in Remote Sensing

تقدم هذه الورقة أول دراسة مقارنة تقيم استراتيجيات الضبط الدقيق الكامل، والضبط الدقيق الخاص بالمشفر، وتعلم التلقين، وتكيف "LoRA" لنماذج الرؤية واللغة في التعلم الاتحادي على بيانات الاستشعار عن بعد، مع تحليل مقايضاتها بين القدرة على التعميم في ظل ظروف البيانات غير المتطابقة توزيعياً (non-IID)، وحجم عبء الاتصالات، والتعقيد الحسابي لتقديم إرشادات عملية لاختيار الاستراتيجية.

Simon Lösche, Barış Büyüktaş, Mathis Adler, Angelos Zavras, Ioannis Papoutsis, Begüm Demir2026-08-06
💻 computer science

Global Attention-Fused Image Cropping with Attention-Guided and Global-Aligned Crop Evaluator

تقترح هذه الورقة طريقة "قص الصور المدمجة بالانتباه العالمي" (GAFIC)، وهي طريقة تدمج وحدة "دمج الميزات الموجهة بالانتباه" ومقيّم "القص المتوافق عالمياً" للتغلب على قيود النهج الحالية من خلال التقاط العلاقات العالمية بين مكونات الصورة، مما يحقق دقة واستقراراً فائقين في اختيار عمليات القص المفضلة جمالياً دون تعديل سلامة البكسلات.

Haotian Yang, Zhile Yang, Kin-Man Lam, Patrick Le Callet, Xin Sun2026-08-06
💻 computer science

Persistent Object Narratives for Token-Efficient Video Language Models

تقدم الورقة البحثية SlotNarrative، وهي واجهة لنموذج لغوي للفيديو تتسم بكفاءة الرموز (tokens)، تقوم بتنظيم محتوى الفيديو في سرديات كائنات مستمرة باستخدام رموز هوية وحالة مدمجة، محققةً توازناً ملائماً بين الدقة وعدد الرموز من خلال فصل تجميع الكائنات عن الضغط لكل إطار.

Junzhe Chen, Siyuan Meng, Xiaojie Guo2026-08-06
💬 NLP

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

تكشف هذه الدراسة أن نماذج الرؤية واللغة تظهر عدم استقرار تشخيصي وانحيازاً مفرطاً كبيراً تحت تأثير الاضطرابات البصرية والنصية في تحليل رنين الدماغ المغناطيسي، مما يثبت أن مقاييس الدقة القياسية تفشل في رصد إخفاقات الموثوقية الحرجة اللازمة للنشر السريري الآمن.

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili2026-08-06
💻 computer science

STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models

يُعد STEP-OPD إطار عمل جديد للتقطير في السياسة نفسها (on-policy distillation) لنماذج الانتشار، حيث يعزز تعلم الطالب من خلال تمديد أهداف المخرجات لتتجاوز المعلم عبر استقراء السرعة والمواءمة الصريحة لتطور التمثيلات الداخلية، مما يُمكّن الطالب الموحد من التفوق على المعلمين ذوي المهام الفردية في مقاييس التوافق التركيبي، وتصيير النصوص، وتفضيلات البشر.

Qingyan Wei, Guangzhao Li, Xiaobing Tu, Yinggui Wang, Xiantao Zhang, Jinkui Ren, Xiaohong Liu, Linfeng Zhang2026-08-06
🤖 AI

When Shared Rollouts Fail in Defensive Driving Evaluation: A NAVSIM Score Basis Audit

تُدقق هذه الورقة إطار تقييم القيادة الدفاعية NAVSIM v2.2 لتكشف أن عدم الاستقرار العددي في عمليات التدحرج المشتركة، والذي يتفاقم بسبب التسامح المشروط بالمرجع، يتسبب في تفوق الوكلاء "العميان" بشكل غير صحيح على خطوط الأساس لإعادة العرض البشري، مما يستدعي دعوة لبروتوكولات تدقيق أكثر صرامة تتضمن الإفصاح عن أساس الدرجة واختبار الاستقرار.

Ziang Wei, Minjun Yu, Zheyuan Lai, Mingjie Pang, Wei Li2026-08-06
🤖 machine learning

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

تقدم الورقة البحثية إطار عمل TD-V2A، الذي يعزز بشكل كبير جودة توليد الفيديو إلى صوت عبر الاستفادة من الفروق الزمنية كتمثيل بصري رئيسي وتوظيف استراتيجية تعلم مستمر هرمي مع توجيه مُخمد، كل ذلك مع تطلب حد أدنى من التعديلات المعمارية مقارنة بالطرق الحالية.

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu2026-08-06