💻 computer science

All-in-One Conditioning for Text-to-Image Synthesis

تقترح هذه الورقة آلية تكييف قائمة على مخطط المشهد (scene graph) بنمط التعلم الصفري (zero-shot)، تتميز بمُكيِّف "السمة-الحجم-الكمية-الموقع" (ASQL) الذي يستخدم نموذج لغة خفيف الوزن لتوفير توجيه بصري مرن، مما يحسن الدقة التركيبية وتنوع تخليق الصور من النصوص دون الحاجة إلى قيود تخطيط صارمة.

Hirunima Jayasekara, Chuong Huynh, Yixuan Ren, Christabel Acquaye, Abhinav Shrivastava2026-02-11
💻 computer science

VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models

تقدم الورقة البحثية VLM-UQBench، وهو معيار جديد مصمم لتقييم عدم اليقين الخاص بكل نمط وعدم اليقين عبر الأنماط في نماذج الرؤية واللغة، مما يكشف أن طرق قياس عدم اليقين الحالية تواجه صعوبة في اكتشاف حالات الغموض الدقيقة على مستوى العينة وتوفير إشارات غير متسقة للكشف عن الهلوسة.

Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li2026-02-11
💻 computer science

Rethinking Global Text Conditioning in Diffusion Transformers

تُظهر هذه الورقة أنه بينما يكون التكييف النصي القائم على التعديل التقليدي غالباً فائضاً عن الحاجة في نماذج محولات الانتشار (Diffusion Transformers)، فإن إعادة توظيف التضمين النصي المجمّع كآلية توجيه خالية من التدريب يمكن أن يعزز بشكل كبير من القدرة على التحكم والأداء عبر مختلف مهام التوليد.

Nikita Starodubcev, Daniil Pakhomov, Zongze Wu, Ilya Drobyshevskiy, Yuchen Liu, Zhonghao Wang, Yuqian Zhou, Zhe Lin, Dmi (…)2026-02-11
🤖 AI

X-Mark: Saliency-Guided Robust Dataset Ownership Verification for Medical Imaging

تُعد X-Mark طريقةً لعلامات مائية نظيفة وخاصة بكل عينة لمجموعات بيانات الأشعة السينية للصدر، حيث تستخدم شبكة U-Net شرطية وتنظيماً لابتلاسيان (Laplacian) لدمج اضطرابات موجهة بالبروز (saliency-guided)، مما يضمن التحقق القوي من الملكية والتحلل من القياس (scale-invariance) مع الحفاظ على الجودة التشخيصية.

Pranav Kulkarni, Junfeng Guo, Heng Huang2026-02-11
🤖 AI

A Deep Multi-Modal Method for Patient Wound Healing Assessment

تقترح هذه الورقة طريقة تعلم نقل عميق متعدد الوسائط تدمج صور الجروح والمتغيرات السريرية للتنبؤ بمسارات التئام الجروح وخطر دخول المريض إلى المستشفى، بهدف تمكين الكشف المبكر عن المضاعفات وتقليل وقت التشخيص السريري.

Subba Reddy Oota, Vijay Rowtula, Shahid Mohammed, Jeffrey Galitz, Minghsun Liu, Manish Gupta2026-02-11
💻 computer science

K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge

يُعد K-Sort Eval إطار عمل موثوقاً وفعالاً للتقييم القائم على نماذج الرؤية واللغة (VLM)، حيث يعمل على تحسين محاذاة التفضيلات من خلال طريقة التصحيح البعدي، ويعظم كفاءة التقييم باستخدام استراتيجية مطابقة ديناميكية للمقارنات بين النماذج من فئة (K+1)(K+1)-wise.

Zhikai Li, Jiatong Li, Xuewen Liu, Wangbo Zhao, Pan Du, Kaicheng Zhou, Qingyi Gu, Yang You, Zhen Dong, Kurt Keutzer2026-02-11
💻 computer science

Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning

تقدم الورقة البحثية Fine-T2I، وهو عبارة عن مجموعة بيانات مفتوحة المصدر واسعة النطاق وعالية الجودة ومتنوعة تضم أكثر من 6 ملايين زوج من النصوص والصور، صُممت لسد فجوة الأداء في الضبط الدقيق لتحويل النص إلى صورة من خلال تحسين جودة التوليد والالتزام بالتعليمات بشكل كبير عبر مختلف النماذج.

Xu Ma, Yitian Zhang, Qihua Dong, Yun Fu2026-02-11
🤖 machine learning

A Scoping Review of Deep Learning for Urban Visual Pollution and Proposal of a Real-Time Monitoring Framework with a Visual Pollution Index

تحلل هذه المراجعة النطاقية أساليب التعلم العميق الحالية للكشف عن التلوث البصري الحضري، وتقترح إطار عمل للمراقبة في الوقت الفعلي يتضمن مؤشرًا للتلوث البصري لدعم الإدارة الحضرية المستدامة والمعيارية.

Mohammad Masudur Rahman, Md. Rashedur Rahman, Ashraful Islam, Saadia B Alam, M Ashraful Amin2026-02-11
🤖 AI

ArtifactLens: Hundreds of Labels Are Enough for Artifact Detection with VLMs

يُعد ArtifactLens إطار عمل متعدد المكونات يستفيد من المعرفة المتأصلة في نماذج الرؤية واللغة (VLMs) سابقة التدريب من خلال التعلم في السياق وتحسين التعليمات لتحقيق أداء فائق في اكتشاف الآثار باستخدام بضع مئات فقط من الأمثلة المصنفة لكل فئة.

James Burgess, Rameen Abdal, Dan Stoddart, Sergey Tulyakov, Serena Yeung-Levy, Kuan-Chieh Jackson Wang2026-02-11
💻 computer science

Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions

تقترح الورقة البحثية **Align-TI**، وهو إطار عمل جديد لتقطير المعرفة يعمل على تحسين ضغط النماذج اللغوية الكبيرة متعددة الوسائط من خلال تجاوز محاذاة الرمز التالي الثابت لالتقاط التفاعلات الديناميكية بين الرموز، وتحديداً من خلال محاذاة التعليمات البصرية (IVA) ومحاذاة احتمالية الانتقال من رمز إلى آخر (TPA).

Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang (…)2026-02-11