💬 NLP

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

تتناول هذه الورقة البحثية أوجه القصور في الأساليب الحالية الموجهة نحو المخاطر في بناء مجموعات بيانات السلامة متعددة الوسائط من خلال اقتراح مسار جديد ذاتي التكيف موجه نحو الصور يقوم تلقائياً بتوليد مجموعة بيانات سلامة واقعية مكونة من 35 ألف عنصر، وتقديم مقياس تقييم معياري للتحقق من فعاليتها عبر مهام متنوعة.

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao2026-02-27
💻 computer science

Visual Instruction Pretraining for Domain-Specific Foundation Models

تقدم هذه الورقة البحثية التدريب المسبق للتعليمات البصرية (ViTP)، وهو نموذج جديد يستفيد من الاستدلال عالي المستوى لتعزيز السمات الإدراكية منخفضة المستوى من خلال التدريب المسبق لنموذج "ترانسفورمر الرؤية" (Vision Transformer) ضمن نموذج رؤية ولغة بشكل كامل من الطرف إلى الطرف، محققاً أداءً هو الأفضل في فئته عبر مختلف معايير الاستشعار عن بعد والتصوير الطبي.

Yuxuan Li, Yicheng Zhang, Wenhao Tang, Yimian Dai, Ming-Ming Cheng, Xiang Li, Jian Yang2026-02-27
🤖 machine learning

Secure and reversible face anonymization with diffusion models

تقدم هذه الورقة أول إطار عمل قائم على الانتشار لإخفاء هوية الوجه بشكل آمن وعكسي، والذي يستخدم التكييف بمفتاح سري لتمكين حماية الهوية عالية الجودة وإعادة البناء المصرح به مع منع إلغاء إخفاء الهوية غير المصرح به.

Pol Labarbarie, Vincent Itier, William Puech2026-02-27
💻 computer science

Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation

تقترح هذه الورقة نماذج الانتشار لإزالة الضجيج غير المتزامنة، وهو إطار عمل مبتكر يخصص خطوات زمنية متميزة لكل بكسل على حدة لتمكين المناطق المتعلقة بالمطالبة من الاستفضاء بمعلومات سياقية أكثر وضوحاً من المناطق غير المتعلقة بها، مما يؤدي إلى تحسين المحاذاة بين النص والصورة بشكل كبير.

Zijing Hu, Yunze Tong, Fengda Zhang, Junkun Yuan, Jun Xiao, Kun Kuang2026-02-27
🤖 AI

Detection and Measurement of Hailstones with Multimodal Large Language Models

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة متعددة الوسائط سابقة التدريب، لا سيما عند تعزيزها باستراتيجيات التلقين ثنائية المراحل التي تستفيد من الأجسام المرجعية، يمكنها اكتشاف وقياس أقطار حبات البرد بفعالية من صور وسائل التواصل الاجتماعي المستمدة من المصادر الجماعية بمتوسط خطأ قدره 1.12 سم، مما يقدم مكملاً واعداً لأجهزة استشعار البرد التقليدية للتقييم السريع للطقس القاسي.

Moritz Alker, David C. Schedl, Andreas Stöckl2026-02-27
💬 NLP

PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions

تقدم هذه الورقة البحثية PoSh، وهو مقياس يعتمد على نموذج لغوي كبير (LLM) كحكم وموجه برسم بياني للمشهد (scene graph) لتقييم الأوصاف التفصيلية للصور، وتتحقق من صحته من خلال معيار DOCENT الجديد، مما يظهر ارتباطاً فائقاً مع الأحكام البشرية ومتانة عبر أنواع الصور المتنوعة مقارنة بالمقاييس الحالية.

Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford, Julia Demarest, Adam Purvis, Keith Krut, Robert Stein, Rina El (…)2026-02-27
💻 computer science

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

تحدد هذه الورقة البحثية وتعالج "الاختصارات البصرية" التي تعيب معايير الإجابة على الأسئلة البصرية القائمة على المعرفة متعددة الوسائط من خلال تقديم مجموعة بيانات RETINA، التي تجبر النماذج على التفكير في الكيانات ذات الصلة، واقتراح نموذج MIMIR الذي يستفيد من استرجاع الصور المتعددة للتغلب على هذه القيود.

Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo2026-02-27
🤖 AI

Diffusion Model in Latent Space for Medical Image Segmentation Task

تقترح الورقة البحثية MedSegLatDiff، وهو إطار عمل فعال للانتشار في الفضاء الكامن يجمع بين المشفر التلقائي التبايني (VAE) وفقدان الإنتروبيا المتقاطعة الموزون لتوليد فرضيات متنوعة لتجزئة الصور الطبية مدركة لعدم اليقين، مع تحقيق أداء رائد على مجموعات بيانات سريرية متعددة.

Huynh Trinh Ngoc, Toan Nguyen Hai, Ba Luong Son, Long Tran Quoc2026-02-27
💻 computer science

ClimaOoD: Improving Anomaly Segmentation via Physically Realistic Synthetic Data

تقدم هذه الورقة ClimaDrive، وهو إطار عمل لتوليد بيانات شذوذ اصطناعية واقعية فيزيائياً ومتنوعة مناخياً، وتستفيد منه لبناء معيار ClimaOoD، الذي يعزز بشكل كبير من قدرة نماذج تقسيم الشذوذ على التعميم والمتانة في سيناريوهات القيادة الذاتية ذات العالم المفتوح.

Yuxing Liu, Zheng Li, Huanhuan Liang, Ji Zhang, Zeyu Sun, Yong Liu2026-02-27
💻 computer science

ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing

تقدم هذه الورقة ThinkRL-Edit، وهو إطار عمل للتعلم التعزيزي المتمحور حول الاستدلال يعزز تحرير الصور القائم على التعليمات من خلال فصل الاستدلال البصري عن التوليف عبر أخذ عينات سلسلة الأفكواب (Chain-of-Thought)، وتجميع المكافآت غير المنحاز، والتقييم باستخدام نماذج اللغات الكبيرة المرئية (VLM) القائم على قائمة التحقق الثنائية للتغلب على القيود في الاستكشاف، ودمج المكافآت، واستقرار المكافأة.

Hengjia Li, Liming Jiang, Qing Yan, Yizhi Song, Hao Kang, Zichuan Liu, Xin Lu, Boxi Wu, Deng Cai2026-02-27