💬 NLP

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

تعالج هذه الورقة فجوة الاستدلال المتعلقة بالسلامة في النماذج اللغوية البصرية من خلال تقديم مجموعة بيانات السلامة متعددة الصور (MIS)، التي تدمج مدخلات متعددة الصور مع تسميات "سلسلة الأفكار" الخاصة بالسلامة لتعزيز قدرات الاستدلال البصري وأداء السلامة بشكل كبير مع الحفاظ على القدرات العامة للنموذج.

Yi Ding, Lijun Li, Bing Cao, Jing Shao2026-02-04
🤖 machine learning

Understanding Representation Dynamics of Diffusion Models via Low-Dimensional Modeling

تُثبت هذه الورقة نظرياً وتجريبياً أن ديناميكيات التمثيل أحادي المنوال الملحوظة في نماذج الانتشار —حيث تبلغ جودة الميزات ذروتها عند مستويات ضجيج متوسطة— تنشأ من التفاعل بين قوة إزالة الضجيج والثقة في الفئة، مما يجعلها مؤشراً موثوقاً لما إذا كان النموذج قد تعلم بنجاح توزيع البيانات الأساسي أم أنه يكتفي بمجرد حفظ بيانات التدريب.

Xiao Li, Zekai Zhang, Xiang Li, Siyi Chen, Zhihui Zhu, Peng Wang, Qing Qu2026-02-04
💻 computer science

FedVSR: Towards Model-Agnostic Federated Learning in Video Super-Resolution

تقدم الورقة البحثية FedVSR، وهو إطار عمل للتعلم الاتحادي غير مرتبط بنموذج محدد وغير مرتبط بحالة، يستخدم خسارة خفيفة الوزن تعتمد على تحويل المويجات المتقطعة واستراتيجية تجميع مدركة للخسارة لتعزيز الجودة الإدراكية لتطوير دقة الفيديو بشكل كبير مع الحفاظ على تكلفة حسابية وتواصل تقترب من الصفر.

Ali Mollaahmadi Dehaghi, Hossein KhademSohi, Reza Razavi, Steve Drew, Mohammad Moshirpour2026-02-04
⚡ electrical engineering

Understanding-informed Bias Mitigation for Fair CMR Segmentation

تُثبت هذه الورقة أن الجمع بين تقليم الصور وفرط أخذ العينات يقلل بفعالية من التحيز العرقي في تقسيم الرنين المغناطي للقلب (CMR) القائم على الذكاء الاصطناعي، مما يحسن الأداء بشكل كبير للمرضى السود الممثلين تمثيلاً ناقصاً دون المساس بالدقة للمرضى البيض.

Tiarna Lee, Esther Puyol-Antón, Bram Ruijsink, Pier-Giorgio Masci, Louise Keehn, Phil Chowienczyk, Emily Haseler, Miaoji (…)2026-02-04
💻 computer science

LGPS: A Lightweight GAN-Based Approach for Polyp Segmentation in Colonoscopy Images

تقترح الورقة البحثية إطار عمل LGPS، وهو إطار عمل خفيف الوزن يعتمد على شبكات الخصومة التوليدية (GAN) يدمج بين هيكل MobileNetV2 مع وحدات ResE، وتحسين الحدود باستخدام ConvCRF، ودالة فقدان هجينة لتحقيق دقة في تقسيم السلائل (polyp segmentation) تضاهي أحدث المعايير العالمية، مع قدرة قوية على التعميم وبعدد أقل بكثير من المعلمات مقارنة بالنماذج الحالية، مما يجعله مناسباً للغاية للتطبيقات السريرية في الوقت الفعلي.

Fiseha B. Tesema, Alejandro Guerra Manzanares, Tianxiang Cui, Qian Zhang, Moses Solomon, Sean He2026-02-04
💻 computer science

DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning

تقدم الورقة البحثية إطار عمل DWIM، وهو إطار عمل مبتكر يعزز الاستدلال البصري التركيبي من خلال توظيف توليد سير عمل مدرك للتباين لاستخراج بيانات تدريب قابلة للتطبيق، والضبط الدقيق القائم على قناع التعليمات لتوجيه النماذج في استنساخ إجراءات الأدوات الفعالة، مما يتغلب على قيود النماذج اللغوية الكبيرة المجمدة ويحقق أداءً رائدًا.

Fucai Ke, Vijay Kumar B G, Xingjian Leng, Zhixi Cai, Zaid Khan, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi, Ma (…)2026-02-04
💬 NLP

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

تقدم هذه الورقة MedFrameQA، وهو أول معيار مرجعي للمساءلة البصرية الطبية متعدد الصور (VQA) مستمد من نصوص مقاطع الفيديو التعليمية لتقييم الاستدلال السريري، مما يكشف أن النماذج اللغوية الكبيرة متعددة الوسائط المتقدمة حالياً تعاني بشكل كبير في دمج المعلومات البصرية عبر تسلسلات الصور وتتبع التطور المرضي.

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang (…)2026-02-04
💻 computer science

Seeing through Satellite Images at Street Views

تقدم هذه الورقة Sat2Density++، وهو نهج جديد يعتمد على حقول الإشعاع العصبي يتغلب على تحديات المشاهد الشحيحة وتغيرات زوايا النظر القصوى لتخليق صور بانورامية وفيديوهات واقعية للشارع من صور الأقمار الصناعية من خلال نمذجة العناصر الخاصة بمنظر الشارع مثل السماء والإضاءة بشكل صريح.

Ming Qian, Bin Tan, Qiuyu Wang, Xianwei Zheng, Hanjiang Xiong, Gui-Song Xia, Yujun Shen, Nan Xue2026-02-04
🤖 AI

Accurate and Efficient World Modeling with Masked Latent Transformers

تقدم الورقة البحثية EMERALD، وهو نموذج عالم فعال يجمع بين الحالات الكامنة المكانية وتنبؤات MaskGIT لتوليد مسارات دقيقة في الفضاء الكامن، محققاً أداءً هو الأفضل في فئته على معيار Crafter من خلال تجاوز الخبراء البشريين في غضون 10 ملايين خطوة.

Maxime Burchi, Radu Timofte2026-02-04
💻 computer science

ECORE: Energy-Conscious Optimized Routing for Deep Learning Models at the Edge

تقترح الورقة البحثية إطار عمل ECORE، وهو إطار توجيه واعٍ بالطاقة للحوسبة الحافية يقوم بتوجيه مهام معالجة الصور ديناميكيًا إلى أزواج مثالية من الأجهزة والنماذج باستخدام خوارزميات تقدير وجشع مبتكرة، محققًا انخفاضات كبيرة في استهلاك الطاقة وزمن الاستجന്ത مع حد أدنى من فقدان الدقة.

Daghash K. Alqahtani, Maria A. Rodriguez, Muhammad Aamir Cheema, Hamid Rezatofighi, Adel N. Toosi2026-02-04