🤖 AI

TARAC: Mitigating Hallucination in LVLMs via Temporal Attention Real-time Accumulative Connection

يُعد TARAC إطار عمل مبتكرًا لا يتطلب تدريبًا، يعمل على الحد من الهلوسة في النماذج اللغوية البصرية الكبيرة من خلال التجميع الديناميكي وإعادة حقن الانتباه البصري التاريخي للحفاظ على التأسيس، محققًا تحسينات ملحوظة في الأداء مع عبء حسابي ضئيل أثناء الاستدلال.

Lei Jiang, Chunzhao Xie, Tongxuan Liu, Yuting Zeng, jinrong Guo, Yunheng Shen, Weizhe Huang, Jing Li, Xiaohua Xu2026-04-14
🤖 AI

Auto-regressive transformation for image alignment

تقترح الورقة البحثية التحويل ذاتي الانحدار (ART)، وهي طريقة مبتكرة تعمل على تحسين محاذاة الصور بشكل تكراري من خلال مسار هرمي ذاتي الانحدار مع توجيه عبر الانتباه المتقاطع لتحقيق دقة فائقة في السيناريوهات الصعبة التي تتضمن مناطق شحيحة الميزات، واختلافات هائلة في المقاييس، وتشوّهات كبيرة.

Kanggeon Lee, Soochahn Lee, Kyoung Mu Lee2026-04-14
🤖 AI

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

تقدم هذه الورقة البحثية "Variational VQA"، وهو نهج بايزي تبايني يعزز بشكل كبير من موثوقية وقدرات التنبؤ الانتقائي لنماذج الرؤية واللغة الكبيرة من خلال تحسين المعايرة والحد من الهلوسة، لا سيما في السيناريوهات ذات التسامح المنخفض مع الخطأ.

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan, Marcus Rohrbach2026-04-14
💬 NLP

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

تقدم هذه الورقة DeceptionDecoded، وهو معيار واسع النطاق وإطار عمل محاكاة موجه بالنية، صُمم لتقييم وتحسين قدرة نماذج الرؤية واللغة على اكتشاف نية المبدع المضللة في الأخبار متعددة الوسائط، مما يعالج اعتمادها الحالي على الإشارات السطحية ويعزز متانتها في حوكمة المعلومات المضللة.

Jiaying Wu, Fanxiao Li, Zihang Fu, Min-Yen Kan, Bryan Hooi2026-04-14
🤖 AI

Learning World Models for Interactive Video Generation

تتناول هذه الورقة تحديات الأخطاء التراكمية وعدم كفاية الذاكرة في توليد الفيديو ذاتي الانحدار من خلال اقتراح تقنية "توليد الفيديو المعزز بالاسترجاع" (VRAG) مع تكييف صريح للحالة العالمية، مما يعزز بشكل كبير من التماسك الزماني والمكاني وقدرات نمذجة العالم التفاعلية.

Taiye Chen, Xun Hu, Zihan Ding, Chi Jin2026-04-14
🤖 AI

Progressive Multimodal Interaction Network for Reliable Quantification of Fish Feeding Intensity in Aquaculture

تقترح هذه الورقة شبكة تفاعل متعددة الوسائط تدريجية (PMIN) تدمج بيانات الصور والصوت وموجات المياه من خلال استخراج الميزات الموحد، وآليات الانتباه عبر الوسائط، والاستدلال التكيفي للأدلة لتحقيق قياس دقيق للغاية وقوي لكثافة تغذية الأسماك من أجل الاستزراع المائي الدقيق.

Shulong Zhang, Mingyuan Yao, Jiayin Zhao, Daoliang Li, Yingyi Chen, Haihua Wang2026-04-14
💬 NLP

VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites

تقدم هذه الورقة VisText-Mosquito، وهو عبارة عن مجموعة بيانات وإطار عمل موحد متعدد الوسائط يدمج بين الكشف البصري، والتقسيم، والتفسير النصي لتمكين التحديد والتحليل الاستباقي المدفوع بالذكاء الاصطناعي لمواقع تكاثر البعوض من أجل الوقاية من الأمراض.

Md. Adnanul Islam, Md. Faiyaz Abdullah Sayeedi, Md. Asaduzzaman Shuvo, Shahanur Rahman Bappy, Md Asiful Islam, Swakkhar (…)2026-04-14
🤖 machine learning

PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving

يُعد PRIX إطار عمل للقيادة الذاتية من طرف إلى طرف، خفيف الوزن ويعتمد على الكاميرا فقط، حيث يستخدم محول إعادة معايرة مدرك للسياق ورأس تخطيط توليدي للتنبؤ بالمسارات الآمنة مباشرة من البكسلات الخام، محققاً أداءً رائداً في معايير NavSim وnuScenes مع تقليل حجم النموذج وتكاليف الاستدلال بشكل كبير مقارنة بالنهج المعتمدة على ليدار (LiDAR) أو نهج رؤية منظور العرض العلوي (BEV).

Maciej K. Wozniak, Lianhang Liu, Yixi Cai, Patric Jensfelt2026-04-14
🤖 AI

AdvDINO: Domain-Adversarial Self-Supervised Representation Learning for Spatial Proteomics

يُعد AdvDINO إطار عمل للتعلم الذاتي القائم على التنافس بين النطاقات، حيث يدمج طبقة عكس التدرج في بنية DINOv2 لتعلم تمثيلات قوية وثابتة عبر النطاقات من صور الشرائح الكاملة المناعية متعددة الألوان، مما يؤدي بفعالية إلى التخفيف من آثار الدفعات وتحسين التنبؤ بالبقاء على قيد الحياة في مجموعات سرطان الرئة والثدي.

Stella Su, Marc Harary, Scott J. Rodig, William Lotter2026-04-14
🤖 machine learning

Delta Rectified Flow Sampling for Text-to-Image Editing

تقترح الورقة البحثية "أخذ عينات التدفق المصحح دلتا" (Delta Rectified Flow Sampling - DRFS)، وهو إطار عمل جديد للتحرير من نص إلى صورة لا يتطلب عملية عكس (inversion-free)، يعمل على تخفيف آثار التنعيم المفرط عبر نمذجة الفروقات في حقل السرعة بشكل صريح وإدخال حد إزاحة يعتمد على الوقت، مما يوحد بين نهجي التحسين (optimization) وتحرير المعادلات التفاضلية العادية (ODE editing) مع تحقيق جودة وقدرة تحكم فائقتين في اختبار PIE المرجعي.

Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang2026-04-14