🤖 AI

Integrating Semi-Supervised and Active Learning for Semantic Segmentation

تقترح هذه الورقة إطار عمل هجينًا مبتكرًا يدمج التعلم النشط مع نهج محسّن شبه مُشرف واستخدام وحدة تكرار تلقائي للتسميات المستعارة لتقليل تكاليف التوسيم وتعزيز أداء التجزئة الدلالية من خلال الاستفادة من كل من البيانات المُوسومة المختارة والبيانات غير المُوسمة المُحسّنة عبر المجالات الطبيعية ومجالات الاستشعار عن بعد.

Wanli Ma, Oktay Karakus, Paul L. Rosin2026-04-14
🤖 AI

AccidentSim: Generating Vehicle Collision Videos with Physically Realistic Collision Trajectories from Real-World Accident Reports

يُعد AccidentSim إطار عمل مبتكرًا يُنشئ مقاطع فيديو واقعية فيزيائيًا لاصطدامات المركبات من خلال استخراج الأدلة الفيزيائية من تقارير الحوادث الواقعية لمحاكاة مسارات ما بعد الاصطدام بدقة، والتي يتم بعد ذلك رندرتها إلى مقاطع فيديو عالية الجودة باستخدام حقول الإشعاع العصبي (Neural Radiance Fields).

Xiangwen Zhang, Qian Zhang, Longfei Han, Qiang Qu, Xiaoming Chen, Weidong Cai2026-04-14
🤖 AI

TARAC: Mitigating Hallucination in LVLMs via Temporal Attention Real-time Accumulative Connection

يُعد TARAC إطار عمل مبتكرًا لا يتطلب تدريبًا، يعمل على الحد من الهلوسة في النماذج اللغوية البصرية الكبيرة من خلال التجميع الديناميكي وإعادة حقن الانتباه البصري التاريخي للحفاظ على التأسيس، محققًا تحسينات ملحوظة في الأداء مع عبء حسابي ضئيل أثناء الاستدلال.

Lei Jiang, Chunzhao Xie, Tongxuan Liu, Yuting Zeng, jinrong Guo, Yunheng Shen, Weizhe Huang, Jing Li, Xiaohua Xu2026-04-14
🤖 AI

Auto-regressive transformation for image alignment

تقترح الورقة البحثية التحويل ذاتي الانحدار (ART)، وهي طريقة مبتكرة تعمل على تحسين محاذاة الصور بشكل تكراري من خلال مسار هرمي ذاتي الانحدار مع توجيه عبر الانتباه المتقاطع لتحقيق دقة فائقة في السيناريوهات الصعبة التي تتضمن مناطق شحيحة الميزات، واختلافات هائلة في المقاييس، وتشوّهات كبيرة.

Kanggeon Lee, Soochahn Lee, Kyoung Mu Lee2026-04-14
🤖 AI

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

تقدم هذه الورقة البحثية "Variational VQA"، وهو نهج بايزي تبايني يعزز بشكل كبير من موثوقية وقدرات التنبؤ الانتقائي لنماذج الرؤية واللغة الكبيرة من خلال تحسين المعايرة والحد من الهلوسة، لا سيما في السيناريوهات ذات التسامح المنخفض مع الخطأ.

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan, Marcus Rohrbach2026-04-14
💬 NLP

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

تقدم هذه الورقة DeceptionDecoded، وهو معيار واسع النطاق وإطار عمل محاكاة موجه بالنية، صُمم لتقييم وتحسين قدرة نماذج الرؤية واللغة على اكتشاف نية المبدع المضللة في الأخبار متعددة الوسائط، مما يعالج اعتمادها الحالي على الإشارات السطحية ويعزز متانتها في حوكمة المعلومات المضللة.

Jiaying Wu, Fanxiao Li, Zihang Fu, Min-Yen Kan, Bryan Hooi2026-04-14
🤖 AI

Learning World Models for Interactive Video Generation

تتناول هذه الورقة تحديات الأخطاء التراكمية وعدم كفاية الذاكرة في توليد الفيديو ذاتي الانحدار من خلال اقتراح تقنية "توليد الفيديو المعزز بالاسترجاع" (VRAG) مع تكييف صريح للحالة العالمية، مما يعزز بشكل كبير من التماسك الزماني والمكاني وقدرات نمذجة العالم التفاعلية.

Taiye Chen, Xun Hu, Zihan Ding, Chi Jin2026-04-14
🤖 AI

Progressive Multimodal Interaction Network for Reliable Quantification of Fish Feeding Intensity in Aquaculture

تقترح هذه الورقة شبكة تفاعل متعددة الوسائط تدريجية (PMIN) تدمج بيانات الصور والصوت وموجات المياه من خلال استخراج الميزات الموحد، وآليات الانتباه عبر الوسائط، والاستدلال التكيفي للأدلة لتحقيق قياس دقيق للغاية وقوي لكثافة تغذية الأسماك من أجل الاستزراع المائي الدقيق.

Shulong Zhang, Mingyuan Yao, Jiayin Zhao, Daoliang Li, Yingyi Chen, Haihua Wang2026-04-14
💬 NLP

VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites

تقدم هذه الورقة VisText-Mosquito، وهو عبارة عن مجموعة بيانات وإطار عمل موحد متعدد الوسائط يدمج بين الكشف البصري، والتقسيم، والتفسير النصي لتمكين التحديد والتحليل الاستباقي المدفوع بالذكاء الاصطناعي لمواقع تكاثر البعوض من أجل الوقاية من الأمراض.

Md. Adnanul Islam, Md. Faiyaz Abdullah Sayeedi, Md. Asaduzzaman Shuvo, Shahanur Rahman Bappy, Md Asiful Islam, Swakkhar (…)2026-04-14
🤖 machine learning

PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving

يُعد PRIX إطار عمل للقيادة الذاتية من طرف إلى طرف، خفيف الوزن ويعتمد على الكاميرا فقط، حيث يستخدم محول إعادة معايرة مدرك للسياق ورأس تخطيط توليدي للتنبؤ بالمسارات الآمنة مباشرة من البكسلات الخام، محققاً أداءً رائداً في معايير NavSim وnuScenes مع تقليل حجم النموذج وتكاليف الاستدلال بشكل كبير مقارنة بالنهج المعتمدة على ليدار (LiDAR) أو نهج رؤية منظور العرض العلوي (BEV).

Maciej K. Wozniak, Lianhang Liu, Yixi Cai, Patric Jensfelt2026-04-14