💻 computer science

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

يُعد VANE إطار عمل موثوقاً للتدريب في وقت الاختبار لنماذج الرؤية واللغة والعمل، حيث يقوم بتكييف السياسات بشكل انتقائي عبر عزل التحديثات المرشحة وعدم اعتمادها إلا بعد التحقق من نجاحها من خلال التنبؤ بالتمثيل البصري المستقبلي، مما يؤدي إلى تحسين أداء التلاعب في الحلقة المغلقة.

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren2026-08-11
🧬 biology

Flow-based conditional cardiac anatomy generation for virtual cohorts

تقدم هذه الورقة البحثية CAN-FLOW، وهو إطار عمل تدفق تطبيع شرطي مكون من خطوتين يتفوق على المشفرات التلقائية المتغيرة الشرطية الموجودة من خلال توليد تشريحات قلبية بطينية واقعية مشروطة بالبيانات الوصفية من بيانات UK Biobank لتسهيل إنشاء مجموعات افتراضية متنوعة للبحوث السريرية.

Konstantinos Kevopoulos, Beatrice Moscoloni, Benjamin Alheit, Cameron Beeche, Julio A. Chirinos, Alexander Heinlein, Mat (…)2026-08-11
🤖 AI

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

تُعد RecoverFly إطار عمل للتدريب اللاحق يعتمد على التعلم المعزز المدرك للفشل، حيث يعمل على تعزيز الملاحة البصرية-اللغوية للطائرات بدون طيار من طرف إلى طرف عبر تكييف التعلم المعزز على مستوى الرمز (token-level)، وإعادة زيارة حالات الفشل، وتوظيف منهج تعليمي مع التنظيم لتحقيق أداء فائق وقدرة عالية على التعميم في معيار TravelUAV.

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian2026-08-11
🤖 AI

Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance

تقدم هذه الورقة البحثية MGN-AIR، وهو إطار عمل مبتكر وشامل لترميم الصور يستخدم توجيهاً متعدد الوسائط على مستوى البكسل باستخدام المحفزات النصية والبصرية لتحقيق استعادة دقيقة وتكيفية للصور المتدهورة بفعل أنواع ودرجات متفاوتة من التلف، مما يتفوق بشكل كبير على أساليب الترميم الموحدة الحالية.

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng2026-08-11
💻 computer science

SwissCrop25: A National Multi-Year Benchmark for Operational Crop Mapping

تقدم الورقة البحثية SwissCrop25، وهي مجموعة بيانات مرجعية وطنية النطاق ومتعددة السنوات تمتد من 2019 إلى 2025، وتتميز بتصنيفات دقيقة وبروتوكول تقييم يعتمد على استبعاد سنة واحدة في كل مرة، مما يكشف أن النماذج الزمكانية المتخصصة في المجال مثل TSViT تتفوق على النماذج التأسيسية في رسم خرائط المحاصيل التشغيلية، مع تسليط الضوء على أهمية البيانات الفينولوجية المستمدة من درجات الحرارة والمقايضات في الأداء خلال الموسم.

Thomas Lauber, Mehmet Ozgur Turkoglu, Sélène Ledain, Helge Aasen2026-08-11
🤖 machine learning

XFeat Revisited: Reproducibility and Evaluation of a Lightweight Image Matcher

تقدم هذه الورقة دراسة شاملة لإعادة إنتاج مطابق الصور خفيف الوزن XFeat، مؤكدةً توازنه القوي بين الدقة والكفاءة من خلال إعادة التنفيذ ودراسات الاستئصال، مع تحديد الفروق المعمارية الدقيقة والقيود في الأداء في سيناريوهات تعدد الوسائط وخارج نطاق التوزيع.

Lazar {\DJ}oković, Aimee Lin2026-08-11
💻 computer science

TriView-YOLO: Early Multi-View Fusion for Ground Penetrating Radar Cavity Detection in Soft, High-Water-Content Soils

تقدم هذه الورقة TriView-YOLO، وهو كاشف متعدد الرؤى يعتمد على YOLOv12، يقوم بدمج رؤى الرادار المخترق للأرض (GPR) الطولية والأفقية والمقطعية لتحقيق كشف آلي عن الفجوات في التربة الصعبة ذات المحتوى المائي العالي والناعمة حيث تعاني الطرق التقليدية بسبب تضاؤل الإشارة.

Suphawut Thawinutchokaudom, Sompote Youwai, Warat Kongkitkul, Mitsumasa Yamashina, Jose M. D. S. Rodrigues Neto, Jun Shi (…)2026-08-11
💻 computer science

Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

لمعالجة أوجه القصور في مجموعات البيانات الحالية في توليد الصور من الصوت، تقدم هذه الورقة A2I-Set، وهي مجموعة بيانات ثلاثية الأنماط عالية الجودة وواسعة النطاق، وتقترح AudioCanvas، وهو نموذج مضبوط بدقة يحقق تعبيرًا بصريًا وتوافقًا عابرًا للأنماط يتفوق على النهج الحالية.

Dongxu Ge, Shansong Liu, Cheng Gong, Xiao-Lei Zhang, Chi Zhang, Xuelong Li2026-08-11
💻 computer science

Towards Collaborative Joint Perception and Prediction: Framework, Baseline Evaluation, and Deployment Perspectives

تقدم هذه الورقة إطار عمل للإدراك والتنبؤ المشترك التعاوني (Co-P&P) الذي يوحد بين الإدراك والتنبؤ بالحركة للتخفيف من الأخطاء والانسدادات، مبرهنةً من خلال التقييمات المرجعية ونموذج أولي مضغوط عصبياً أن الدمج على مستوى التنبؤ يؤدي أداءً أقل مقارنة بدمج الكشف أو التتبع مع تحقيق كفاءة كبيرة في عرض النطاق الترددي.

Lei Wan, Hannan Ejaz Keen, Alexey Vinel2026-08-11
🤖 AI

From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation

تقترح هذه الورقة إطار عمل موحداً من الدلالة إلى القرار للملاحة البصرية اللغوية للطائرات بدون طيار، يدمج بين التعزيز الدلالي القائم على التعليمات، والتجميع الزمني الديناميكي المدرك للارتباط، وتحسين القرار المدرك للطوبولوجيا، لتحقيق أداء رائد في معايير AerialVLN وOpenFly.

Zeyuan Ma, Jiaxin Chen, Di Huang2026-08-11