🤖 machine learning

Leveraging Multi-Temporal Sentinel 1 and 2 Satellite Data for Leaf Area Index Estimation With Deep Learning

تقترح هذه الورقة إطار عمل جديد للتعلم العميق يدمج بيانات الأقمار الصناعية Sentinel-1 وSentinel-2 متعددة الفترات الزمنية باستخدام وحدات U-Net سابقة التدريب وفك تشفير مدرك للموسمية لتحقيق تقدير دقيق للغاية لمؤشر مساحة الأوراق على مستوى البكسل بجذر متوسط مربع خطأ (RMSE) قدره 0.06 ومعامل تحديد (R²) قدره 0.93.

Clement Wang, Antoine Debouchage, Valentin Goldité, Aurélien Wery, Jules Salzinger2026-05-22
💻 computer science

Label tree semantic losses for rich multi-class medical image segmentation

تقترح هذه الورقة دالتي فقدان دلالي جديدتين تعتمدان على الأشجار وتستفيدان من هياكل التسمية الهرمية لتحسين تقسيم الصور الطبية متعدد الفئات، مما يظهر مكاسب أداء ثابتة مقارنة بالنماذج المرجعية في كل من مهام تقسيم الدماغ الكاملة الخاضعة للإشراف الكامل ومهام التصوير الطيفي الفائق للجراحة العصبية ذات التوسيم المتناثر.

Junwen Wang, Oscar MacCormac, William Rochford, Aaron Kujawa, Jonathan Shapey, Tom Vercauteren2026-05-22
💻 computer science

InfVSR: Breaking Length Limits of Generic Video Super-Resolution

تقدم الورقة البحثية InfVSR، وهو إطار عمل انتشار ذاتي الانحدار بخطوة واحدة، يعيد صياغة عملية تعزيز دقة الفيديو (video super-resolution) لتمكين الاستدلال التدفيقي عالي الكفاءة لمقاطع الفيديو ذات الأطوال التعسفية بجودة تضاهي أحدث المعايير واتساق زمني، محققاً تسارعاً يصل إلى 58 ضعفاً مقارنة بالطرق الحالية.

Ziqing Zhang, Kai Liu, Zheng Chen, Xi Li, Yucong Chen, Bingnan Duan, Linghe Kong, Yulun Zhang2026-05-22
💻 computer science

Towards Selection of Large Multimodal Models as Engines for Burned-in Protected Health Information Detection in Medical Images

تقوم هذه الورقة البحثية بقياس أداء ثلاثة من النماذج اللغوية الكبيرة متعددة الوسائط (GPT-4o، وGemini 2.5 Flash، وQwen 2.5 7B) في اكتشاف معلومات الصحة المحمية في الصور الطبية، حيث وجدت أنها تتفوق على تقنيات التعرف الضوئي على الحروف التقليدية في استخراج النصوص، إلا أن مكاسب دقة الاكتشاف الإجمالية لديها تكون أكثر أهمية لأنماط الأختام المعقدة بدلاً من النصوص الواضحة القابلة للقراءة، مما يؤدي إلى توصيات اختيار مخصصة واستراتيجية نشر قابلة للتوسع.

Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga2026-05-22
💻 computer science

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

يُعد LongVT إطار عمل وكيلًا متكاملًا يعزز الاستدلال في الفيديوهات الطويلة من خلال الاستفادة من استدعاء الأدوات الأصيل لتنفيذ عملية "سلسلة تفكير متعددة الوسائط عبر الأدوات" من العام إلى الخاص، مدعومًا بمجموعة بيانات ضخمة تم تنسيقها حديثًا (VideoSIAH) واستراتيجية تدريب ثلاثية المراحل تتفوق بشكل كبير على النماذج المرجعية الحالية.

Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan L (…)2026-05-22
💬 NLP

Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval

تقدم الورقة البحثية إطار عمل "تقليم المرساة الهيكلية" (SAP)، وهو إطار عمل لا يتطلب تدريباً ولا يعتمد على الاستعلام، يحقق ضغطاً عالياً في استرجاع الوثائق المرئية من خلال تحديد والحفاظ على "هضبة هيكلية" مستقرة ضمن الطبقات المتوسطة للنموذج، مما يحافظ على أكثر من 90% من أداء الاسترجاع مع تقليم أكثر من 90% من الرموز المرئية دون الحاجة إلى ضبط خاص لكل نموذج.

Zhuchenyang Liu, Ziyu Hu, Yao Zhang, Yu Xiao2026-05-22
💻 computer science

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

يُعد Video-o3 إطار عمل مبتكر للاستدلال متعدد الخطوات في الفيديوهات الطويلة، حيث يتغلب على قيود أخذ العينات الموحدة من خلال تمكين البحث التكراري الأصيل عن الأدلة عبر قناع انتباه مفكك المهام ومكافأة موجهة للمسار قابلة للتحقق، محققاً أداءً هو الأفضل في فئته على اختبارات معيارية مثل MLVU وVideo-Holmes.

Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Ti (…)2026-05-22
💻 computer science

Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation

تقدم هذه الورقة "Causal Forcing"، وهو إطار عمل جديد للتقطير يعالج عدم التوافق الهيكلي بين المعلمين ذوي الانتشار ثنائي الاتجاه والطلاب لتوليد الفيديو ذاتي الانحدار من خلال توظيف معلم ذاتي الانحدار لتهيئة المعادلات التفاضلية العادية (ODE)، مما يحقق توليد فيديو تفاعلياً في الوقت الفعلي وبأداء رائد مع تحسينات كبيرة في الجودة الديناميكية، والمكافأة البصرية، واتباع التعليمات.

Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, Jun Zhu2026-05-22
💬 NLP

When Shared Knowledge Hurts: Spectral Over-Accumulation in Model Merging

تقدم هذه الورقة البحثية "معايرة القيم المفردة" (SVC)، وهي طريقة لا تتطلب تدريباً تعمل على تخفيف تدهور الأداء الناتج عن التراكم المفرط للمعرفة الطيفية المشتركة في دمج النماذج، وذلك من خلال قياس تداخل الفضاءات الجزئية وإعادة تحجيم القيم المفردة المتضخمة، مما يحقق نتائج هي الأفضل حالياً عبر معايير الرؤية واللغة.

Yayuan Li, Ze Peng, Jian Zhang, Jintao Guo, Yue Duan, Yinghuan Shi2026-05-22
🔢 mathematics

When Simultaneous Localization and Mapping Meets Wireless Communications: A Survey

تستعرض هذه الورقة التكامل ثنائي الاتجاه بين التوطين ورسم الخرائط الآني (SLAM) والاتصالات اللاسلكية، مع تسليط الضوء على كيفية استفادة نظام التوطين ورسم الخرائط الآني البصري من بيانات الترددات الراديوية لحل مشكلة تحديد المقياس، بينما تستفيد الشبكات اللاسلكية من قياس المسافات البصري، لتحدد في النهاية التقنيات الحالية والتحديات والإمكانات المستقبلية لأنظمة الاتصالات والتوطين ورسم الخرائط الآني المشتركة.

Konstantinos Gounis, Sotiris A. Tegos, Dimitrios Tyrovolas, Panagiotis D. Diamantoulakis, George K. Karagiannidis2026-05-22