💻 computer science

GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?

تقدم هذه الورقة GenVideoLens، وهو معيار مرجعي دقيق يتكون من 500 فيديو مشروح عبر 15 بُعداً من أبعاد الأصالة، ليكشف أن نماذج الرؤية واللغة الكبيرة (LVLMs) تؤدي بشكل جيد في الإشارات الإدراكية، لكنها تعاني بشكل كبير في الاستنتاج البصري والفيزيائي والزمني في كشف الفيديو المُنشأ بواسطة الذكاء الاصطناعي.

Yueying Zou, Pei Pei Li, Zekun Li, Xinyu Guo, Xing Cui, Huaibo Huang, Ran He2026-03-20
💻 computer science

GEAR: Geography-knowledge Enhanced Analog Recognition Framework in Extreme Environments

تقدم الورقة البحثية إطار عمل GEAR، وهو مسار معالجة ثلاثي المراحل يجمع بين المعرفة الجغرافية والتعلم العميق لتحديد النظائر الطبوغرافية لخندق ماريانا في هضبة تشينغهاي-التبت بكفاءة، محققاً دقة هي الأفضل في هذا المجال وكاشفاً عن ارتباطات جوهرية مع البيانات البيولوجية لدعم أبحاث أعماق البحار المستقبلية.

Zelin Liu, Bocheng Li, Yuling Zhou, Xuanting Li, Yixuan Yang, Jing Wang, Weishu Zhao, Xiaofeng Gao2026-03-20
🤖 machine learning

SwiftGS: Episodic Priors for Immediate Satellite Surface Recovery

يُعد SwiftGS نظاماً متعلماً فوقياً يتيح إعادة بناء الأسطح ثلاثية الأبعاد بسرعة وبشكل صفري من صور الأقمار الصناعية متعددة التواريخ عبر التنبؤ بتمثيلات هجينة لـ "غاوس" ودالة المسافة الموقعة (SDF) من خلال التدريب الحقبي، مما يلغي الحاجة إلى عملية تحسين مكلفة لكل مشهد مع الحفاظ على دقة عالية واتساق في الرؤية.

Rong Fu, Jiekai Wu, Haiyun Wei, Xiaowen Ma, Shiyin Lin, Kangan Qian, Chuang Liu, Jianyuan Ni, Simon James Fong2026-03-20
💻 computer science

Training-Free Sparse Attention for Fast Video Generation via Offline Layer-Wise Sparsity Profiling and Online Bidirectional Co-Clustering

تقدم هذه الورقة البحثية SVOO، وهو إطار عمل لا يتطلب تدريباً لتسريع توليد الفيديو في نماذج "ديفيوجن ترانسفورمرز" (Diffusion Transformers)، والذي يتغلب على القيود الحالية من خلال الاستفادة من التنميط الطبقي غير المتصل عبر الإنترنت والتجميع المشترك ثنائي الاتجاه عبر الإنترنت لتحقيق توازن فائق بين الجودة وسرعة التنفيذ.

Jiayi Luo, Jiayu Chen, Jiankun Wang, Cong Wang, Hanxin Zhu, Qingyun Sun, Chen Gao, Zhibo Chen, Jianxin Li2026-03-20
💻 computer science

PhysVideo: Physically Plausible Video Generation with Cross-View Geometry Guidance

يقدم PhysVideo إطار عمل ثنائي المراحل يستفيد من مجموعة بيانات متعددة المشاهد تم إنشاؤها حديثًا (PhysMV) وتوجيه هندسي عبر المشاهد لتوليد فيديوهات معقولة فيزيائيًا ومتماسكة مكانيًا، وذلك عن طريق تخليق مقدمات صور متعامدة مدركة للفيزياء أولاً ثم دمجها مع سياقات الخلفية.

Cong Wang, Hanxin Zhu, Xiao Tang, Jiayi Luo, Xin Jin, Long Chen, Fei-Yue Wang, Zhibo Chen2026-03-20
💻 computer science

Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA

تقدم هذه الورقة "Click-to-Ask"، وهو مساعد بث مباشر مدعوم بالذكاء الاصطناعي يجمع بين المعالجة متعددة الوسائط غير المتصلة بالإنترنت لإنشاء نصوص ترويجية متوافقة، وبين وحدة تفاعلية عبر الإنترنت تمكن مقدمي البث من معالجة استفسارات المشاهدين في الوقت الفعلي بكفاءة، مما يعزز التفاعل والكفاءة التشغيلية في التجارة الإلكترونية.

Ruizhi Yu, Keyang Zhong, Peng Liu, Qi Wu, Haoran Zhang, Yanhao Zhang, Chen Chen, Haonan Lu2026-03-20
🤖 AI

Multiscale Switch for Semi-Supervised and Contrastive Learning in Medical Ultrasound Image Segmentation

تقترح هذه الورقة البحثية "Switch"، وهو إطار عمل جديد للتعلم شبه المُشرف لتقسيم صور الموجات فوق الصوتية الطبية، يدمج استراتيجية "التبديل متعدد المقاييس" (Multiscale Switch) لضمان تغطية مكانية موحدة، واستراتيجية "التبديل في نطاق التردد" (Frequency Domain Switch) مع التعلم التبايني من أجل تمثيل ميزات قوي، محققاً أداءً هو الأفضل في فئته عبر ست مجموعات بيانات متنوعة مع كفاءة عالية في عدد المعلمات حتى في ظل الندرة الشديدة للبيانات.

Jingguo Qu, Xinyang Han, Yao Pu, Man-Lik Chui, Simon Takadiyi Gunda, Ziman Chen, Jing Qin, Ann Dorothy King, Winnie Chiu (…)2026-03-20
💻 computer science

Towards High-Quality Image Segmentation: Improving Topology Accuracy by Penalizing Neighbor Pixels

تقدم الورقة البحثية طريقة SCNP، وهي طريقة فعالة ومتعددة الاستخدامات تعزز دقة الطوبولوجيا في تقسيم الصور من خلال معاقبة لوجيتات البكسل (pixel logits) بناءً على جيرانها سيئي التصنيف، مما يظهر أداءً محسناً عبر مجموعات بيانات وأطر عمل متنوعة دون التكاليف الحسابية أو القيود المورفولوجية للمنهجيات السابقة.

Juan Miguel Valverde, Dim P. Papadopoulos, Rasmus Larsen, Anders Bjorholm Dahl2026-03-20
💻 computer science

EdgeCrafter: Compact ViTs for Edge Dense Prediction via Task-Specialized Distillation

يقدم EdgeCrafter إطار عمل موحداً ومدمجاً لنموذج المحولات الرؤيوية (Vision Transformer) يستفيد من التقطير المتخصص للمهام والتصميم المدرك للحواف لتمكين التنبؤ الكثيف عالي الأداء (بما في ذلك الكشف، والتقطيع، وتقدير الوضعية) على الأجهزة ذات الموارد المحدودة، مما يغلق بفعالية فجوة الدقة والكفاءة بين نماذج المحولات الرؤيوية والمعماريات التقليدية القائمة على الشبكات العصبية الالتفافية (CNN).

Longfei Liu, Yongjie Hou, Yang Li, Qirui Wang, Youyang Sha, Yongjun Yu, Yinzhi Wang, Peizhe Ru, Xuanlong Yu, Xi Shen2026-03-20
💻 computer science

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

تقترح الورقة البحثية 6Bit-Diffusion، وهو إطار عمل للكمية مختلطة الدقة أثناء الاستدلال يقوم بتخصيص عرض النطاق الترددي لـ NVFP4 وINT8 ديناميكيًا بناءً على استقرار الطبقة ويستخدم ذاكرة تخزين مؤقت للفروق الزمنية (Temporal Delta Cache) لتخطي الحسابات المتكررة، مما يحقق تقليلاً كبيراً في الذاكرة وتسريعاً لنماذج محولات انتشار الفيديو (Video Diffusion Transformers) دون المساس بجودة التوليد.

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu2026-03-20