🤖 machine learning

Hierarchical Concept Embedding & Pursuit for Interpretable Image Classification

تقترح هذه الورقة إطار عمل "تضمين المفاهيم والسعي الهرمي" (HCEP)، وهو إطار عمل يستفيد من الترميز المتناثر الهرمي على تضمينات نماذج الرؤية واللغة لاستعادة تسلسلات المفاهيم الهرمية، مما يحقق تصنيفاً للصور أكثر موثوقية وقابلية للتفسير مع تحسين الدقة والاستدعاء مقارنة بالنماذج المرجعية غير الهرمية.

Nghia Nguyen, Tianjiao Ding, René Vidal2026-03-16
💻 computer science

LongStream: Long-Sequence Streaming Autoregressive Visual Geometry

يُعد LongStream نموذجاً هندسياً بصرياً مبتكراً للبث يعتمد على فك الارتباط بالمقياس، ويحقق إعادة بناء ثلاثية الأبعاد مستقرة وبمقياس متري عبر تسلسلات فائقة الطول من خلال التنبؤ بوضعيات الإطارات الرئيسية النسبية، وتوظيف تعلم المقياس المتعامد لمنع الانجراف، واستخدام تدريب متسق مع الذاكرة المخبئية للتخفيف من تحيزات الانتباه في نماذج المحولات (Transformers).

Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang2026-03-16
💻 computer science

Train Short, Inference Long: Training-free Horizon Extension for Autoregressive Video Generation

يُعد FLEX إطار عمل للاستنتاج لا يتطلب تدريباً، يعمل على تمديد آفاق توليد الفيديو ذات التوليد الذاتي من خلال معالجة التحيز الطيفي ومحدودية أخذ عينات الضجيج عبر تعديل RoPE المدرك للتردد، وأخذ عينات الضجيج متعدد الأطوار، ومصرف انتباه مخصص للاستنتاج فقط، مما يتيح تخليق فيديو عالي الجودة لفترات طويلة دون الحاجة إلى تدريب إضافي للنموذج.

Jia Li, Xiaomeng Fu, Xurui Peng, Weifeng Chen, Youwei Zheng, Tianyu Zhao, Jiexi Wang, Fangmin Chen, Xing Wang, Hayden Kw (…)2026-03-16
🤖 AI

BitDance: Scaling Autoregressive Generative Models with Binary Tokens

تُعد BitDance مولداً للصور ذاتي الانحدار وقابلاً للتوسع، حيث يتنبأ برموز ثنائية عالية الإنتروبيا باستخدام رأس انتشار ثنائي وطريقة فك تشفير انتشار "الرقعة التالية" المبتكرة، محققاً درجات FID رائدة في ImageNet مع تقليل عدد المعلمات ووقت الاستدلال بشكل كبير مقارنة بالنماذج الحالية.

Yuang Ai, Jiaming Han, Shaobin Zhuang, Weijia Mao, Xuefeng Hu, Ziyan Yang, Zhenheng Yang, Yali Wang, Huaibo Huang, Xiang (…)2026-03-16
💻 computer science

GA-Drive: Geometry-Appearance Decoupled Modeling for Free-viewpoint Driving Scene Generation

يُعد GA-Drive إطار عمل محاكاة مبتكرًا يولد مشاهد قيادة ذات منظور حر، عالية الدقة وقابلة للتعديل، من خلال فصل هندسة المشهد عن مظهره، وذلك باستخدام توليف المنظور الزائف القائم على الهندسة متبوعًا بنموذج انتشار فيديو للرندرة الواقعية للغاية.

Hao Zhang, Lue Fan, Qitai Wang, Wenbo Li, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li2026-03-16
💻 computer science

TIRAuxCloud: A Thermal Infrared Dataset for Day and Night Cloud Detection

تقدم هذه الورقة TIRAuxCloud، وهي مجموعة بيانات متعددة الأنماط شاملة تجمع بين البيانات بالأشعة تحت الحمراء الحرارية، والبيانات البصرية، والبيانات المساعدة من Landsat وVIIRS لمعالجة تحديات الكشف عن السحب وتجزئتها بدقة على مدار الساعة طوال أيام الأسبوع في مراقبة الأرض.

Alexis Apostolakis, Vasileios Botsos, Niklas Wölki, Andrea Spichtinger, Nikolaos Ioannis Bountos, Ioannis Papoutsis, Pan (…)2026-03-16
💻 computer science

Fourier Angle Alignment for Oriented Object Detection in Remote Sensing

تقترح هذه الورقة البحثية "محاذاة زاوية فوريه" (Fourier Angle Alignment)، وهي طريقة تستخدم تماثل دوران فوريه لمعالجة عدم الاتساق الاتجاهي وتضارب المهام في كشف الكائنات المدوّرة في الاستشعار عن بعد من خلال وحدتين مبتكرتين، هما FAAFusion وFAA Head، محققةً أداءً هو الأفضل في فئتها على معايير DOTA وHRSC2016.

Changyu Gu, Linwei Chen, Lin Gu, Ying Fu2026-03-16
💻 computer science

AHAP: Reconstructing Arbitrary Humans from Arbitrary Perspectives with Geometric Priors

يُعد AHAP إطار عمل بنظام التغذية الأمامية يعيد بناء البشر ثلاثيي الأبعاد من منظورات متعددة المشاهد عشوائية دون الحاجة إلى معايرة الكاميرا، وذلك عبر دمج الهندسة متعددة المشاهد، والربط الهوياتي عبر المشاهد، والتنبؤ بنموذج SMPL الموجه بالرأس بشكل فعال لتحقيق دقة التحديد واتساق الوضعية.

Xiaozhen Qiao, Wenjia Wang, Zhiyuan Zhao, Jiacheng Sun, Ping Luo, Hongyuan Zhang, Xuelong Li2026-03-16
🤖 AI

SvfEye: A Semantic-Visual Fusion Framework with Multi-Scale Visual Context for Multimodal Reasoning

يُعد SvfEye إطار عمل خالٍ من التدريب يعزز الاستدلال متعدد الوسائط عبر دمج القصد الدلالي مع السياق البصري متعدد المقاييس بشكل تكيفي من خلال وحدة قرار قائمة على الثقة وآلية دمج الانتباه الدلالي، مما يؤدي إلى القضاء على الحشو الحسابي غير الضروري وتحسين دقة التحديد مع تحقيق مكاسب كبيرة في الأداء وتسريع عمليات الاستنتاج.

Yuxiang Shen, Hailong Huang, Zhenkun Gao, Xueheng Li, Man Zhou, Chengjun Xie, Haoxuan Che, Xuanhua He, Jie Zhang2026-03-16
💻 computer science

Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer

تقدم هذه الورقة بحث FlexiMMT، وهو أول إطار عمل ضمني لتحويل الصور إلى فيديو يتيح نقلًا دقيقًا للأجسام المتعددة والحركات المتعددة من خلال توظيف انتباه القناع المنفصل للحركة ونشر القناع المتمايز لمعالجة تشابك الحركة بين الأجسام بفعالية.

Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang2026-03-16