💻 computer science

SPKLIP: Aligning Spike Video Streams with Natural Language

تقدم الورقة البحثية SPKLIP، وهي أول بنية مصممة لمحاذاة تدفقات فيديو النبضات المتفرقة مع اللغة الطبيعية من خلال استخراج الميزات الهرمي والتعلم التبايني، محققةً أداءً رائدًا في التعلم بلقطات قليلة وكفاءة طاقة محسنة للنشر العصبي.

Yongchang Gao, Meiling Jin, Zhaofei Yu, Tiejun Huang, Guozhang Chen2026-03-24
💻 computer science

Go Beyond Earth: Understanding Human Actions and Scenes in Microgravity Environments

تقدم هذه الورقة MicroG-4M، وهي أول مجموعة بيانات مرجعية تضم أكثر من 4,700 مقطع فيديو من مهمات فضائية حقيقية ومحاكاة لمعالجة الفجوة الحرجة في فهم الفيديو لبيئات الجاذبية الصغرى من خلال دعم مهام التعرف على الأفعال، وكتابة الشرح للفيديو، والإجابة على الأسئلة البصرية.

Di Wen, Lei Qi, Kunyu Peng, Kailun Yang, Fei Teng, Ao Luo, Jia Fu, Yufan Chen, Ruiping Liu, Yitian Shi, M. Saquib Sarfra (…)2026-03-24
🤖 AI

Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative Models

تقدم هذه الورقة SymmFlow، وهو إطار عمل متماثل لتدفق المطابقة (Symmetrical Flow Matching) موحد يتعلم بشكل مشترك التحويلات الأمامية والعكسية لتحقيق أداء رائد في توليد الصور، والتجزئة، والتصنيف ضمن نموذج واحد مع تمكين الاستدلال الفعال في خطوة واحدة.

Francisco Caetano, Christiaan Viviers, Peter H. N. De With, Fons van der Sommen2026-03-24
🤖 AI

Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation

تقدم هذه الورقة HVLFormer، وهو إطار عمل لتقسيم الصور بنظام التعلم شبه المُشرف الذي يستفيد من استعلامات الكائنات النصية الهرمية والمدركة للمجال وتنظيم الاتساق عبر الرؤى لمحاذاة التمثيلات البصرية والنصية من نماذج الرؤية واللغة بفعالية، محققاً أداءً هو الأفضل في مجاله باستخدام أقل من 1% من البيانات المصنفة.

Numair Nadeem, Saeed Anwar, Muhammad Hamza Asad, Abdul Bais2026-03-24
💻 computer science

Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations

تقترح هذه الورقة استراتيجية "Ctrl-Z Sampling"، وهي استراتيجية غير مرتبطة بنموذج محدد تُستخدم أثناء الاستدلال، تعمل ديناميكياً على اكتشاف والهروب من النقاط المثلى المحلية في نماذج الانتشار عبر العودة إلى حالات أكثر ضجيجاً واستكشاف مسارات بديلة فقط عند تحديد ركود في الجودة، مما يؤدي إلى تحسين جودة التوليد عبر مختلف الميزانيات الحسابية.

Shunqi Mao, Wei Guo, Chaoyi Zhang, Jieting Long, Ke Xie, Weidong Cai2026-03-24
💻 computer science

PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

يقدم PoseMaster إطار عمل موحداً أصيلاً ثلاثي الأبعاد يستفيد مباشرة من الهياكل العظمية ثلاثية الأبعاد ومجموعة بيانات ضخمة من نوع "صورة-هيكل عظمي-شبكة" لتحقيق توليد وضعيات ثلاثية الأبعاد بأسلوب فني متفوق ودقيق وقابل للتحريك، متجاوزاً بذلك قيود مسارات العمل التقليدية المتتالية من 2D إلى 3D.

Hongyu Yan, Kunming Luo, Weiyu Li, Kaiyi Zhang, Yixun Liang, Jingwei Huang, Chunchao Guo, Ping Tan2026-03-24
💻 computer science

HUG-VAS: A Hierarchical NURBS-Based Generative Model for Aortic Geometry Synthesis and Controllable Editing

يُعد HUG-VAS إطار عمل توليدي هرمي مبتكر يجمع بين تمثيل NURBS والنمذجة القائمة على الانتشار لتخليق هندسات للأبهر واقعية وجاهزة لمحاكاة ديناميكا الموائع الحسابية (CFD)، وتمكين التحرير الشرطي من نوع "صفر محاولات" (zero-shot) دون الحاجة للتدريب من بيانات تصوير سريرية متفرقة.

Pan Du, Mingqi Xu, Xiaozhi Zhu, Jian-xun Wang2026-03-24
🤖 machine learning

Energy Efficient Exact and Approximate Systolic Array Architecture for Matrix Multiplication

تقترح هذه الورقة بنية مصفوفة انقباضية (systolic array) بحجم 8×8 موفرة للطاقة، تستخدم عناصر معالجة مبتكرة دقيقة وتقريبية (PPC وNPPC) تحقق توفيراً كبيراً في استهلاك الطاقة بنسبة 22% و32% على التوالي، مع الحفاظ على جودة مخرجات عالية لتطبيقات معالجة الصور والرؤية المقاومة للأخطاء مثل تحويل جيب التمام المتقطع (DCT) وكشف الحواف.

Pragun Jaswal, L. Hemanth Krishna, B. Srinivasu2026-03-24
🤖 AI

Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

تقدم الورقة البحثية WorldForge، وهو إطار عمل مبتكر لا يتطلب تدريباً يستفيد من التحسين داخل الخطوة، والتحليل الكامن القائم على التدفق البصري، والتوجيه ثنائي المسار، لتمكين التحكم الدقيق في الكاميرا بصفر محاولات (zero-shot) لتوليد فيديوهات ثلاثية وثنائية الأبعاد عالية الجودة دون الحاجة إلى إعادة تدريب النموذج.

Chenxi Song, Yanming Yang, Tong Zhao, Ruibo Li, Chi Zhang2026-03-24
💻 computer science

Texture Vector-Quantization and Reconstruction Aware Prediction for Generative Super-Resolution

تقترح هذه الورقة البحثية نموذج TVQ&RAP، وهو نموذج توليدي لرفع دقة الصور يحسن نمذجة الأولويات البصرية من خلال إدخال استراتيجية تكميم متجهية مخصصة للقوام وآلية تنبؤ مدركة لإعادة البناء يتم تدريبها باستخدام إشراف على مستوى الصورة لتقديم نتائج واقعية للغاية بتكلفة حوسبية منخفضة.

Qifan Li, Jiale Zou, Jinhua Zhang, Wei Long, Xingyu Zhou, Shuhang Gu2026-03-24