🤖 AI

ArcVQ-VAE: A Spherical Vector Quantization Framework with ArcCosine Additive Margin

تقترح هذه الورقة البحثية ArcVQ-VAE، وهو إطار عمل جديد للكمية المتجهة يعزز تعلم التمثيل المنفصل في نماذج VQ-VAE من خلال إدخال مسبق للهامش الزاوي الكروي لتقييد متجهات كتاب الشفرات وتحسين قابليتها للانفصال الزاوي، مما يؤدي إلى تحسين استخدام كتاب الشفرات وأداء أفضل في إعادة بناء الصور وتوليدها.

Jaeyung Kim, YoungJoon Yoo2026-05-14
💻 computer science

Qwen-Image-VAE-2.0 Technical Report

تُعد Qwen-Image-VAE-2.0 مجموعة مشفرات تلقائية تباينية عالية الضغط تحقق دقة إعادة بناء رائدة وقدرة فائقة على الانتشار من خلال ابتكارات معمارية مثل الوصلات التخطّية العالمية، والتدريب واسع النطاق باستخدام التصيير الاصطناعي، وتعزيز المحاذاة الدلالية، وتتفوق بشكل خاص في السيناريوهات الغنية بالنصوص.

Zekai Zhang, Deqing Li, Kuan Cao, Yujia Wu, Chenfei Wu, Yu Wu, Liang Peng, Hao Meng, Jiahao Li, Jie Zhang, Kaiyuan Gao (…)2026-05-14
🤖 AI

HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation

تُعد HetScene إطار عمل انتشار ثنائي المراحل يراعي عدم التجانس، يعمل على تحسين توليد المشاهد الداخلية الكثيفة من خلال تفكيك الأشياء إلى فئات أولية وثانوية لإنشاء هيكل هيكلي عالمي مستقر أولاً ثم تخليق تخطيطات سياقية مفصلة، مما يتغلب على قيود الطرق الحالية في نمذجة التبعيات المكانية المعقدة والواقعية الفيزيائية.

Zini Chen, Junming Huang, Rong Zhang, Jiamin Xu, Cheng Peng, Chi Wang, Weiwei Xu2026-05-14
💻 computer science

Sparse Code Uplifting for Efficient 3D Language Gaussian Splatting

تقترح الورقة البحثية SCOUP، وهي طريقة مبتكرة تفصل بين تعلم التمثيل اللغوي وتحسين غاوس ثلاثي الأبعاد (3D Gaussian optimization) عبر الاستفادة من التمثيلات القائمة على كتاب الرموز المتناثر (sparse codebook) المستمدة من مناطق الصور ثنائية الأبعاد ورفعها إلى ثلاثة أبعاد عبر التجميع المتناثر الموزون، مما يحقق تحسينات متزامنة في سرعة التدريب، وكفاءة الذاكرة، وأداء التصيير لفهم المشاهد ثلاثية الأبعاد ذات المفردات المفتوحة.

Lovre Antonio Budimir, Yushi Guan, Steve Ryhner, Sven Lončarić, Nandita Vijaykumar2026-05-14
🔬 optics

DeepFilters: Scattering-Aware Pupil Engineering with Learned Digital Filter Reconstruction for Extended Depth of Field Microscopy

يعد DeepFilters إطار عمل بصري عميق مدرك للتشتت يعمل على تحسين مرشح بؤري وشبكة إعادة بناء رقمية بشكل مشترك باستخدام نموذج أمامي قابل للتفاضل، مما يتيح مجهرية ذات مجال عمق ممتد مع استعادة الإشارة لما يتجاوز 120 ميكرومتر في الأنسجة البيولوجية المشتتة دون الحاجة إلى إعادة التدريب.

Joseph L. Greene, Suet YIng Chan, Qilin Deng, Jeffrey Alido, Alexandra Lion, Guorong Hu, Ruipeng Guo, Tongyu Li, Kivilci (…)2026-05-14
💻 computer science

SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models

يُعد SceneGraphVLM نموذجاً لغوياً بصرياً مدمجاً، تم تدريبه على مرحلتين، يقوم بتوليد رسوم بيانية للمشاهد عالية الدقة من الصور ومقاطع الفيديو بمدة تأخير تبلغ ثانية واحدة تقريباً، وذلك عبر استخدام تنسيق تسلسل TOON كفؤ في استهلاك الرموز (tokens) والتعلم المعزز المدرك للهلوسة.

Vladislav Makarov, Mark Gizetdinov, Dmitry Yudin2026-05-14
💻 computer science

SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification

تقدم هذه الورقة البحثية SpurAudio، وهو معيار جديد لتصنيف الصوت في ظل محدودية العينات (few-shot)، والذي يكشف كيف تعتمد الأساليب المتطورة والنماذج التأسيسية الضخمة غالباً على ارتباطات خلفية زائفة بدلاً من الميزات الأمامية القوية، مما يؤدي إلى تدهور حاد في الأداء عند اختلال هذه الإشارات السياقية.

Giries Abu Ayoub, Morad Tukan, Loay Mualem2026-05-14
🤖 AI

Weakly Supervised Segmentation as Semantic-Based Regularization

تقترح هذه الورقة نهجاً عصبياً رمزياً يدمج المنطق الضبابي القابل للتفاضل مع نموذج "Segment Anything" (SAM) لتوحيد التوصيفات الضعيفة والبديهيات النطاقية كقيود منطقية مستمرة، مما يؤدي إلى توليد تسميات مستعارة عالية الجودة تتيح أداءً في التجزئة تحت الإشراف الضعيف يتجاوز الأساليب المرجعية ذات الإشراف الكامل.

Stefano Colamonaco, Andrei-Bogdan Florea, Jaron Maene2026-05-14
🧬 biology

Characterizing Universal Object Representations Across Vision Models

تحدد هذه الورقة تمثيلات كائنية عالمية وقابلة للتفسير دلالياً عبر 162 نموذجاً بصرياً متنوعاً، وهي مستقلة عن الاختلافات الهيكلية أو التدريبية ولكنها ترتبط ارتباطاً وثيقاً بالرؤية البيولوجية لدى كل من قرود المكاك والبشر.

Florian P. Mahner, Johannes Roth, Ka Chun Lam, Michael F. Bonner, Francisco Pereira, Martin N. Hebart2026-05-14
🤖 AI

Coordinating Multiple Conditions for Trajectory-Controlled Human Motion Generation

تقترح الورقة البحثية إطار عمل CMC، وهو إطار عمل من مرحلتين منفصلتين ينسق بين الشروط النصية والمسارية لتوليد حركة البشر من خلال ضمان اتباع المسار بدقة أولاً عبر تمثيل مبسط، ثم استكمال حركة الجسم الكامل عبر نموذج طلاء (inpainting) مشروط بالنص ومعزز بآلية طلاء انتقائية لتحقيق أداء رائد في هذا المجال.

Deli Cai, Haoyang Ma, Changxing Ding2026-05-14