💻 computer science

MechVerse: Evaluating Physical Motion Consistency in Video Generation Models

تقدم الورقة البحثية MechVerse، وهو معيار مرجعي شامل يتكون من أكثر من 21,000 مقطع ميكانيكي اصطناعي، لتقييم وإثبات أن نماذج توليد الفيديو الحالية تواجه صعوبة في الالتزام بالقيود الكينماتيكية والهندسية على الرغم من تحقيقها دقة بصرية عالية.

Rahul Jain, Mayank Patel, Asim Unmesh, Karthik Ramani2026-05-15
💻 computer science

SR-Prominence: A Crowdsourced Protocol and Dataset Suite for Perceptually-Weighted Super-Resolution Artifact Evaluation

تقدم هذه الورقة SR-Prominence، وهي مجموعة بيانات وبروتوكول تقييم قائم على التعهيد الجماعي، لتقييم عيوب الدقة الفائقة بناءً على تأثيرها الإدراكي (البروز) بدلاً من مجرد وجودها الثنائي، مما يكشف أن العديد من العيوب الحالية غير محسوسة لمعظم المشاهدين، ويوضح أن المقاييس الكلاسيكية المرجعية الكاملة غالباً ما تتفوق على الكواشف المتخصصة في التنبؤ بهذه التأثيرات الإدراكية.

Ivan Molodetskikh, Kirill Malyshev, Mark Mirgaleev, Nikita Zagainov, Evgeney Bogatyrev, Dmitriy Vatolin2026-05-15
💻 computer science

LPH-VTON: Resolving the Structure-Texture Dilemma of Virtual Try-On via Latent Process Handover

يعالج LPH-VTON المقايضة الهيكلية-النسيجية في تجربة القياس الافتراضي من خلال تقديم إطار عمل تآزري يستفيد بالتتابع من نموذج منحاز للهيكل من أجل المحاذاة الهندسية ونموذج منحاز للنسيج من أجل رندرة التفاصيل عالية الدقة ضمن عملية إزالة ضجيج مستمرة واحدة.

Yixin Liu, Baihong Qian, Jinglin Jiang, Jeffery Wu, Yan Chen, Wei Wang, Yida Wang, Lanqing Yang, Guangtao Xue2026-05-15
💻 computer science

HeatKV: Head-tuned KV-cache Compression for Visual Autoregressive Modeling

تُعد HeatKV طريقة مبتكرة لضغط ذاكرة التخزين المؤقت (KV-cache) للنماذج التوليدية المرئية ذاتية الانحدار، حيث تستخدم جدول تقليم ثابت ومعدل حسب الرأس بناءً على ترتيب الانتباه غير المتصل بالإنترنت لتحقيق نسبة ضغط ذاكرة أعلى بمقدار ضعفين مع الحفاظ على جودة توليد الصور أو تحسينها.

Jonathan Cederlund, Axel Berg, Durmus Alp Emre Acar, Chuteng Zhou, Pontus Giselsson2026-05-15
💻 computer science

Masked Next-Scale Prediction for Self-supervised Scene Text Recognition

تقدم هذه الورقة البحثية التنبؤ بالنمط التالي المقنع (MNSP)، وهو إطار عمل موحد للتعلم الذاتي يعزز التعرف على النصوص في المشاهد من خلال التعلم المشترك للتنبؤ بالميزات عبر المقاييس وإعادة بناء الصور المقنعة لنمذجة التطور الهرمي من التخطيطات الكلية إلى ضربات الحروف الدقيقة بفعالية، محققةً أداءً هو الأفضل في مجاله على العديد من المعايكات المرجعية.

Zhuohao Chen, Zeng Li, Yifei Zhang, Chang Liu, Yu Zhou2026-05-15
💻 computer science

Hierarchical Image Tokenization for Multi-Scale Image Super Resolution

تقترح هذه الورقة طريقة مبتكرة لرفع دقة الصور متعددة المقاييس تجمع بين الترميز الهرمي للصور (HIT) وتحسين التفضيل المباشر (DPO) ضمن إطار عمل بصري ذاتي الانحدار لتحقيق أداء رائد باستخدام نموذج مدمج يضم 300 مليون معلمة، مما يلغي الحاجة إلى بيانات تدريب خارجية مع تمكين توليد مخرجات متعددة المقاييس بمرونة وعبر تمريرة واحدة.

Isma Hadji, Enrique Sanchez, Adrian Bulat, Brais Martinez, Georgios Tzimiropoulos2026-05-15
🤖 machine learning

Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers

تكشف هذه الورقة أن نماذج الرؤية واللغة المدربة تباينياً تحتوي على فضاء فرعي جوهري وثابت من الضجيج متعدد الوسائط المشترك يمكن تقليمه بأمان دون الإضرار بالأداء في المهام اللاحقة، مما يقدم رؤى ميكانيكية جديدة حول بنيتها التمثيلية الكامنة.

Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek2026-05-15
💻 computer science

SCRWKV: Ultra-Compact Structure-Calibrated Vision-RWKV for Topological Crack Segmentation

تقترح الورقة البحثية شبكة SCRWKV، وهي شبكة رؤية-RWKV فائقة الصغر تتميز بمُشفّر حقل-بنية يحتوي على مكونات مبتكرة مثل وحدة الاستبصار المُعايرة بالبنية وفك تشفير خفيف الوزن، والتي تحقق دقة رائدة في تقسيم الشقوق على مستوى البكسل بـ 1.22 مليون معلمة فقط مع الحفاظ على تعقيد حوسبي خطي.

Hanxu Zhang, Chen Jia, Hui Liu, Xu Cheng, Fan Shi, Shengyong Chen2026-05-15
💻 computer science

Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control

يُعد MSCoT نموذجاً جديداً متعدد المقاييس، ينتقل من الخشن إلى الناعم، ويحقق أداءً فائقاً وسريعاً ودقيقاً في التحكم في حركة الإنسان أثناء وقت الاختبار عبر الجمع بين التنبؤ الهرمي بالرموز، والتوجيه الفعال متعدد المقاييس، ومُحسِّن رموز خفيف الوزن للتغلب على قيود النهج الحالية القائمة على الانتشار والتكرار.

Nhat Le, Daochang Liu, Anh Nguyen, Ajmal Mian2026-05-15
💻 computer science

H-OmniStereo: Zero-Shot Omnidirectional Stereo Matching with Heading-Aligned Normal Priors

تقدم هذه الورقة H-OmniStereo، وهو إطار عمل لتقنية مطابقة الاستريو متعدد الاتجاهات بنمط "الصفر استباقي" (zero-shot)، يستفيد من مجموعة بيانات اصطناعية واسعة النطاق ومقدر للمتجهات العمودية أحادية الاتجاه متوافق مع اتجاه الرأس للتغلب على تحديات ندرة البيانات والتشوه الكروي، محققاً تعميماً فائقاً للسيناريوهات الواقعية.

Chenxing Jiang, Zhe Tong, Pusen Gao, Peize Liu, Yang Xu, Chuan Fang, Ping Tan, Shaojie Shen2026-05-15