💻 computer science

High-Fidelity Single-Image Head Modeling with Industry-Grade Topology

تقدم هذه الورقة إطار عمل لإعادة بناء الرأس من صورة واحدة يحقق توبولوجيا بمستوى صناعي وحفاظاً عالي الدقة على الهوية من خلال مسار تحسين ثلاثي المراحل من الخشن إلى الناعم معزز بقيود مدركة للهندسة، وهو ما تم التحقق من صحته من قبل فنانين تقنيين محترفين باعتباره الطريقة الأفضل أداءً للإنتاج الواقعي للبشر الرقميين.

Yunmu Wang, Zoubin Bi, Bowen Cai, Chenchu Rong, Jinlong Wang, Junchen Deng, Aocheng Huang, Jidong Jia, Huan Fu2026-05-07
💻 computer science

Angle-I2P: Angle-Consistent-Aware Hierarchical Attention for Cross-Modality Outlier Rejection

تقترح الورقة البحثية Angle-I2P، وهي شبكة مبتكرة لرفض القيم المتطرفة في عملية تسجيل الصور مع السحب النقطية، تجمع بين قيود الاتساق الزاوي غير المعتمدة على المقياس وآلية انتباه هرمية من المستوى العالمي إلى المحلي لتحسين نسبة النقاط الصحيحة واستدعاء التسجيل بشكل كبير، لا سيما في السيناريوهات ذات جودة المطابقة الأولية المنخفضة.

Muyao Peng, Shun Zou, Pei An, You Yang, Qiong Liu2026-05-07
💻 computer science

InterMesh: Explicit Interaction-Aware End-to-End Multi-Person Human Mesh Recovery

يُعد InterMesh إطار عمل متكامل لاستعادة الشبكة البشرية لعدة أشخاص، حيث يدمج صراحةً دلالات التفاعل المهيكل بين الإنسان والبيئة عبر كاشف للتفاعل بين الإنسان والأشياء ووحدات خفيفة الوزن، مما يحسن بشكل كبير من دقة تقدير الوضعية والشكل في سيناريوهات التفاعل المعقدة مقارنة بالطرق الحالية القائمة على الانتباه الضمني.

Kaili Zheng, Kaiwen Wang, Xun Zhu, Chenyi Guo, Ji Wu2026-05-07
🤖 AI

Reference-based Category Discovery: Unsupervised Object Detection with Category Awareness

تقترح هذه الورقة البحثية إطار "اكتشاف الفئات القائم على المرجع" (RefCD)، وهو إطار عمل لاكتشاف الأشياء غير الخاضع للإشراف، يحقق كشفاً واعياً بالفئات دون الحاجة إلى تسميات توضيحية يدوية، وذلك من خلال الاستفادة من تشابه الميزات بين الأشياء المتوقعة والصور المرجعية غير المصنفة لتوجيه تعلم الميزات الخاصة بكل فئة.

Yichen Li, Qiankun Liu, Ying Fu2026-05-07
💻 computer science

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

تقترح الورقة البحثية CAST، وهي طريقة لا تتطلب تدريباً وتعمل بأسلوب "التوصيل والتشغيل"، والتي تخفف من حدة هلوسة الكائنات في النماذج اللغوية البصرية الكبيرة عبر الاستفادة من أنماط الانتباه الموجهة بالوصف لتوجيه الإدراك البصري دون زيادة تكاليف الاستدلال بشكل كبير.

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang (…)2026-05-07
💻 computer science

From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models

تقارن هذه الورقة بشكل منهجي بين استراتيجيات الإشراف على الأفعال الكامنة القائمة على الصور وتلك القائمة على الأفعال لنماذج الرؤية واللغة والأفعال، كاشفةً أن الطرق القائمة على الصور تعزز الاستدلال طويل المدى بينما تحسن الطرق القائمة على الأفعال التنسيق الحركي، مع تحقيق الإشراف المباشر على الرموز لأفضل أداء إجمالي.

Yihan Lin, Haoyang Li, Yang Li, Haitao Shen, Yihan Zhao, Chao Shao, Jing Zhang2026-05-07
🤖 machine learning

HEXST: Hexagonal Shifted-Window Transformer for Spatial Transcriptomics Gene Expression Prediction

يُعد HEXST نموذج محول (Transformer) جديد ذو نافذة مزاحفة سداسية، يعمل على تحسين التنبؤ بالتعبير الجيني المكاني من الصور النسيجية عبر التوافق مع هندسة مصفوفة البقع السداسية واستخدام أهداف حساسة للتباين للحفاظ على التباين المكاني، متفوقاً بذلك على النماذج الحالية ذات الحالة الفنية الأحدث عبر مجموعات بيانات متعددة.

Keunho Byeon, Jin Tae Kwak2026-05-07
🤖 AI

FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation

تُعد FaithfulFaces إطار عمل مبتكر لتوليد الفيديو من النصوص يعالج تشوه الهوية في المشاهد الديناميكية المعقدة عبر تقديم أداة محاذاة للهوية مشتركة مع الوضعية ومجموعة بيانات متنوعة ومنسقة للحفاظ على اتساق هوية الوجه القوي عبر التباينات الكبيرة في الوضعيات والانسدادات.

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Sen Liang, Wenyue Li, Tianxiang Zheng, Qinglin Lu, Zhen Cui2026-05-07
💻 computer science

Not Every Subject Should Stay: Machine Unlearning for Noisy Engagement Recognition

تقترح هذه الورقة إطار عمل خفيف الوزن لـ "إلغاء التعلم" على مستوى الأشخاص لمجموعات بيانات التعرف على التفاعل المشوبة بالضجيج، والذي يزيل بفعالية تأثير الأشخاص المسببين للمشكلات دون الحاجة إلى إعادة تدريب كاملة، مستعيداً أكثر من 89% من مكاسب الأداء للنموذج المثالي بتكلفة حوسبية تعادل ربع التكلفة تقريباً.

Alexander Vedernikov2026-05-07
⚡ electrical engineering

VC-FeS: Viewpoint-Conditioned Feature Selection for Vehicle Re-identification in Thermal Vision

تقدم هذه الورقة البحثية VC-FeS، وهي طريقة اختيار ميزات مشروطة بجهة النظر تعمل على تكييف مستخرجات ViT المدربة مسبقاً على صور RGB للتغلب على نقص الألوان والنسيج في عملية إعادة تحديد هوية المركبات حرارياً، محققةً مكاسب كبيرة في الأداء على كل من مجموعة البيانات القياسية ومجموعة بيانات بحرية حرارية مقترحة حديثاً.

Yasod Ginige, Ransika Gunasekara, Darsha Hewavitharana, Manjula Ariyarathne, Peshala Jayasekara, Ranga Rodrigo2026-05-07