💻 computer science

RA-ClipScore: Making Generative Model Evaluation More Interpretable

تقدم الورقة البحثية RA-CLIPScore، وهو مقياس مبتكر يعزز قابلية التفسير لتقييم النماذج التوليدية من خلال فك الارتباط بين السمات المتنافسة وتحليل محاذاة التوزيع المكاني عبر رموز الرقع المحلية (local patch tokens)، مما يوفر رؤى أكثر قوة وتوافقاً مع الإدراك البشري مقارنة بالطرق الحالية.

Yifan Lu, Taras Kucherenko, Hedvig Kjellström, Judith Bütepage2026-08-13
💻 computer science

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

يُعد Avatar-Forever إطار عمل تدريب متوازي ومنفصل يجمع بين التقطير كامل المعلمات للحصول على جودة بصرية عالية وبين مُكيِّف خفيف الوزن طويل الأمد يتم تدريبه عبر تدريب التدحرج الموجه بالاسترداد، مما يتيح توليد أفاتار مدفوع بالصوت بشكل مستقر وفي الوقت الفعلي ولأمد غير محدود على وحدة معالجة رسومية واحدة من نوع H100.

Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang2026-08-13
💻 computer science

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

تحدد هذه الورقة أن طريقة تحسين التفضيل المباشر (DPO) القياسية لا تستغل المعلومات السياقية بشكل كافٍ، مما يؤدي إلى هلوسة الكائنات في النماذج اللغوية الكبيرة متعددة الوسائط، وتقترح طريقة "تحسين التفضيل المباشر المعاير للسياق" (C²-DPO)، وهي طريقة تعمل صراحةً على تعظيم مكاسب التفضيل السياقي لتقليل الهلوسة بشكل كبير مع الحفاظ على قدرات الاستد old العام.

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim2026-08-13
💻 computer science

TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer

يُعد TGRHuman إطار عمل جديداً موجهاً بالنصوص يقوم بتوليد هندسة بشرية ثلاثية الأبعاد وأنسجة عالية الجودة ومتسقة بكفاءة، وذلك عبر فصل عمليات تخليقهما واستخدام توليد ملاحظات متعددة المشاهد صريحة مع مُصيّر انتشار (diffusion renderer)، مما يتغلب على قيود الطرق التقليدية القائمة على تمثيل الحقول العصبية الإشعاعية (NeRF).

Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li2026-08-13
💻 computer science

Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs

يُعد Map-Det3D إطار عمل للرصد ثلاثي الأبعاد متعدد المنظور عبر الإنترنت، والذي يستفيد من عملية إعادة بناء ثلاثية الأبعاد مترية ذات تغذية أمامية قبل التنبؤ مباشرة بصناديق الإحاطة ثلاثية الأبعاد المترية من فيديو أحادي العدسة، مما يتغلب بفعالية على قيود غموض المقياس وتحول النطاق التي تواجهها أساليب الرفع التقليدية من ثنائي الأبعاد إلى ثلاثي الأبعاد.

Yung-Hsu Yang, Luigi Piccinelli, Samuel Rota Bulò, Sunghwan Hong, Denis Rozumny, Johannes Schönberger, Zuria Bauer, Herm (…)2026-08-13
💻 computer science

GenFAR: A generalized representation of brain structure, derived from 49,246 multi-cohort MRIs via deep learning

يُعد GenFAR إطار عمل للتعلم العميق معياريًا تم تدريبه على 49,246 صورة رنين مغناطيسي للدماغ من مجموعات سكانية متعددة باستخدام نهج تسلسلي لاستخلاص تمثيل عام ومعلومات سريرية يحسن بشكل كبير من كفاءة العينات ودقة مهام التصوير العصبي اللاحقة.

Vishnu M. Bashyam, Guray Erus, Junhao Wen, Pratik Chaudhari, Randa Melhem, Sindhuja Govindarajan Tirumalai, Gareth Harma (…)2026-08-13
🤖 AI

HSTGFormer: Hyper Spatial-Temporal Graph Transformer for 3D Human Pose Estimation

تقترح هذه الورقة البحثية HSTGFormer، وهو إطار عمل "ترانسفورمر" معزز بالرسوم البيانية يوحد الاستدلال المكاني-الزماني من خلال رسم بياني فائق للمكان والزمان ورسم بياني زماني تكيفي ثنائي المقياس لالتقاط التبعيات المحلية المقترنة والأنماط الزمنية الخاصة بالمفاصل، محققاً دقة وكفاءة عاليتين في تقدير وضعية جسم الإنسان ثلاثي الأبعاد.

Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei2026-08-13
🤖 AI

M-Net: Integrating Spectral Features and Physical Field Operators into Deep Learning for Medical Image Segmentation

تقترح الورقة البحثية M-Net، وهي بنية تعلم عميق مبتكرة تدمج الانحيازات الاستقرائية الرياضية — وتحديداً الميزات الطيفية المستمرة ومؤثرات الحقل الفيزيائي — ضمن إطار عمل U-Net لتتفوق بشكل كبير على النماذج القياسية القائمة على البيانات في تقسيم الصور الطبية عبر معايير الكبد والكلى وأورام الدماغ.

Jing Zhu, Ye Wang, Fumin Wang2026-08-13
💻 computer science

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

تقدم هذه الورقة GAS، وهو إطار تدريب يعزز الفهم البصري بعبء استدلال صفري في النماذج اللغوية الكبيرة متعددة الوسائط باستخدام فرع توليد منفصل مع التنبؤ بالتمثيل التالي (Next Embedding Prediction) كإشراف مساعد لتنقية التمثيلات البصرية المشتركة دون المساس ببنية الاستدلال النهائية.

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang2026-08-13
🤖 AI

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

تقترح الورقة البحثية إطار عمل SCOUT، الذي يجمع بين نهج سلسلة أفكار ثلاثي الأبعاد مهيكل وخوارزمية تعزيز مكافأة عملياتية جديدة متعددة الأهداف ومجموعة بيانات مخصصة لتعزيز قدرات الاستدلال المكاني لنماذج الرؤية واللغة بشكل كبير، محققةً أداءً يتجاوز GPT-4o في المهام المعقدة.

Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang2026-08-13