💻 computer science

CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation

يُعد CapTalk إطار عمل مبتكرًا موجهًا بالنصوص يتيح تحريك الرأس ثلاثي الأبعاد بشكل متزامن وفي الوقت الفعلي، مع تحكم منفصل وديناميكي في أسلوب التحدث والتعبير العاطفي، وذلك من خلال الاستفادة من مجموعة بيانات واسعة النطاق من الأوصاف النصية إلى جانب الصوت المحرك.

Xuangeng Chu, Yuan Gan, Ziteng Cui, Shuhong Liu, Jian Wang, Bing Zhou, Tatsuya Harada2026-05-29
🤖 AI

Rethinking FID Through the Geometry of the Reference Dataset

تُثبت هذه الورقة أن موثوقية مقياس مسافة فريديه-إنسبشن (FID) في تقييم مولدات الصور تتأثر جوهرياً بالخصائص الهندسية لمجموعة البيانات المرجعية، وتحديداً كثافتها التوزيعية ورتبتها الفعالة، مما قد يتسبب في تدهور قيمة مقياس FID حتى مع تحسن جودة العينات في مجموعات البيانات المشتتة.

Yunghee Lee, Byeonghyun Pak2026-05-29
🤖 machine learning

TRACER: Persistent Regularization for Robust Multimodal Finetuning

تقدم الورقة البحثية TRACER، وهي طريقة ضبط دقيق متعدد الوسائط قوية تعالج مشكلتي النسيان الكارثي وانهيار المعلم من خلال توظيف معلم يعتمد على المتوسط المتحرك الموزون (WMA) لضمان التنظيم المستمر، مما يحسن بشكل كبير من دقة التوزيع خارج النطاق والمعايرة.

Hesam Asadollahzadeh, Feng Liu, Christopher Leckie, Sarah M. Erfani2026-05-29
💻 computer science

Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation

تقترح هذه الورقة "التوجيه السلبي المتعامد" (Orthogonal Negative Guidance)، وهي طريقة خالية من التدريب لتوليد الصور من النصوص، تعمل على كبح المفاهيم غير المرغوب فيها عن طريق تعميم ميزات انتباه المطالبة السلبية لتكون متعامدة بالنسبة للمطالب الإيجابية، مما يحقق إزالة فائقة للمفاهيم مع الحفاظ على جودة الصورة ومطابقة المطالبة.

Jungmin Ko, Jungwon Park, Jimyeong Kim, Changin Choi, Wonseok Lee, Wonjong Rhee2026-05-29
💻 computer science

ParCo-SDF: Learning Prior-Free Partial-to-Complete Signed Distance Fields of Deformable Objects

تقدم هذه الورقة البحثية ParCo-SDF، وهو إطار عمل ثنائي المراحل يحقق إعادة بناء عالية الدقة من جزئي إلى كامل للأجسام القابلة للتشوه من ملاحظات السحابة النقطية دون الاعتماد على مسبقات، وذلك عبر الاستفيد من ترميز الهندسة الزمنية وتنبؤ دالة المسافة الموقعة (SDF) المشروط بـ FiLM للتغلب على قيود التعميم التي تواجهها الطرق الحالية المعتمدة على المسبقات.

Deokmin Hwang, Minseok Song, Daehyung Park2026-05-29
💻 computer science

FedSmoothLoRA: Toward Smoother and Faster Convergence in Federated Low-Rank Adaptation

يُعد FedSmoothLoRA إطار عمل جديد للتعلم الاتحادي يعزز سرعة التقارب واستقرار التكيف منخفض الرتبة (LoRA) من خلال تقديم مصفوفات مطابقة الجولات ومحاذاة التدرج لحل عدم تطابق الحالة بين الجولات وتوفير تهيئة خاصة بكل عميل، مما يجعله يتفوق على الأساليب الحالية في مهام الصور والنصوص.

Zehao Wang, Guanglei Yang, Yihan Zeng, Hang Xu, Hongzhi Zhang, Wangmeng Zuo, Chun-Mei Feng2026-05-29
💻 computer science

FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation

يعالج FlowSeg عدم الاتساق الدلالي في التجزئة المشروطة بالنماذج اللغوية الكبيرة من خلال تقديم تدفق دلالي ثنائي الاتجاه وديناميكي يوجه بنشاط عملية صقل القناع التكرارية مع الشروط اللغوية المتطورة، محققاً أداءً هو الأفضل في فئته في مهام التجزئة المرجعية والتعليلية.

Zekang Zhang, Guangyu Gao, Youyun Tang, ChengJing Wu, Xiaochao Qu, Chi Harold Liu, Jianbo Jiao, Yunchao Wei, Luoqi Liu (…)2026-05-29
💻 computer science

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

تحدد هذه الورقة وتعالج عنق الزجاجة في مرحلة ما بعد التدريب، حيث تتحسن نماذج الرؤية واللغة في القدرة على الاستنتاج أكثر من الإدراك، وذلك عبر تقديم إطار تشخيصي يكشف عن أسباب متباينة لهذا التباين في الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي، وتقترح تدخلات مستهدفة مثل إعادة وزن الخسارة الديناميكي والمكافآت المدركة للإدراك لتعزيز الأداء النهائي بشكل كبير.

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng2026-05-29
💻 computer science

ESAM++: Efficient Online 3D Perception on the Edge

تقترح الورقة البحثية إطار عمل ESAM++، وهو إطار عمل خفيف الوزن وقابل للتوسع للإدراك اللحظي للمشاهد ثلاثية الأبعاد على أجهزة الحافة، والذي يستبدل شبكة ESAM's 3D sparse UNet المكلفة حوسبياً بشبكة 3D Sparse Feature Pyramid Network (SFPN) فعالة، محققاً دقة تنافسية مع سرعة استنتاج تصل إلى ثلاثة أضعاف ونصف حجم النموذج.

Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay, Vikas Bahirwani, Marc Niethammer, Ehsan Adeli, Andrea Colaco2026-05-29
💻 computer science

KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing

يُعد KGEdit إطار عمل لا يتطلب تدريباً يعمل على تعزيز توليد وتحرير النصوص إلى فيديو من خلال بناء رسم بياني معرفي مدرك للغموض لإزالة الغموض عن المطالبات، وحقن دلالات مهيكلة عبر وحدات متخصصة لضمان الربط الدقيق للمفاهيم والاتساق الزمني.

Mingshu Cai, Miao Zhang, Chenghe Yang, Yixuan Li, Osamu Yoshie, Yuya Ieiri2026-05-29