💻 computer science

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

يقدم DiMo إطار عمل انتشار منفصل موحد يوسع النمذجة المقنعة لتشمل فهم وتوليد الحركة والنص ثنائي الاتجاه، مما يتيح مقايضات مرنة بين الجودة وزمن الاستجابة ومهام حركة متنوعة من خلال صقل الرموز التكراري، وتكميم المتجهات المتبقية، وتحسين السياسة النسبية للمجموعات.

Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhan (…)2026-02-09
🤖 AI

DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking

تقدم هذه الورقة البحثية مهمة تتبع الأجسام المتعددة بالإشارة المرجعية في بيانات RGBD، والتي تُعرف بـ DRMOT، إلى جانب مجموعة بيانات DRSet وإطار عمل DRTrack، وذلك لمعالجة أوجه القصور في النماذج التي تعتمد على بيانات 2D فقط عبر الاستفادة من دمج وسائط RGB والعمق واللغة لضمان تتبع أهداف متين يدرك الأبعاد الثلاثية وتأصيل مكاني-دلالي.

Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao2026-02-09
🤖 machine learning

Generative Modeling via Drifting

تقدم هذه الورقة "النماذج المنحرفة" (Drifting Models)، وهو نموذج توليدي جديد جديد يطور توزيع الدفع الأمامي أثناء التدريب عبر مجال انحراف لتحقيق التوازن، مما يتيح توليد صور في خطوة واحدة بأداء هو الأفضل حالياً على مجموعة بيانات ImageNet بدقة 256×256.

Mingyang Deng, He Li, Tianhong Li, Yilun Du, Kaiming He2026-02-09
🤖 machine learning

Extreme Weather Nowcasting via Local Precipitation Pattern Prediction

تقدم هذه الورقة exPreCast، وهو إطار عمل حتمي فعال معزز بانتباه مكاني زماني محلي وفك تشفير حافظ للنسيج، إلى جانب مجموعة بيانات رادارية متوازنة تم إنشاؤها حديثًا من الإدارة الكورية للأرصاد الجوية، لتحقيق أداء رصد حالي هو الأفضل في فئته عبر كل من أحداث هطول الأمطار العادية والمتطرفة.

Changhoon Song, Teng Yuan Chang, Youngjoon Hong2026-02-09
💻 computer science

Generalization of Self-Supervised Vision Transformers for Protein Localization Across Microscopy Domains

تُظهر هذه الدراسة أن نماذج "Vision Transformers" ذات التعلم الذاتي والمُدربة مسبقاً على مجموعات بيانات مجهرية واسعة النطاق، ولا سيما "أطلس البروتين البشري"، تتعمم بفعالية في مهام تحديد المواقع البروتينية عبر مجالات مجهرية مختلفة، محققةً أداءً فائقاً حتى مع وجود بيانات محدودة مصنفة خاصة بالمهمة.

Ben Isselmann, Dilara Göksu, Andreas Weinmann2026-02-09
💬 NLP

Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering

تقترح هذه الورقة البحثية طريقة فك ترميز تعتمد على الوعي بالارتباط (RMCD)، وهي طريقة فك ترميز خالية من التدريب تعمل على تعزيز الإجابة على الأسئلة البصرية المعززة بالاسترجاع عبر وزن سياقات متعددة مسترجعة بشكل تكيفي بناءً على صلتها، وذلك لتجميع المعلومات المفيدة بفعالية مع كبح الضجيج الناتج عن المصادر غير ذات الصلة.

Jongha Kim, Byungoh Ko, Jeehye Na, Jinsung Yoon, Hyunwoo J. Kim2026-02-09
💬 NLP

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

تقدم هذه الورقة أول دراسة منهجية تقارن بين نماذج اللغة الانتشارية متعددة الوسائط ونماذج اللغة الرؤيوية ذات التوليد الذاتي كأدوات تضمين، كاشفةً أنه في حين تظهر النماذج الأولى أداءً أقل بشكل عام بسبب عدم كفاية المحاذاة بين الصورة والنص، فإن فجوة الأداء تتباين بشكل كبير بين نماذج محددة.

Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao2026-02-09
🤖 AI

SVRepair: Structured Visual Reasoning for Automated Program Repair

يُعد SVRepair إطار عمل آلي لإصلاح البرمجيات متعدد الوسائط يسد الفجوة الدلالية بين تقارير الأخطاء المرئية وإصلاحات الكود من خلال تحويل المصنوعات المرئية غير المتجانسة إلى رسوم بيانية للمشاهد دلالية مهيكلة لتعزيز تحديد موقع الخطأ وتوليد الرقع البرمجية، محققاً أداءً هو الأفضل في فئته عبر العديد من المعايير المرجعية.

Xiaoxuan Tang, Jincheng Wang, Liwei Luo, Jingxuan Xu, Sheng Zhou, Dajun Chen, Wei Jiang, Yong Li2026-02-09
⚡ electrical engineering

ALIEN: Analytic Latent Watermarking for Controllable Generation

تقدم الورقة البحثية ALIEN، وهو إطار عمل تحليلي للعلامات المائية لنماذج الانتشار الكامن يستبدل التحسين التجريبي المكثف حاسوبياً بمعامل تعديل جديد يعتمد على الوقت لتحقيق تضمين علامة مائية قابل للتحكم ومتين وعالي الدقة، متفوقاً بشكل كبير على الأساليب الرائدة في كل من الجودة والمتانة.

Liangqi Lei, Keke Gai, Jing Yu, Qi Wu2026-02-09
💻 computer science

From Blurry to Believable: Enhancing Low-quality Talking Heads with 3D Generative Priors

تقدم هذه الورقة البحثية SuperHead، وهو إطار عمل مبتكر يستفيد من الانعكاس ثلاثي الأبعاد المدرك للديناميكيات للنماذج التوليدية مسبقة التدريب لتخليق صور رمزية ثلاثية الأبعاد لرؤوس متحدثة عالية الدقة وقابلة للتحريك بتفاصيل دقيقة من مدخلات منخفضة الدقة، مما يضمن جودة بصرية فائقة واتساقاً زمنياً مقارنة بالطرق الحالية.

Ding-Jiun Huang, Yuanhao Wang, Shao-Ji Yuan, Albert Mosella-Montoro, Francisco Vicente Carrasco, Cheng Zhang, Fernando D (…)2026-02-09