💻 computer science

Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

تقترح هذه الورقة البحثية إطار عمل LDF-VFI، وهو إطار عمل شامل متمحور حول الفيديو يستخدم محول انتشار ذاتي الانحدار مع تقنيات مبتكرة للعينات من نوع (skip-concatenate) وانتباه محلي متفرق لتحقيق استيفاء إطارات فيديو متطور وحاصل على أعلى المعايير، يتسم بالاتساق الزمني ويدعم دقات عشوائية وتسلسلات طويلة.

Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xion (…)2026-03-31
🤖 machine learning

AutoRegressive Generation with B-rep Holistic Token Sequence Representation

تقدم هذه الورقة BrepARG، وهو الإطار الأول لترميز بيانات تمثيل الحدود (B-rep) إلى تسلسل رموز كلي يتكون من رموز هندسية وطوبولوجية، مما يتيح توليداً متطوراً بنظام التنبؤ الذاتي عبر بنية محول تعتمد فقط على فك التشفير.

Jiahao Li, Yunpeng Bai, Yongkang Dai, Hao Guo, Hongping Gan, Yilei Shi2026-03-31
💻 computer science

PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors

يُعد PhaSR إطار عمل عام لإزالة ظلال الصور يحقق أداءً قويًا عبر ظروف إضاءة متنوعة من خلال توظيف محاذاة مسبقة ثنائية المستوى عبر التقييس المحاذي فيزيائيًا لتصحيح الإضاءة، وانتباه التصحيح الهندسي-الدلالي لمواءمة الهندسة العميقة مع التضمينات الدلالية.

Chia-Ming Lee, Yu-Fan Lin, Yu-Jou Hsiao, Jin-Hui Jiang, Yu-Lun Liu, Chih-Chung Hsu2026-03-31
💬 NLP

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

يُعد CoPE-VideoLM نموذج لغة فيديو فعالاً يستفيد من متجهات الحركة والمتبقيات من بدائيات ترميز الفيديو لتقليل العبء الحسابي وزمن الاستجابة بشكل جذري مع الحفاظ على الأداء أو تجاوزه عبر مختلف معايير فهم الفيديو.

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu2026-03-31
💻 computer science

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

تقترح هذه الورقة إطاراً لحماية حقوق الطبع والنشر للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) يقوم بتوليد صور محفزة عدائية عبر آلية حقن مزدوجة —تجمع بين الاتساق النصي ومحاذاة السمات الدلالية— لاستثارة استجابات فريدة تتعلق بالملكية في المشتقات التي خضعت لضبط دقيق، بينما تظل خاملة في النماذج غير المشتقة.

Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang2026-03-31
💻 computer science

ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization

يُعد ConceptPrism إطار عمل لتوليد الصور من النصوص بشكل مخصص، حيث يحقق فصلاً دقيقاً للمفاهيم عبر التحسين المشترك لرمز مستهدف ورموز متبقية على مستوى الصورة من خلال خسائر إعادة البناء والاستبعاد، مما يؤدي إلى عزل الميزات المشتركة دون الحاجة إلى معلومات خارجية.

Minseo Kim, Minchan Kwon, Dongyeun Lee, Yunho Jeon, Junmo Kim2026-03-31
💻 computer science

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

تحدد الورقة البحثية أن نماذج CLIP المدربة على شروح طويلة تعاني من انحياز "قصر نظر" حيث يتركز الانتباه على الجملة الملخصة الأولية، وتقترح DeBias-CLIP، وهي طريقة خالية من المعلمات تعمل على إزالة هذا الملخص وإعادة توزيع الإشراف لتحقيق أداء رائد في استرجاع النصوص الطويلة وتحسين المتانة.

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander2026-03-31
🤖 AI

Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

يقدم Fase3D أول نموذج لغوي متعدد الوسائط ثلاثي الأبعاد فعال وخالٍ من المشفر، والذي يستفيد من أداة ترميز مبتكرة قائمة على تحويل فوريه تجمع بين تسلسل السحابة النقطية وتحويل فوريه السريع (FFT) لتحقيق أداء يضاهي الأنظمة القائمة على المشفرات مع تقليل التكاليف الحسابية وتكاليف المعلمات بشكل كبير.

Guofeng Mei, Wei Lin, Luigi Riz, Yujiao Wu, Yiming Wang, Fabio Poiesi2026-03-31
💻 computer science

DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

يُعد DyaDiT نموذج محول انتشار متعدد الوسائط يقوم بتوليد إيماءات ثنائية واعية بالسياق ومقبولة اجتماعياً من خلال الاستفادة من الديناميكيات الصوتية المتبادلة ورموز السياق الاجتماعي الاختيارية ليتفوق على الأساليب الحالية في كل من المقاييس الموضوعية وتفضيلات المستخدمين.

Yichen Peng, Jyun-Ting Song, Siyeol Jung, Ruofan Liu, Haiyang Liu, Xuangeng Chu, Ruicong Liu, Erwin Wu, Hideki Koike, Kr (…)2026-03-31
💻 computer science

OMG-Avatar: One-shot Multi-LOD Gaussian Head Avatar

يُعد OMG-Avatar طريقة مبتكرة من نوع "المرة الواحدة" (one-shot) تستخدم تمثيلاً غاوسياً متعدد مستويات التفاصيل (Multi-LOD Gaussian) وبنية قائمة على المحولات (transformer-based) مع نموذج تعلم من الخشن إلى الناعم لإعادة بناء نماذج رمزية ثلاثية الأبعاد للرأس عالية الجودة وقابلة للتحريك مع دمج الكتفين في غضون 0.2 ثانية فقط، مما يوازن بفعالية بين جودة إعادة البناء والكفاءة الحسابية عبر مختلف قدرات الأجهزة.

Jianqiang Ren, Lin Liu, Steven Hoi2026-03-31