🤖 machine learning

SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting

تُعد SplatSuRe طريقة مبتكرة لتقنية "Gaussian Splatting" ثلاثية الأبعاد، حيث تحقق دقة فائقة عالية الجودة ومتسقة عبر تعدد المشاهد من خلال تطبيق التحسين بشكل انتقائي فقط على المناطق ذات العينات الناقصة بناءً على وضعية الكاميرا وهندسة المشهد، مما يتجنب عدم الاتساق الناتج عن الدقة الفائقة الموحدة عبر جميع المشاهد.

Pranav Asthana, Alex Hanson, Allen Tu, Tom Goldstein, Matthias Zwicker, Amitabh Varshney2026-03-31
💻 computer science

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

يُعد LAMP إطار عمل مبتكر يسخر النماذج اللغوية الكبيرة لترجمة الأوصاف باللغة الطبيعية إلى برامج حركة ثلاثية الأبعاد مهيكلة وقابلة للتنفيذ لكل من الأجسام الديناميكية والكاميرات، مما يتيح تحكماً دقيقاً وسينمائياً في الحركة أثناء توليد الفيديو.

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan2026-03-31
💻 computer science

UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking

يُعد UniLS أول إطار عمل متكامل (end-to-end) يُنشئ تعبيرات موحدة للأفاتار أثناء التحدث والاستماع مدفوعة فقط بمسار صوتي مزدوج، متجاوزاً بذلك جمود نماذج المستمع السابقة من خلال نموذج تدريب مبتكر يتكون من مرحلتين يتعلم من خلالهما نموذج حركة داخلي قبل تعديله باستخدام إشارات الكلام.

Xuangeng Chu, Ruicong Liu, Yifei Huang, Yun Liu, Yichen Peng, Bo Zheng2026-03-31
💻 computer science

E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training

يُعد E-RayZer نموذجاً للرؤية ثلاثية الأبعاد يعتمد على التعلم الذاتي، حيث يتعلم تمثيلات قائمة على أسس هندسية من خلال إجراء إعادة بناء ثلاثية الأبعاد صريحة مباشرة في الفضاء ثلاثي الأبعاد، متفوقاً بذلك على الطرق غير المباشرة السابقة ومضاهياً النماذج الخاضعة للإشراف الكامل في المهام اللاحقة دون الحاجة إلى بيانات مصنفة.

Qitao Zhao, Hao Tan, Qianqian Wang, Sai Bi, Kai Zhang, Kalyan Sunkavalli, Shubham Tulsiani, Hanwen Jiang2026-03-31
💬 NLP

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

يقدم VideoARM نموذج استدلال وكيل مع ذاكرة متعددة الوسائط هرمية تتيح تحليلاً تكيفياً للفيديو من المستوى العام إلى المستوى الدقيق في الوقت الفعلي، محققاً أداءً هو الأفضل في فئته في فهم مقاطع الفيديو طويلة المدى مع تقليل استهلاك الرموز (tokens) بشكل كبير مقارنة بالأساليب الحالية.

Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu2026-03-31
💻 computer science

LitePT: Lighter Yet Stronger Point Transformer

تقدم الورقة البحثية LitePT، وهو هيكل خلفي أكثر كفاءة للسحب النقطية ثلاثية الأبعاد يجمع استراتيجياً بين التلافيف في المراحل المبكرة للهندسة منخفضة المستوى مع الانتباه في الطبقات العميقة للدلالات عالية المستوى، معززاً بترميز موضعي جديد خالٍ من المعلمات (PointROPE)، لتحقيق أداء رائد بأعداد أقل بكثير من المعلمات، واستدلال أسرع، واستهلاك أقل للذاكرة مقارنة بـ Point Transformer V3.

Yuanwen Yue, Damien Robert, Jianyuan Wang, Sunghwan Hong, Jan Dirk Wegner, Christian Rupprecht, Konrad Schindler2026-03-31
💻 computer science

From Unlearning to UNBRANDING: A Benchmark for Trademark-Safe Text-to-Image Generation

تقدم هذه الورقة البحثية "إزالة العلامات التجارية" (unbranding)، وهي مهمة ومعيار مرجعي جديد لتوليد النصوص إلى صور بدقة متناهية، يهدف إلى إزالة كل من العلامات التجارية الصريحة والسمات الهيكلية الدقيقة للعلامة التجارية (المظهر التجاري) مع الحفاظ على التماسك الدلالي، مما يعالج قصور الكواشف الحالية ويسلط الضوء على المخاطر المتزايدة التي تفرضها النماذج ذات الدقة العالية.

Dawid Malarz, Filip Manjak, Maciej Zięba, Przemysław Spurek, Artur Kasymov2026-03-31
💬 NLP

RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering

تقدم الورقة البحثية RadImageNet-VQA، وهي مجموعة بيانات ضخمة منسقة من قبل خبراء تضم 750 ألف صورة للأشعة المقطعية والرنين المغناطيسي مع 7.5 مليون زوج من الأسئلة والأجوبة المصممة للنهوض بمجال الإجابة البصرية على الأسئلة الإشعاعية مع إثبات متانتها ضد الاختصارات اللغوية والقيود الحالية للنماذج الحديثة في تحديد الأمراض الدقيقة.

Léo Butsanets, Charles Corbière, Julien Khlaut, Pierre Manceron, Corentin Dancette2026-03-31
🤖 machine learning

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

تقدم هذه الورقة NarrativeTrack، وهو أول معيار تصميم لتقييم الفهم السردي للنماذج اللغوية الكبيرة متعددة الوسائط من خلال إطار عمل "تطور الاستدلال التركيبي" المنظم الذي يكشف عن عدم قدرتها على تتبع الكيانات بمتانة عبر الديناميكيات الزمنية، مما يكشف عن مقايضة جوهرية بين التجذر الإدراكي والتماسك الزمني.

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty2026-03-31
💻 computer science

Adaptive Attention Distillation for Robust Few-Shot Segmentation under Environmental Perturbations

تتناول هذه الورقة تحدي الاضطرابات البيئية في تقسيم الصور بلقطات قليلة من خلال تقديم إعداد ومعيار جديد للصلابة (ER-FSS) إلى جانب طريقة تقطير الانتباه التكيفي (AAD) التي تحسن بشكل كبير أداء النموذج وقدرته على التعميم عبر السيناريوهات المعقدة في العالم الحقيقي.

Qianyu Guo, Jingrong Wu, Jieji Ren, Weifeng Ge, Wenqiang Zhang2026-03-31