💻 computer science

EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories

تقدم هذه الورقة EMMA، وهو معيار شامل يقيم تقنيات محو المفاهيم عبر خمسة مجالات باستخدام 13 مقياساً للكشف عن أوجه قصورها في التعامل مع المطالبات غير المباشرة، والمفاهيم المتشابهة بصرياً، والتحيزات المحتملة.

Lu Wei, Yuta Nakashima, Noa Garcia2026-04-01
💻 computer science

Guiding a Diffusion Transformer with the Internal Dynamics of Itself

تقترح هذه الورقة البحثية "التوجيه الداخلي" (Internal Guidance - IG)، وهي استراتيجية بسيطة وفعالة تستفيد من الديناميكيات الداخلية لـ "محولات الانتشار" (Diffusion Transformers) عبر إدخال إشراف مساعد على الطبقات المتوسطة أثناء التدريب واستقراء مخرجات الطبقات أثناء أخذ العينات، مما يحقق جودة توليد وكفاءة تدريب رائدة في مجموعة بيانات ImageNet.

Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu2026-04-01
💻 computer science

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

تقدم هذه الورقة MVGGT، وهو إطار عمل فعال وشامل (end-to-end) لتجزئة التعبيرات المرجعية ثلاثية الأبعاد متعددة المشاهد، والذي يستعيد بنية المشهد ويجزئ الكائنات من مناظر RGB متفرقة باستخدام تصميم محول ثنائي الفروع واستراتيجية تحسين مبتكرة للتغلب على تخفيف تدرج المقدمة، مدعوماً بمقياس MVRefer الجديد.

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao2026-04-01
💻 computer science

AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation

يُعد AGILE إطار عمل قويًا يعيد بناء التفاعلات الديناميكية بين اليد والجسم من مقاطع فيديو أحادية العين عبر الانتقال من إعادة البناء التقليدية إلى نموذج توليدي وكيل، وذلك باستخدام نموذج رؤية ولغة لتخليق شبكات مجسمة كاملة للأجسام واستراتيجية "المرساة والتتبع" لتجاوز مرحلة التهيئة الهشة القائمة على بنية الحركة من متعدد الصور، مما ينتج أصولاً جاهزة للمحاكاة ذات دقة هندسية عالية ومعقولية فيزيائية.

Jin-Chuan Shi, Binhong Ye, Tao Liu, Xiaoyang Liu, Yangjinhui Xu, Junzhe He, Zeju Li, Hao Chen, Chunhua Shen2026-04-01
🤖 AI

Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

تتناول هذه الورقة المقايضة بين التوليد والفهم في النماذج متعددة الوسائط من خلال اقتراح إطار عمل "السبب-التأمل-التحسين" (R3)، الذي يعيد صياغة التوليد كعملية متعددة الخطوات من "التوليد-الفهم-إعادة التوليد" لتعزيز كلتا القدرتين في آن واحد.

Sen Ye, Mengde Xu, Shuyang Gu, Di He, Liwei Wang, Han Hu2026-04-01
💻 computer science

Human-level 3D shape perception emerges from multi-view learning

تُثبت هذه الورقة أن الإدراك البشري لمستوى الأشكال ثلاثية الأبعاد يمكن أن ينبثق من شبكات عصبية مُدربة حصرياً على بيانات بصرية مكانية متعددة المشاهد وطبيعية، محققةً تطابقاً في مرحلة "الصفر" (zero-shot) مع دقة البشر، وأنماط الخطأ، وأوقات الاستجابة دون تدريب خاص بالمهمة أو انحيازات استقرائية متعلقة بالأجسام.

Tyler Bonnen, Jitendra Malik, Angjoo Kanazawa2026-04-01
💻 computer science

StreetTree: A Large-Scale Global Benchmark for Fine-Grained Tree Species Classification

تقدم هذه الورقة البحثية StreetTree، وهو أول مجموعة بيانات مرجعية عالمية واسعة النطاق في العالم تحتوي على أكثر من 12 مليون صورة لأكثر من 8,300 نوع من أشجار الشوارع عبر 133 دولة، والمصممة للنهوض بتصنيف الأشجار دقيق التفاصيل ودعم أبحاث العلوم الحضرية من خلال معالجة تحديات مثل التشابه البصري، والتباين الموسمي، وظروف التصوير المتنوعة.

Jiapeng Li, Yingjing Huang, Fan Zhang, Yu liu2026-04-01
💻 computer science

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

تقترح هذه الورقة البحثية إطار عمل SSR2^2-GCD، وهو إطار عمل جديد متعدد الوسائط شبه مُشرف لاكتشاف الفئات المعممة (Generalized Category Discovery) يعمل على تعزيز التعرف على المجموعات المفتوحة من خلال إعطاء الأولوية للمحاذاة داخل الوسيط الواحد عبر تقليل المعدل والاستفادة من نماذج الرؤية واللغة لتحسين نقل المعرفة.

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li2026-04-01
💻 computer science

Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling

تقدم هذه الورقة Face-to-Face with Jimmy Fallon (F2F-JF)، وهي مجموعة بيانات مدتها 70 ساعة من التفاعلات الثنائية في البرامج الحوارية المصممة لنمذجة المحادثة البشرية التفاعلية، وتثبت فائدتها من خلال تحسين أداء الشخصيات الرقمية المدفوعة بالصوت عبر التكييف البصري عبر الأشخاص.

Ernie Chu, Vishal M. Patel2026-04-01
💻 computer science

DF-ACBlurGAN: Structure-Aware Conditional Generation of Internally Repeated Patterns for Biomaterial Microtopography Design

تقدم هذه الورقة البحثية نموذج DF-ACBlurGAN، وهو شبكة خصومية توليدية شرطية مدركة للهيكل تستفيد من تحليل النطاق الترددي والتمويه المتكيف مع المقياس لتخليق تضاريس مجهرية للمواد الحيوية ذات أنماط تكرار داخلية دقيقة وقابلة للتحكم تتوافق مع نتائج استجابة بيولوجية محددة.

Rongjun Dong, Xin Chen, Morgan R Alexander, Karthikeyan Sivakumar, Reza Omdivar, David A Winkler, Grazziela Figueredo2026-04-01