🤖 machine learning

SCOPE: Scene-Contextualized Incremental Few-Shot 3D Segmentation

يقدم SCOPE إطار عمل جاهز للتشغيل للتقطيع ثلاثي الأبعاد التدريجي بلقطات قليلة، والذي يعمل على إثراء نماذج الفئات الجديدة من خلال استرجاع ودمج النماذج الزائفة عالية الثقة من مناطق الخلفية غير المصنفة، مما يحقق أداءً رائدًا في ScanNet وS3DIS مع التخفيف من النسيان الكارثي دون إعادة تدريب العمود الفقري.

Vishal Thengane, Zhaochong An, Tianjin Huang, Son Lam Phung, Abdesselam Bouzerdoum, Lu Yin, Na Zhao, Xiatian Zhu2026-03-09
💻 computer science

Multimodal Large Language Models as Image Classifiers

تُظهر هذه الورقة أن ضعف الأداء المتصور لنماذج اللغات الكبيرة متعددة الوسائط (MLLMs) في تصنيف الصور هو إلى حد كبير نتاج لبروتوكولات تقييم معيبة وحقائق أرضية مشوبة بالضجيج وليس عجزاً حقيقياً في النماذج، مما يكشف أن تصحيح هذه المشكلات يقلص بشكل كبير فجوة الأداء مع النماذج الخاضعة للإشراف، مع تسليط الضوء على إمكانات نماذج اللغات الكبيرة متعددة الوسائط في المساعدة في تنسيق مجموعات البيانات واسعة النطاق.

Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas2026-03-09
💻 computer science

Motion Illusions Generated Using Predictive Neural Networks Also Fool Humans

تقدم هذه الورقة البحثية "مولد الأوهام التطوري" (EIGen)، وهو نموذج توليدي يعتمد على الشبكات العصبية التنبؤية للفيديو، يقوم بإنشاء أوهام حركة بصرية جديدة، والتي تأكد قدرتها على خداع المشاركين البشريين، مما يدعم الفرضية القائلة بأن مثل هذه الأوهام تنشأ من المعالجة التنبؤية للدماغ بدلاً من المدخلات البصرية الخام، ويسلط الضوء على قيمة دراسة "الإخفاقات المدفوعة" في أبحاث الذكاء الاصطناعي.

Lana Sinapayen, Eiji Watanabe2026-03-06
💻 computer science

Motion-Aware Animatable Gaussian Avatars Deblurring

تقدم هذه الورقة طريقة مبتكرة لإعادة بناء صور رمزية بشرية ثلاثية الأبعاد حادة من نماذج غاوس (Gaussian avatars) مباشرة من مقاطع فيديو متعددة المشاهد ضبابية، وذلك عبر الاستفادة من نموذج ضبابية فيزيائي مدرك للثلاثية الأبعاد ونموذج حركة لتحسين تمثيل الرمز والبارامترات الحركية بشكل مشترك.

Muyao Niu, Yifan Zhan, Qingtian Zhu, Zhuoxiao Li, Wei Wang, Zhihang Zhong, Xiao Sun, Yinqiang Zheng2026-03-06
💻 computer science

Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation

تقدم الورقة البحثية "تتبع أي شيء خلف كل شيء" (TABE)، وهو مسار عمل يعتمد على الصفر (zero-shot) يستفيد من الضبط الدقيق للنموذج أثناء وقت الاختبار لنموذج انتشار فيديو مُدرب مسبقاً للقيام بتجزئة كائنات الفيديو غير الظاهرة (amodal video object segmentation) باستخدام قناع استعلام مرئي واحد فقط، مما يلغي الحاجة إلى التدريب المسبق أو إعادة التدريب الخاص بفئة معينة.

Finlay G. C. Hudson, William A. P. Smith2026-03-06
💻 computer science

Learnable Sparsity for Vision Generative Models

تقترح هذه الورقة إطار عمل للتقليم الهيكلي غير معتمد على إعادة التدريب ومستقل عن النموذج لنماذج الانتشار، يستخدم قناعاً قابلاً للتعلم والاشتقاق وهدفاً جديداً من طرف إلى طرف مع فحص نقاط التفتيش لتدرج الخطوة الزمنية لتحقيق خفض في المعلمات يصل إلى 20% في نماذج مثل SDXL وFLUX مع الحفاظ على الأداء وتقليل تكاليف الذاكرة.

Yang Zhang, Er Jin, Wenzhong Liang, Yanfei Dong, Ashkan Khakzar, Philip Torr, Johannes Stegmaier, Kenji Kawaguchi2026-03-06
💻 computer science

3D Dynamics-Aware Manipulation: Endowing Manipulation Policies with 3D Foresight

تقدم هذه الورقة إطار عمل للمناولة مدركاً للديناميكيات ثلاثية الأبعاد، يعزز أداء السياسة من خلال دمج نمذجة العالم ثلاثي الأبعاد عبر مهام التنبؤ بالعمق والتدفق ذاتية الإشراف، مما يزود السياسات باستبصار حيوي ثلاثي الأبعاد من أجل مناولة متينة في العمق دون المساس بسرعة الاستدلال.

Yuxin He, Ruihao Zhang, Xianzu Wu, Zhiyuan Zhang, Cheng Ding, Qiang Nie2026-03-06
🔬 physics

Noise2Ghost: Self-supervised deep convolutional reconstruction for ghost imaging

تقدم الورقة البحثية Noise2Ghost، وهي طريقة تعلم عميق ذاتي الإشراف تحقق جودة فائقة في تقليل الضجيج وإعادة البناء في التصوير الشبحي دون الحاجة إلى بيانات مرجعية نظيفة، مما يتيح التصوير عالي الجودة في سيناريوهات الإضاءة المنخفضة مثل تشتت الأشعة السينية الحساس للجرعة والدراسات البيولوجية.

Mathieu Manni, Dmitry Karpov, K. Joost Batenburg, Sharon Shwartz, Nicola Viganò2026-03-06
💻 computer science

OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

تقترح هذه الورقة إطار عمل OSPO، وهو إطار عمل ذاتي التحسين يعزز المحاذاة الدقيقة بين النص والصورة ويقلل من هلاوس الكائنات من خلال بناء بيانات تفضيل متمحورة حول الكائنات بشكل مستقل واستخدام خسارة SimPO الموزونة بالكائنات، متفوقاً بذلك على كل من أساليب التحسين الذاتي السابقة ونماذج الانتشار المتخصصة.

Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim2026-03-06
💻 computer science

EDITOR: Effective and Interpretable Prompt Inversion for Text-to-Image Diffusion Models

تقترح الورقة البحثية تقنية EDITOR، وهي تقنية فعالة وقابلة للتفسير لعكس المطالبات لنماذج الانتشار من النص إلى الصورة، والتي تجمع بين التهيئة بالوصف المسبق التدريب، وصقل الفضاء الكامن، وتحويل التضمين إلى نص لتتفوق على الأساليب الحالية في تشابه الصور، والمحاذاة النصية، والقدرة على التعميم مع تمكين تطبيقات متنوعة في المجالات اللاحقة.

Mingzhe Li, Kejing Xia, Gehao Zhang, Zhenting Wang, Guanhong Tao, Siqi Pan, Juan Zhai, Shiqing Ma2026-03-06