💻 computer science

Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

تقدم هذه الورقة البحثية LIDA، وهو إطار عمل غير مرتبط بنموذج محدد يعيد صياغة عملية إسناد الصور المولدة بواسطة الذكاء الاصطناعي كمسألة استرجاع مثيل باستخدام بصمات منخفضة البت وتدريب مسبق غير خاضع للإشراف لتحقيق أداء رائد في إعدادات الصفر والتدريب القليل دون الحاجة إلى الوصول إلى النماذج التوليدية الأصلية.

Hongsong Wang, Renxi Cheng, Chaolei Han, Jie Gui2026-03-12
💻 computer science

Need for Speed: Zero-Shot Depth Completion with Single-Step Diffusion

تقدم الورقة البحثية Marigold-SSD، وهو إطار عمل لإكمال العمق يعتمد على دمج متأخر وخطوة واحدة، يستفيد من مسبقات الانتشار القوية لتحقيق إدراك ثلاثي الأبعاد فعال وقوي وصفرِي التدريب مع سرعة استنتاج أكبر بكثير وتكاليف تدريب دنيا مقارنة بالطرق القائمة على الانتشار.

Jakub Gregorek, Paraskevas Pegios, Nando Metzger, Konrad Schindler, Theodora Kontogianni, Lazaros Nalpantidis2026-03-12
💬 NLP

MUNIChus: Multilingual News Image Captioning Benchmark

تقدم الورقة البحثية MUNIChus، وهو أول معيار متعدد اللغات لوصف صور الأخبار يضم تسع لغات بما في ذلك اللغات ذات الموارد المنخفضة، لمعاللة ندرة مجموعات البيانات غير الإنجليزية وتقييم أداء النماذج الحديثة في هذه المهمة الصعبة.

Yuji Chen, Alistair Plum, Hansi Hettiarachchi, Diptesh Kanojia, Saroj Basnet, Marcos Zampieri, Tharindu Ranasinghe2026-03-12
💻 computer science

Less is More: Decoder-Free Masked Modeling for Efficient Skeleton Representation Learning

تقترح الورقة البحثية إطار عمل SLiM، وهو إطار عمل جديد خالٍ من فك التشفير (decoder-free) يوحد بين النمذجة المقنعة والتعلم التبايني من خلال مشفر مشترك وقناع أنبوب دلالي (semantic tube masking) لتحقيق أداء رائد في التعرف على الأفعال القائم على الهيكل العظمي مع تقليل التكاليف الحسابية بشكل كبير.

Jeonghyeok Do, Yun Chen, Geunhyuk Youk, Munchurl Kim2026-03-12
🤖 AI

Are Video Reasoning Models Ready to Go Outside?

تقدم هذه الورقة البحثية ROVA، وهو إطار تدريب يعزز متانة نماذج الاستدلال المرئي ضد الاضطرابات الواقعية مثل الطقس والانسداد من خلال التدريب التكيفي المدرك للصعوبة ومكافأة الاتساق المدركة للمتانة، والذي تم التحقق من صحته بواسطة معيار PVRBench الجديد الذي يظهر تحسينات كبيرة في الأداء مقارنة بالنماذج الحالية.

Yangfan He, Changgyu Boo, Jaehong Yoon2026-03-12
💻 computer science

A2^2-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks

تقترح الورقة البحثية A²-Edit، وهو إطار عمل موحد لتحرير الصور يستفيد من مجموعة بيانات جديدة واسعة النطاق (UniEdit-500K)، ووحدة "خليط من المحولات" (Mixture of Transformer) للنمذجة الديناميكية للفئات، واستراتيجية تدريب "تخمير القناع" (Mask Annealing) لتحقيق تحرير دقيق وموجه بمرجع لأي كائنات عشوائية باستخدام أقنعة خشنة فقط.

Huayu Zheng, Guangzhao Li, Baixuan Zhao, Siqi Luo, Hantao Jiang, Guangtao Zhai, Xiaohong Liu2026-03-12
💻 computer science

Bioinspired CNNs for border completion in occluded images

تقدم هذه الورقة البحثية BorderNet، وهي شبكة عصبية تلافيفية مستوحاة بيولوجياً تستفيد من النماذج الرياضية لإكمال الحدود في القشرة البصرية لتحسين متانة التصنيف بشكل كبير ضد حالات حجب الخطوط والشبكات عبر مجموعات بيانات MNIST وFashion-MNIST وEMNIST.

Catarina P. Coutinho, Aneeqa Merhab, Janko Petkovic, Ferdinando Zanchetta, Rita Fioresi2026-03-12
🤖 AI

RandMark: On Random Watermarking of Visual Foundation Models

تقترح هذه الورقة RandMark، وهي طريقة للعلامات المائية العشوائية تقوم بدمج العلامات المائية الرقمية في التمثيلات الداخلية للنماذج التأسيسية البصرية باستخدام شبكة مشفر-وفك تشفير صغيرة لتمكين التحقق القوي من الملكية مع انخفاض معدلات الكشف الخاطئ والخطأ في الكشف.

Anna Chistyakova, Mikhail Pautov2026-03-12
💻 computer science

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

تقدم الورقة البحثية WalkGPT، وهو نموذج لغوي بصري يعتمد على البكسل، يوحّد بين الاستدلال اللغوي والتقسيم لتوفير توجيه للملاحة للمشاة مدرك للعمق، إلى جانب معيار PAVE لتقييم فهم المشاهد المراعي لإمكانية الوصول.

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu2026-03-12
💻 computer science

Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers

تقدم هذه الورقة البحثية إطار العمل "الآن في حينه" (Just-in-Time - JiT)، وهو إطار عمل لا يتطلب تدريباً يعمل على تسريع نماذج محولات الانتشار (Diffusion Transformers) من خلال استغلال التكرار المكاني لحساب التحديثات على مجموعة فرعية متفرقة من رموز الارتكاز (anchor tokens)، محققاً تسريعاً يصل إلى 7 أضعاف مع جودة صورة شبه كاملة على نموذج FLUX.1-dev.

Wenhao Sun, Ji Li, Zhaoqiang Liu2026-03-12