🤖 AI

RandMark: On Random Watermarking of Visual Foundation Models

تقترح هذه الورقة RandMark، وهي طريقة للعلامات المائية العشوائية تقوم بدمج العلامات المائية الرقمية في التمثيلات الداخلية للنماذج التأسيسية البصرية باستخدام شبكة مشفر-وفك تشفير صغيرة لتمكين التحقق القوي من الملكية مع انخفاض معدلات الكشف الخاطئ والخطأ في الكشف.

Anna Chistyakova, Mikhail Pautov2026-03-12
💻 computer science

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

تقدم الورقة البحثية WalkGPT، وهو نموذج لغوي بصري يعتمد على البكسل، يوحّد بين الاستدلال اللغوي والتقسيم لتوفير توجيه للملاحة للمشاة مدرك للعمق، إلى جانب معيار PAVE لتقييم فهم المشاهد المراعي لإمكانية الوصول.

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu2026-03-12
💻 computer science

Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers

تقدم هذه الورقة البحثية إطار العمل "الآن في حينه" (Just-in-Time - JiT)، وهو إطار عمل لا يتطلب تدريباً يعمل على تسريع نماذج محولات الانتشار (Diffusion Transformers) من خلال استغلال التكرار المكاني لحساب التحديثات على مجموعة فرعية متفرقة من رموز الارتكاز (anchor tokens)، محققاً تسريعاً يصل إلى 7 أضعاف مع جودة صورة شبه كاملة على نموذج FLUX.1-dev.

Wenhao Sun, Ji Li, Zhaoqiang Liu2026-03-12
🤖 AI

Taking Shortcuts for Categorical VQA Using Super Neurons

تقدم هذه الورقة البحثية "Super Neurons"، وهي طريقة لا تتطلب تدريباً تستفيد من التنشيطات القياسية (scalar activations) من الرمز الأول المُولّد لإنشاء مصنفات عالية الدقة للأسئلة البصرية الإجابة (VQA) الفئوية، مما يتيح الخروج المبكر للغاية من الطبقة الأولى ويحقق تسريعاً يصل إلى 5.10 ضعفاً مع تحسين الأداء مقارنة بالشبكة الأصلية.

Pierre Musacchio, Jaeyi Jeong, Dahun Kim, Jaesik Park2026-03-12
💻 computer science

Backdoor Directions in Vision Transformers

تتقصى هذه الورقة البحثية هجمات الباب الخلفي في نماذج "Vision Transformers" من خلال تحديد "اتجاه المحفز" السببي في تنشيطات النموذج، وكشف آليات معالجة متميزة لأنواع المحفزات المختلفة، واقتراح مخطط كشف خالٍ من البيانات يعتمد على التفسير الآلي.

Sengim Karayalcin, Marina Krcek, Pin-Yu Chen, Stjepan Picek2026-03-12
💻 computer science

HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation

تقدم هذه الورقة البحثية HanMoVLM، وهو نموذج رؤية ولغة متخصص معزز بسلسلة من التفكير (Chain-of-Thought) التي تم التحقق منها من قبل الخبراء ومجموعة بيانات مبتكرة قائمة على المزاد (HanMo-Bench) لتحقيق تقييم بمستوى احترافي للوحات الصينية والعمل كمدقق عالي الجودة لتحسين توليد الصور الفنية.

Hongji Yang, Yucheng Zhou, Wencheng Han, Songlian Li, Xiaotong Zhao, Jianbing Shen2026-03-12
💻 computer science

A dataset of medication images with instance segmentation masks for preventing adverse drug events

تقدم هذه الورقة MEDISEG، وهي مجموعة بيانات شاملة تضم 8,262 صورة للأدوية مع أقنعة تجزئة مثالية تغطي 32 نوعاً من الحبوب تحت ظروف واقعية متنوعة، مما يعزز بشكل كبير التعرف على الحبوب القائم على الذكاء الاصطناست ومنع الآثار الجانبية الضارة للأدوية من خلال تمكين التدريب القوي والتعلم الفعال من عينات قليلة للسيناريوهات المعقدة مثل الانسداد والازدحام.

W. I. Chu, S. Hirani, G. Tarroni, L. Li2026-03-12
🤖 AI

BALD-SAM: Disagreement-based Active Prompting in Interactive Segmentation

تقدم هذه الورقة البحثية BALD-SAM، وهو إطار عمل مبني على أسس علمية يعمل على تكييف التعلم النشط البايزي من خلال عدم الاتفاق (Bayesian Active Learning by Disagreement) مع الاختيار المكاني للمطالبات في التجزئة التفاعلية، مما يُمكّن رأس تقدير عدم يقين خفيف الوزن على النماذج التأسيسية المجمدة ليتفوق بشكل كبير على التلقين البشري وتلقين النموذج المثالي (oracle) عبر مجالات متنوعة.

Prithwijit Chowdhury, Mohit Prabhushankar, Ghassan AlRegib2026-03-12
💻 computer science

Evaluating Few-Shot Pill Recognition Under Visual Domain Shift

تقيم هذه الدراسة التعرف على الأقراص بأسلوب التعلم من عينات قليلة في ظل تحولات النطاق البصري الواقعية، حيث وجدت أنه بينما يتكيف التصنيف الدلالي بسرعة مع الحد الأدنى من البيانات المصنفة، فإن النشر القوي يتطلب التدريب على مشاهد واقعية متعددة الأجسام للتخفيف من انخفاض الأداء الناتج عن الانسداد والازدحام في تحديد المواقع والاستدعاء.

W. I. Chu, G. Tarroni, L. Li2026-03-12
🤖 AI

On the Reliability of Cue Conflict and Beyond

تنتقد هذه الورقة عدم الاستقرار والغموض في معايير صراع الإشارات الحالية لقياس انحياز الشكل-النسيج للشبكات العصبية، وتقدم إطار عمل REFINED-BIAS، وهو إطار جديد يتميز بأزواج إشارات متوازنة ومقاييس قائمة على الترتيب لتمكين مقارنات موثوقة، وقابلة للتفسير، وعادلة بين النماذج.

Pum Jun Kim, Seung-Ah Lee, Seongho Park, Dongyoon Han, Jaejun Yoo2026-03-12