💻 computer science

CanViT: Toward Active-Vision Foundation Models

تقدم الورقة البحثية CanViT، وهو أول نموذج رؤية نشطة تأسيسي (AVFM) مستقل عن المهام والسياسات، والذي يستخدم بنية مبتكرة من "التمثيل الشبكي الشبكي إلى التمثيل المكاني" (retinotopic-to-spatiotopic) وتدريباً مسبقاً خالياً من الملصقات لتحقيق أداء رائد في التجزئة الدلالية وتصنيف الصور بتكاليف حوسبة أقل بكثير من نماذج الرؤية النشطة الحالية.

Yohaï-Eliel Berreby, Sabrina Du, Audrey Durand, B. Suresh Krishna2026-03-25
💻 computer science

FullCircle: Effortless 3D Reconstruction from Casual 360^\circ Captures

تقدم ورقة "FullCircle" مسار عمل عملي ومجموعة بيانات مرجعية جديدة لإعادة بناء المشاهد ثلاثية الأبعاد بشكل قوي وسهل مباشرة من لقطات كاميرا 360 درجة الخام، متجاوزةً بذلك بفعالية قيود الطرق الحالية عبر إلغاء الحاجة إلى بروتوكولات خاصة ومعالجة رؤية المشغل البشري، مع التفوق على كل من تقنية (3DGS) القياسية والأساليب المرجعية القائمة على المنظور.

Yalda Foroutan, Ipek Oztas, Daniel Rebain, Aysegul Dundar, Kwang Moo Yi, Lily Goli, Andrea Tagliasacchi2026-03-25
💻 computer science

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

تقدم هذه الورقة البحثية Dress-ED، وهي أول مجموعة بيانات واسعة النطاق توحد بين تجربة الملابس الافتراضية (Virtual Try-On)، وإزالة الملابس الافتراضية (Virtual Try-Off)، وتحرير الملابس الموجه بالنص مع أكثر من 146 ألف عينة مدفوعة بالتعليمات، إلى جانب إطار عمل انتشار متعدد الوسائط موحد لتمكين توليد أزياء تفاعلي وقابل للتحكم.

Fulvio Sanguigni, Davide Lobba, Bin Ren, Marcella Cornia, Nicu Sebe, Rita Cucchiara2026-03-25
🤖 AI

To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models

تكشف هذه الورقة عن مقايضة حرجة بين التجذر والتملق في النماذج اللغوية الرؤية الطبية، حيث تكون النماذج الأكثر مقاومة للهلوسة هي الأكثر تملقاً، مما يثبت من خلال مقاييس جديدة أن النماذج الحالية ذات 7-8 مليارات معلمة تفتقر إلى المتانة والتجذر المتزامنين اللازمين للنشر السريري الآمن.

OFM Riaz Rahman Aranya, Kevin Desai2026-03-25
🤖 AI

Toward Faithful Segmentation Attribution via Benchmarking and Dual-Evidence Fusion

تقدم هذه الورقة معياراً قابلاً لإعادة الإنتاج لتقييم مدى أمانة ومتانة طرق الإسناد في التجزئة الدلالية، وتقترح تقنية الإسناد بالدليل المزدوج (DEA)، وهي تقنية دمج خفيفة الوزن تعمل على تحسين الأمانة القائمة على الحذف بشكل كبير من خلال الجمع بين إشارات التدرج والتدخل.

Abu Noman Md Sakib, OFM Riaz Rahman Aranya, Kevin Desai, Zijie Zhang2026-03-25
💻 computer science

Pretext Matters: An Empirical Study of SSL Methods in Medical Imaging

تُظهر هذه الدراسة التجريبية أن استراتيجية التعلم الذاتي الخاضعة للإشراف المثلى للتصوير الطبي تعتمد على التنظيم المكاني للإشارات ذات الصلة سريرياً، حيث تتفوق بنيات التضمين المشترك (JEAs) في المهام الموضعية مثل علم الأمراض النسيجي، بينما تؤدي بنيات التنبؤ بالتضمين المشترك (JEPAs) بشكل أفضل في البيانات ذات البنية العالمية مثل الموجات فوق الصوتية، وهو اكتشاف أكده خبراء طبيون.

Vedrana Ivezić, Mara Pleasure, Ashwath Radhachandran, Saarang Panchavati, Shreeram Athreya, Vivek Sant, Benjamin Emert (…)2026-03-25
💻 computer science

Large-Scale Avalanche Mapping from SAR Images with Deep Learning-based Change Detection

تقدم هذه الورقة مساراً معالجةً متكاملاً (end-to-end) يعتمد على التعلم العميق لرسم خرائط الانهيارات الثلجية واسعة النطاق باستخدام صور رادار الفتحة الاصطناعية (SAR) من قمر "سنتينل-1" ثنائي التوقيت، وهو ما يحقق أداءً عالياً في الكشف عبر مناطق جبلية متعددة ويؤسس لمجموعة بيانات مرجعية قابلة لإعادة الإنتاج للبحوث المستقبلية.

Mattia Gatti, Alberto Mariani, Ignazio Gallo, Fabiano Monti2026-03-25
🤖 AI

WiFi2Cap: Semantic Action Captioning from Wi-Fi CSI via Limb-Level Semantic Alignment

تقدم الورقة البحثية WiFi2Cap، وهو إطار عمل يحافظ على الخصوصية ويقوم بتوليد أوصاف لغوية طبيعية دقيقة من إشارات مؤشر حالة الوصلة (CSI) الخاصة بشبكات الواي فاي، وذلك عبر الاستفادة من محاذاة "المعلم-الطالب" بين الرؤية واللغة مع فقدان اتساق المرآة لحل الغموض الاتجاهي، وقد تم التحقق من صحته باستخدام مجموعة بيانات متزامنة ومقترحة جديدة تتكون من (CSI-RGB-sentence).

Tzu-Ti Wei, Chu-Yu Huang, Yu-Chee Tseng, Jen-Jee Chen2026-03-25
💻 computer science

How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos

تقيم هذه الدراسة فعالية نماذج الرؤية واللغة (VLMs) الجاهزة في اكتشاف الأخطاء البصرية عبر 41 ساعة من فيديوهات أسلوب اللعب، حيث وجدت أنه بينما يعد أداء الخط الأساسي واعداً، فإن استراتيجيات التحسين الشائعة التي لا تعتمد على الضبط الدقيق لا تحقق سوى تحسينات طفيفة، مما يشير إلى أن التقدم المستقبلي يتطلب مناهج هجينة للتمييز بشكل أفضل بين الشذوذ النصي والبصري.

Wentao Lu, Alexander Senchenko, Alan Sayle, Abram Hindle, Cor-Paul Bezemer2026-03-25
💻 computer science

Multimodal Industrial Anomaly Detection via Geometric Prior

تقدم هذه الورقة البحثية نموذج GPAD، وهو شبكة مبتكرة للكشف عن الشذوذ الصناعي متعددة الوسائط تستفيد من نموذج خبير في السحابة النقطية لاستخراج الأولويات الهندسية عبر ناقلات المتجهات العمودية التفاضلية وتوظف استراتيجية دمج ثنائية المراحل للتفوق بشكل كبير على الأساليب الرائدة في اكتشاف عيوب الأسطح ثلاثية الأبعاد المعقدة.

Min Li, Jinghui He, Gang Li, Jiachen Li, Jin Wan, Delong Han2026-03-25