💻 computer science

Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis

تقدم هذه الورقة إطار عمل لإزالة الانحياز قائم على التوليد للكشف عن الكائنات، والذي يستخدم درجة التمثيل لتحديد الاحتياجات الحقيقية للبيانات بما يتجاوز مجرد التكرار، ويوظف مخططات بصرية مع محاذاة توليدية لتخليق مشاهد عالية الدقة وغير منحازة، مما يحسن أداء الكشف بشكل كبير للأجسام غير الممثلة كفاية.

Xinhao Cai, Liulei Li, Gensheng Pei, Tao Chen, Jinshan Pan, Yazhou Yao, Wenguan Wang2026-03-18
💻 computer science

Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models

تقدم هذه الورقة إطاراً موحداً وقابلاً لإعادة الإنتاج لتقييم التحيز الثقافي في كل من نماذج توليد الصور من النصوص ونماذج توليد الصور من الصور غير المستكشفة كفايةً، مما يكشف أن الأنظمة الحالية تنحاز تلقائياً نحو صور نمطية تابعة للشمال العالمي، وتُضعف الدقة الثقافية أثناء التحرير التكراري، وتعتمد على إشارات سطحية بدلاً من التغييرات المدركة للسياق.

Huichan Seo, Sieun Choi, Minki Hong, Yi Zhou, Junseo Kim, Lukman Ismaila, Naome Etori, Mehul Agarwal, Zhixuan Liu, Jihie (…)2026-03-18
🤖 AI

Exploring the Underwater World Segmentation without Extra Training

تقدم هذه الورقة البحثية AquaOV255، وهي أول مجموعة بيانات لتقسيم الصور تحت الماء ذات دقة عالية وواسعة النطاق، وEarth2Ocean، وهو إطار عمل للتقسيم مفتوح المفردات لا يتطلب تدريباً يعمل على نقل نماذج الرؤية واللغة البرية إلى البيئات تحت الماء بفعالية من خلال التوجيه الهندسي والمحاذاة الدلالية، مما يضع معياراً جديداً لتقسيم الكائنات البحرية.

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li2026-03-18
💻 computer science

Lite Any Stereo: Efficient Zero-Shot Stereo Matching

تقدم الورقة البحثية "Lite Any Stereo"، وهو إطار عمل فائق الخفة للمطابقة المجسمة، يحقق أفضل النتائج في التعميم الصفري (zero-shot generalization) على المعايير المرجعية للواقع الحقيقي بتكلفة حوسبة تقل عن 1% من الطرق الدقيقة الحالية، وذلك عبر توظيف هيكل خلفي مدمج، وتجميع تكلفة هجين، واستراتيجية تدريب ثلاثية المراحل.

Junpeng Jing, Weixun Luo, Ye Mao, Krystian Mikolajczyk2026-03-18
💻 computer science

MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registration

يُعد MorphSeek إطار عمل جديداً غير مرتبط بهيكل محدد لتسجيل الصور القابلة للتشوه، حيث يعيد صياغة المهمة كعملية تحسين مستمرة مكانياً في فضاء الميزات الكامن باستخدام سياسة غاوسية عشوائية وتحسين السياسة النسبي للمجموعات لتحقيق دقة عالية وكفاءة في التسمية مع حد أدنى من العبء الحسابي.

Runxun Zhang, Yizhou Liu, Li Dongrui, Bo XU, Jingwei Wei2026-03-18
💻 computer science

Order Matters: 3D Shape Generation from Sequential VR Sketches

تقدم هذه الورقة VRSketch2Shape، وهو إطار عمل ومجموعة بيانات مبتكرة تولد أشكالاً ثلاثية الأبعاد عالية الدقة من رسومات الواقع الافتراضي المتسلسلة عبر الاستفادة من ترتيب الضربات الزمني من خلال مشفر مدرك للترتيب ومولد قائم على الانتشار.

Yizi Chen, Sidi Wu, Tianyi Xiao, Nina Wiedemann, Loic Landrieu2026-03-18
💻 computer science

Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description

تقدم هذه الورقة VLM-IRIS، وهو إطار عمل يعتمد على التعلم الصفري (zero-shot) يعمل على تطويع النماذج الرؤية-اللغوية القائمة على CLIP لتناسب الاستشعار الصناعي بالأشعة تحت الحمراء عبر تحويل الصور الحرارية إلى تمثيلات متوافقة مع نظام RGB، مما يتيح الكشف الدقيق عن قطع العمل في التصنيع الإضافي دون الحاجة إلى إعادة تدريب النموذج أو استخدام مجموعات بيانات مصنفة.

Nazanin Mahjourian, Vinh Nguyen2026-03-18
💻 computer science

Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching

يقدم Fast-FoundationStereo عائلة من بنيات مطابقة الاستريو في الوقت الفعلي التي تحقق تعميماً قوياً لصفر المحاولات (zero-shot) عبر الجمع بين تقنيات تقطير المعرفة، والبحث عن البنية العصبية القائم على الكتل، والتقليم الهيكلي لسد الفجوة بين دقة النماذج التأسيسية وسرعة الطرق الفعالة.

Bowen Wen, Shaurya Dewan, Stan Birchfield2026-03-18
💻 computer science

WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering

يُعد WildCap إطار عمل هجينًا مبتكرًا للرندرة العكسية يتيح التقاط عتامة الوجه (albedo) بجودة عالية من فيديوهات الهواتف الذكية غير المقيدة، وذلك عبر الجمع بين طريقة تحويل إضاءة قائمة على البيانات ونهج قائم على النماذج يتميز بنموذج إضاءة لشبكة التكسل (texel grid) ومسبقات الانتشار (diffusion priors) لفصل الإضاءة المعقدة عن خصائص المواد بفعالية.

Yuxuan Han, Xin Ming, Tianxiao Li, Zhuofan Shen, Qixuan Zhang, Lan Xu, Feng Xu2026-03-18
🤖 AI

DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model

تقدم هذه الورقة إطار عمل DiG (التأريض التفاضلي)، وهو إطار عمل مبتكر يعزز الإدراك البصري دقيق التفاصيل في النماذج اللغوية الكبيرة متعددة الوسائط من خلال تدريبها على تحديد الفروق بين أزواج الصور باستخدام خط معالجة بيانات للرندرة ثلاثية الأبعاد مؤتمت وتعلم منهجي، مما يؤدي إلى تحسينات كبيرة في الأداء عبر مختلف معايير الاستدلال البصري.

Zhou Tao, Shida Wang, Yongxiang Hua, Haoyu Cao, Linli Xu2026-03-18