🤖 AI

Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play

يُعد Vision-Zero إطار عمل قابلاً للتوسع وخالياً من التسميات، يُمكّن نماذج الرؤية واللغة من تحسين ذاتها من خلال ألعاب لعب ذاتي استراتيجية متعددة الوكلاء يتم إنشاؤها من صور عشوائية، وذلك باستخدام خوارزمية تحسين سياسة اللعب الذاتي التكرارية لتحقيق أداء فائق في أحدث التقنيات دون الحاجة إلى تعليق بشري.

Qinsi Wang, Bo Liu, Tianyi Zhou, Jing Shi, Yueqian Lin, Yiran Chen, Hai Helen Li, Kun Wan, Wentian Zhao2026-03-05
🤖 AI

Training-Free Reward-Guided Image Editing via Trajectory Optimal Control

تقدم هذه الورقة إطار عمل خالٍ من التدريب لتحرير الصور الموجه بالمكافأة، حيث تصيغ العملية كمسألة تحكم أمثل للمسار، مما يمكن النموذج من تعزيز أهداف محددة مع الحفاظ على دقة الصورة المصدر دون الحاجة إلى تدريب إضافي أو المعاناة من اختراق المكافأة.

Jinho Chang, Jaemin Kim, Jong Chul Ye2026-03-05
💻 computer science

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

تتناول هذه الورقة البحثية أوجه القصور في نماذج توليد الصور الحالية في التعامل مع المرئيات الهيكلية من خلال تقديم إطار عمل شامل يتضمن مجموعة بيانات مكونة من 1.3 مليون زوج، ونموذج VLM-FLUX.1 موحد تم تدريبه باستخدام منهج تعليمي ثلاثي المراحل واستدلال خارجي، ومعيار StructBench مع مقياس StructScore لتقييم وتحسين الدقة الواقعية في توليد الرسوم البيانية والمخططات وتعديلها.

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li2026-03-05
💻 computer science

Weakly Supervised Concept Learning with Class-Level Priors for Interpretable Medical Diagnosis

تقدم هذه الورقة "متنبئ المفاهيم الموجه بالأولويات" (PCP)، وهو إطار عمل للتعلم الخاضع للإشراف الضعيف يستفيد من أولويات المفاهيم على مستوى الفئة والانتظام لتمكين تشخيص طبي موثوق وقابل للتفسير دون الحاجة إلى تعليقات توضيحية مكلفة للمفاهيم، متفوقاً بشكل كبير على النماذج المرجعية ذات التعلم الصفري مع مضاهاة النماذج الخاضعة للإشراف الكامل.

Md Nahiduzzaman, Steven Korevaar, Alireza Bab-Hadiashar, Ruwan Tennakoon2026-03-05
🤖 AI

Improving Multi-View Reconstruction via Texture-Guided Gaussian-Mesh Joint Optimization

تقترح هذه الورقة إطاراً موحداً للتحسين المشترك السلس بين "Gaussian" والشبكة (mesh)، والذي يعمل في آن واحد على تحسين هندسة الشبكة وألوان الرؤوس باستخدام توجيه النسيج والرندرة القابلة للتفاضل لتحقيق عمليات إعادة بناء ثلاثية الأبعاد عالية الجودة مناسبة لمهام التحرير اللاحقة.

Zhejia Cai, Puhua Jiang, Shiwei Mao, Hongkun Cao, Ruqi Huang2026-03-05
🤖 machine learning

NeuCLIP: Efficient Large-Scale CLIP Training with Neural Normalizer Optimization

يُعد NeuCLIP إطار عمل تحسين مبتكر يعيد صياغة فقدان التباين (contrastive loss) باستخدام التحليل المحدب والمتغير لاستبدال مُقدِّرات المُطَبِّع لكل عينة غير الفعالة بشبكة عصبية مدمجة، مما يُمكِّن من تدريب نماذج CLIP واسعة النطاق بدقة وكفاءة أكبر عبر مجموعات بيانات تتراوح من ملايين إلى مليارات العينات.

Xiyuan Wei, Chih-Jen Lin, Tianbao Yang2026-03-05
💻 computer science

Skullptor: High Fidelity 3D Head Reconstruction in Seconds with Multi-View Normal Prediction

يسد "سكالبتور" (Skullptor) الفجوة بين إعادة البناء الفعالة من صورة واحدة وبين التصوير المساحي متعدد الرؤى عالي الدقة، وذلك عبر الجمع بين نموذج للتنبؤ بالأسطح الطبيعية يعتمد على الانتباه عبر الرؤى وبين تحسين التصيير العكسي، لتحقيق إعادة بناء ثلاثية الأبعاد مفصلة للرأس في ثوانٍ معدودة مع تقليل المتطلبات المتعلقة بالكاميرا والحوسبة.

Noé Artru, Rukhshanda Hussain, Emeline Got, Alexandre Messier, David B. Lindell, Abdallah Dib2026-03-05
💻 computer science

EvalMVX: A Unified Benchmarking for Neural 3D Reconstruction under Diverse Multiview Setups

تقدم هذه الورقة البحثية EvalMVX، وهي مجموعة بيانات شاملة من العالم الحقيقي تضم 25 جسماً مع نماذج شبكية (meshes) حقيقية متوافقة تم التقاطها تحت ظروف إضاءة وزوايا رؤية متنوعة، لإنشاء معيار موحد للتقييم والمقارنة الكمية لطرق الاستعادة الخاصة بالرؤية متعددة المناظر العصبية (neural multiview stereo)، والستيريوفوتومتري (photometric stereo)، والاستعادة من الاستقطاب (shape-from-polarization).

Zaiyan Yang, Jieji Ren, Xiangyi Wang, zonglin li, Xu Cao, Heng Guo, Zhanyu Ma, Boxin Shi2026-03-05
🤖 AI

ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion

تقترح الورقة البحثية إطار عمل ITO، الذي يعزز التدريب المسبق التبايني بين الصور والنصوص من خلال دمج المحاذاة المتعددة متعددة الوسائط مع وحدة دمج خفيفة الوزن وغير مستخدمة أثناء الاستدلال لتقليل الفجوات بين الوسائط والتفوق على النماذج المرجعية الحالية عبر مختلف المعايير.

HanZpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zonglin Zhao, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He2026-03-05