💬 NLP

Vero: An Open RL Recipe for General Visual Reasoning

تُعد "فيرو" (Vero) عائلة مفتوحة بالكامل من نماذج الرؤية واللغة التي تحقق أداءً رائدًا في مجال الاستدلال البصري العام من خلال توسيع نطاق التعلم التعزيزي عبر 600 ألف عينة متنوعة ومكافآت موجهة للمهام، مما يثبت أن التغطية الواسعة للبيانات هي المحرك الأساسي للنجاح دون الاعتماد على بيانات أو أنماط تفكير مملوكة لجهات خاصة.

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu2026-04-07
🤖 AI

Your Pre-trained Diffusion Model Secretly Knows Restoration

تكشف هذه الورقة أن نماذج الانتشار المدربة مسبقاً تمتلك بطبيعتها قدرات ترميم يمكن إطلاقها من خلال تدريب تضمينات النصوص (prompt embeddings) ضمن صياغة جسر الانتشار (diffusion bridge) لمواءمة ديناميكيات التدريب والاستدلال، مما يحقق ترميماً عالي الأداء وشاملاً (all-in-one) دون الحاجة إلى ضبط دقيق أو وحدات تحكم متخصصة.

Sudarshan Rajagopalan, Vishal M. Patel2026-04-07
🤖 machine learning

Swish-T : Enhancing Swish Activation with Tanh Bias for Improved Neural Network Performance

تقدم هذه الورقة عائلة دوال التنشيط Swish-T، التي تعزز دالة Swish الأصلية من خلال دمج انحياز التان هانت (Tanh) لإنشاء منحنيات أكثر سلاسة وغير رتيبة تُحسن تجريبيًا أداء الشبكات العصبية عبر مختلف النماذج ومجموعات البيانات المرجعية.

Youngmin Seo, Jinha Kim, Unsang Park2026-04-06
🤖 AI

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

تقدم هذه الورقة البحثية ForgeryGPT، وهو إطار عمل جديد للنماذج اللغوية الكبيرة متعددة الوسائط يعزز كشف تزييف الصور وتحديد مواقعه من خلال دمج مستخرج تزييف مدرك للقناع (Mask-Aware Forgery Extractor) لالتقاط الارتباطات الجنائية عالية الرتبة وتمكين التحليل القابل للتفسير على مستوى البكسل عبر استراتيجية تدريب متخصصة مكونة من ثلاث مراحل.

Jiawei Liu, Fanrui Zhang, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha2026-04-06
⚡ electrical engineering

Clinical utility of foundation models in musculoskeletal MRI for biomarker fidelity and predictive outcomes

تُظهر هذه الدراسة أن النماذج التأسيسية التي تم ضبطها بدقة يمكنها تحويل صور الرنين المغناطيسي الروتينية للجهاز العضلي الهيكلي إلى مؤشرات حيوية كمية معيارية وموثوقة، تعمل في الوقت ذاته على تحسين سير العمل السريري من خلال الفرز التلقائي وتتيح التنبؤ الدقيق طويل الأمد بمخاطر استبدال الركبة وفصال العظام.

Gabrielle Hoyer, Michelle W Tong, Rupsa Bhattacharjee, Valentina Pedoia, Sharmila Majumdar2026-04-06
🤖 machine learning

gen2seg: Generative Models Enable Generalizable Instance Segmentation

تقترح الورقة البحثية "gen2seg"، وهي طريقة تعيد توظيف النماذج التوليدية مسبقة التدريب مثل Stable Diffusion وMAE من أجل تقسيم مثالي مستقل عن الفئة عبر ضبطها بدقة باستخدام فقد تلوين المثيل على مجموعة بيانات ضيقة، محققةً تعميماً قوياً لصفر من المعرفة (zero-shot) يضاهي أو يتفوق على النماذج الخاضعة للإشراف المكثف مثل SAM في أنواع الكائنات غير المرئية والحدود الغامضة.

Om Khangaonkar, Hamed Pirsiavash2026-04-06
🤖 AI

Differential-UMamba: Rethinking Tumor Segmentation Under Limited Data Scenarios

تقدم الورقة البحثية Diff-UMamba، وهي بنية مبتكرة تجمع بين UNet وMamba مع وحدة لتقليل الضوضاء تعتمد على تفاضل الإشارة لتعزيز دقة ومتانة تقسيم الأورام في سيناريوهات التصوير الطبي شحيحة البيانات.

Dhruv Jain, Romain Modzelewski, Romain Herault, Clement Chatelain, Eva Torfeh, Sebastien Thureau2026-04-06
🤖 AI

SmartCLIP: Modular Vision-language Alignment with Identification Guarantees

تقدم هذه الورقة SmartCLIP، وهو إطار عمل معياري مبتكر قائم على ضمانات نظرية يعمل بفعالية على فك تشابك التمثيلات المرئية ومواءمتها مع المفاهيم النصية بمستويات متفاوتة من الدقة للتغلب على مشكلات عدم توافق المعلومات وتشابكها المتأصلة في نماذج CLIP القياسية.

Shaoan Xie, Lingjing Kong, Yujia Zheng, Yu Yao, Zeyu Tang, Eric P. Xing, Guangyi Chen, Kun Zhang2026-04-06
🔬 materials science

Geometric Analysis of Magnetic Labyrinthine Stripe Evolution via U-Net Segmentation

تقدم هذه الورقة إطار عمل للتعلم العميق يعتمد على بنية U-Net قوية، مدمجاً مع مسار تحليل هندسي لتوصيف تطور أنماط الخطوط المتاهية المغناطيسية في أغشية Bi:YIG كمياً، مما يكشف عن أنماط انتقال هيكلية متميزة مرتبطة بقطبية المجال أثناء التخمير المغناطيسي.

Vinícius Yu Okubo, Kotaro Shimizu, B. S. Shivaran, Gia-Wei Chern, Hae Yong Kim2026-04-06
💻 computer science

Learning Adaptive Pseudo-Label Selection for Semi-Supervised 3D Object Detection

تقترح هذه الورقة إطار عمل جديد للكشف عن الأجسام ثلاثية الأبعاد بنظام التعلم شبه المُشرف، والذي يستخدم وحدة تسمية مستعارة قابلة للتعلم لاختيار التسميات المستعارة عالية الجودة بشكل تكيفي عبر دمج الدرجات وتحديد عتبات مدركة للسياق، مما يتغلب على قيود طرق العتبة اليدوية أو الثابتة.

Taehun Kong, Tae-Kyun Kim2026-04-06