🤖 AI

Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner

تقدم الورقة البحثية Chart-R1، وهو نموذج رؤية ولغة خاص بنطاق المخططات البيانية، يستخدم نهجاً برمجياً لتخليق البيانات واستراتيجية تدريب ثنائية المرحلة تجمع بين الإشراف بسلسلة الأفكال والضبط الدقيق بالتعزيز الحساس عددياً لتعزيز قدرات الاستدلال في المخططات بشكل كبير.

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Yufeng Zhong, Lin Ma2026-03-17
💻 computer science

Exemplar Med-DETR: Toward Generalized and Robust Lesion Detection in Mammogram Images and beyond

تقدم هذه الورقة البحثية نموذج Exemplar Med-DETR، وهو كاشف تبايني متعدد الوسائط مبتكر يستفيد من سمات النماذج المثالية الخاصة بكل فئة واستراتيجية تدريب تكرارية لتحقيق أداء رصين ومتفوق في اكتشاف الآفات عبر مختلف الوسائط التصويرية الطبية، بما في ذلك تصوير الثدي الشعاعي، والأشعة السينية للصدر، وتصوير الأوعية الدموية.

Sheethal Bhat, Bogdan Georgescu, Adarsh Bhandary Panambur, Mathias Zinnen, Tri-Thien Nguyen, Awais Mansoor, Karim Khalif (…)2026-03-17
💬 NLP

STEMTOX: From Social Tags to Fine-Grained Toxic Meme Detection via Entropy-Guided Multi-Task Learning

تقدم هذه الورقة مجموعة بيانات TOXICTAGS المكونة من 6,300 ميم (meme) مُعلق عليها، والمُثرية بوسوم اجتماعية، وتقترح إطار عمل STEMTOX، وهو إطار تعلم متعدد المهام موجه بالإنتروبيا يستفيد من هذه الوسوم لتحسين الكشف عن الميمات السامة بدقة عالية باستخدام نماذج الرؤية واللغة.

Subhankar Swain, Naquee Rizwan, Vishwa Gangadhar S, Nayandeep Deb, Animesh Mukherjee2026-03-17
🤖 AI

Extending Foundational Monocular Depth Estimators to Fisheye Cameras with Calibration Tokens

تقدم هذه الورقة "رموز المعايرة" (Calibration Tokens)، وهي آلية تكييف خفيفة الوزن ذات تعلم ذاتي، تعمل على محاذاة التضمينات الكامنة لمقدرات العمق أحادية العدسة التأسيسية المدربة على الصور المنظورية مع صور عين السمكة، مما يتيح تقديرًا دقيقًا للعمق لكاميرات عين السمكة دون الحاجة إلى إعادة التدريب أو الضبط الدقيق.

Suchisrit Gangopadhyay, Jung-Hee Kim, Xien Chen, Patrick Rim, Hyoungseob Park, Alex Wong2026-03-17
💻 computer science

UnLoc: Leveraging Depth Uncertainties for Floorplan Localization

يُعد UnLoc إطار عمل فعالاً وقائماً على البيانات لتحديد موقع الكاميرا المتسلسل ضمن المخططات الطابقية، حيث يستفيد من نماذج العمق أحادية العدسة الجاهزة والمعززة بتقدير صريح لعدم اليقين لتحقيق دقة ومتانة فائقتين مقارنة بالأسالهم الرائدة.

Matthias Wüest, Francis Engelmann, Ondrej Miksik, Marc Pollefeys, Daniel Barath2026-03-17
💻 computer science

From Orthomosaics to Raw UAV Imagery: Enhancing Palm Detection and Crown-Center Localization

تُظهر هذه الدراسة أن استخدام صور الطائرات بدون طيار الخام، بدلاً من الصور الجوية المصححة (orthomosaics)، يعزز بشكل كبير من عملية اكتشاف أشجار النخيل وتحديد مراكز تيجانها في الغابات الاستوائية، مما يقدم نهجاً أكثر فعالية للمراقبة البيئية وإدارة الحفظ.

Rongkun Zhu, Kangning Cui, Wei Tang, Rui-Feng Wang, Sarra Alqahtani, David Lutz, Fan Yang, Paul Fine, Jordan Karubian, R (…)2026-03-17
💻 computer science

Revisiting Vision Language Foundations for No-Reference Image Quality Assessment

تقدم هذه الورقة تقييماً منهجياً لستة نماذج تأسيسية للرؤية واللغة في مجال تقييم جودة الصور بدون مرجع، كاشفةً عن تفوق نموذج SigLIP2 وأن اختيار التنشيط القابل للتعلم يتفوق على الدوال الثابتة، مما يؤدي إلى إرساء أداء جديد هو الأفضل حالياً في عدة معايير قياسية.

Ankit Yadav, Ta Duc Huy, Lingqiao Liu2026-03-17
💻 computer science

UniPrototype: Humn-Robot Skill Learning with Uniform Prototypes

يعالج UniPrototype تحدي ندرة البيانات في تعلم الروبوتات من خلال تقديم إطار عمل مبتكر ينقل معرفة التلاعب البشري إلى الروبوتات عبر آلية اكتشاف النماذج الأولية التركيبية مع التعيينات اللينة واستراتيجية اختيار تكيفية، مما يحسن بشكل كبير من كفاءة التعلم وأداء المهام عبر كل من بيئات المحاكاة والبيئات الواقعية.

Xiao Hu, Qi Yin, Yangming Shi, Yang Ye2026-03-17
💻 computer science

Multi-View Camera System for Variant-Aware Autonomous Vehicle Inspection and Defect Detection

تقدم هذه الورقة منصة فحص المركبات الآلي (AVI)، وهي نظام تعلم عميق متعدد الرؤى يعمل في الوقت الفعلي، يدمج بيانات الكاميرا المتزامنة مع محرك قواعد دلالي للتحقق من متغيرات المركبات وكشف عيوب السطح في آن واحد بدقة تبلغ 93% وإنتاجية تصل إلى 3.3 مركبة في الدقيقة.

Yash Kulkarni, Raman Jha, Renu Kachhoria2026-03-17
🤖 AI

Purrception: Variational Flow Matching for Vector-Quantized Image Generation

يُعدّ Purrception إطار عمل جديد للمطابقة المتغيرة للتدفق (variational flow matching) لتوليد الصور المكممة متجهياً (vector-quantized)، حيث يجمع بشكل فريد بين ديناميكيات النقل المستمر والإشراف الفئوي الصريح لتحقيق تقارب أسرع في التدريب وجودة صور تنافسية على مجموعة بيانات ImageNet-1k.

Răzvan-Andrei Matişan, Vincent Tao Hu, Grigory Bartosh, Björn Ommer, Cees G. M. Snoek, Max Welling, Jan-Willem van de Me (…)2026-03-17