💻 computer science

DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation

تقترح الورقة البحثية إطار عمل DCARL، وهو إطار عمل تلقائي الترتيب يعتمد على استراتيجية "فرق تسد"، يجمع بين مولد إطارات رئيسية مخصص لضمان الاتساق الهيكلي العالمي ومولد استكمال (interpolation) لضمان التماسك المحلي، مما يتيح توليد فيديو عالي الدقة ومستقر بمسارات طويلة تصل إلى 32 ثانية مع التفوق على النماذج المرجعية الحالية في جودة الصورة والالتزام بحركة الكاميرا.

Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen2026-03-27
🤖 machine learning

NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders

تقدم هذه الورقة NeuroVLM-Bench، وهو معيار شامل يقيم عشرين من النماذج اللغوية الكبيرة الرائدة والمزودة بقدرات رؤية في مهام التصوير العصبي ثنائي الأبعاد، كاشفةً أنه بينما يتم التعامل جيداً مع السمات التقنية للصور، يظل الاستنتاج التشخيصي يمثل تحدياً، حيث تتصدر النماذج المملوكة مثل Gemini-2.5-Pro من حيث الدقة، ويظهر نموذج MedGemma-1.5-4B أكبر قدر من الواعد بين البنيات ذات الأوزان المفتوحة.

Katarina Trojachanec Dineva, Stefan Andonov, Ilinka Ivanoska, Ivan Kitanovski, Sasho Gramatikov, Tamara Kostova, Monika (…)2026-03-27
🤖 AI

Gaze patterns predict preference and confidence in pairwise AI image evaluation

تُظهر هذه الدراسة أن بيانات تتبع حركة العين، ولا سيما أنماط التحديق مثل تأثير الشلال، ووقت المكوث، وتكرار الانتقال، يمكن أن تتنبأ بفعالية بكل من الاختيار البشري ومستويات الثقة أثناء تقييمات الصور المولدة بالذكاء الاصطناعي بنظام المقارنة الثنائية، مما يقدم إشارات ضمنية قيمة لتحسين جودة توصيف التفضيلات.

Nikolas Papadopoulos, Shreenithi Navaneethan, Sheng Bai, Ankur Samanta, Paul Sajda2026-03-27
🤖 machine learning

Towards automatic smoke detector inspection: Recognition of the smoke detectors in industrial facilities and preparation for future drone integration

تقدم هذه الورقة نظاماً آلياً للتعرف على كواشف الدخان للمنشآت الصناعية، حيث تُثبت أن نموذج YOLOv11n يحقق أداءً فائقاً (0.884 mAP@0.5) مقارنة بكواشف أخرى مثل SSD وRT-DETRv2 عند تدريبه على مزيج من البيانات الحقيقية وشبه الاصطناعية، مما يتيح عمليات تفتيش مستقبلية أكثر أماناً وكفاءة تعتمد على الطائرات بدون طيار.

Lukas Kratochvila, Jakub Stefansky, Simon Bilik, Robert Rous, Tomas Zemcik, Michal Wolny, Frantisek Rusnak, Ondrej Cech (…)2026-03-27
🤖 AI

How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning

تقدم هذه الورقة DreamHouse، وهو معيار مرجعي جديد للاستدلال الفيزيائي التوليدي يقيم نماذج الرؤية واللغة بناءً على قدرتها على تشييد منازل ذات هياكل خشبية سليمة إنشائياً ومتوافقة مع الأكواد من خلال تفاعل وكيل تكراري، مما يكشف عن فجوات كبيرة في القدرة على الاستدلال الفيزيائي تكون غير مرئية في التقييمات الحالية التي تركز على الواقعية البصرية.

Luyu Yang, Yutong Dai, An Yan, Viraj Prabhu, Ran Xu, Zeyuan Chen2026-03-27
💻 computer science

ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects

تقدم هذه الورقة البحثية ICTPolarReal، وهي مجموعة بيانات واسعة النطاق تضم أكثر من 1.2 مليون صورة عالية الدقة تلتقط 218 كائناً من العالم الحقيقي تحت ظروف متنوعة من تعدد الزوايا، وتعدد الإضاءة، والاستقطاب، مما يعزز بشكل كبير دقة وتعميم مهام التصيير العكسي مثل التفكيك الجوهري، وإعادة الإضاءة، وإعادة البناء ثلاثي الأبعاد من خلال توفير بيانات مواد قائمة على أسس فيزيائية.

Jing Yang, Krithika Dharanikota, Emily Jia, Haiwei Chen, Yajie Zhao2026-03-27
💻 computer science

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

تقترح هذه الورقة إطار عمل MoE-GRPO، وهو إطار للتعلم المعزز يعمل على تحسين توجيه الخبراء في نماذج الرؤية واللغة القائمة على خليط الخبراء (Mixture-of-Experts) من خلال صياغة اختيار الخبير كمسألة اتخاذ قرار متسلسل باستخدام تحسين السياسة النسبية للمجموعات (Group Relative Policy Optimization) والتوجيه المدرك للنماط، مما يعزز تنوع الخبراء وتخصص المهام مع التخفيف من حدة الإفراط في التخصيص.

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim2026-03-27
🤖 AI

Improving Fine-Grained Rice Leaf Disease Detection via Angular-Compactness Dual Loss Learning

تقترح هذه الورقة إطار عمل بفقد ثنائي يجمع بين فقد المركز (Center Loss) وفقد آرك فيس (ArcFace Loss) لمعالجة التباين العالي داخل الفئة والتشابه بين الفئات في الكشف عن أمراض أوراق الأرز، محققةً دقة تصل إلى 99.6% عبر ثلاث بنيات هيكلية متطورة دون الحاجة إلى تعديلات هيكلية رئيسية.

Md. Rokon Mia, Rakib Hossain Sajib, Abdullah Al Noman, Abir Ahmed, B M Taslimul Haque2026-03-27
💻 computer science

GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization

يُعد GDPO-Listener إطار عمل مبتكرًا يولد حركات رأس ثلاثية الأبعاد عالية التعبير لكل من التحدث والاستماع في التفاعلات الثنائية، وذلك عبر الجمع بين بنية مطابقة التدفق ذات الانحدار الذاتي (Auto-Regressive Flow Matching) وتحسين السياسة المفككة بمكافأة المجموعة (Group reward-Decoupled Policy Optimization) للتغلب على مشكلة "الانحدار نحو المتوسط" وتمكين الاستجابات غير اللفظية القابلة للتخصيص والتحكم دلاليًا.

Zhangyu Jin, Maksim Siniukov, Deuksin Kwon, Ashutosh Chaubey, Mohammad Soleymani2026-03-27
💻 computer science

VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

يُعد VideoTIR إطار عمل مبتكر يستفيد من التعلم المعزز، وتحديداً خوارزمية تحسين السياسة المجمعة لمجموعة أدوات الإجراءات (TAGPO) ونظام تخليق مسارات قائم على بيئة تجريبية (sandbox)، لتمكين النماذج اللغوية الكبيرة متعددة الوسائط من فهم مقاطع الفيديو الطويلة بدقة وكفاءة من خلال الاسترجاع الديناميكي والتركيز على الأجزاء المرئية ذات المعنى مع الحد من الهلوسة.

Zhe Gao, Shiyu Shen, Taifeng Chai, Weinong Wang, Haotian Xu, Xing W, Wenbin Li, Qi Fan, Yang Gao, Dacheng Tao2026-03-27