💻 computer science

MVP-LAM: Learning Action-Centric Latent Action via Cross-Viewpoint Reconstruction

تقترح الورقة البحثية نموذج MVP-LAM، وهو نموذج متعدد الرؤى يتعلم أفعالاً كامنة متمحورة حول الفعل من خلال إعادة البناء عبر الرؤى المتعددة لتحسين التدريب المسبق لنماذج VLA وأداء التلاعب الروبوتي في المهام اللاحقة.

Jung Min Lee, Dohyeok Lee, Seokhun Ju, Taehyun Cho, Jin Woo Koo, Li Zhao, Sangwoo Hong, Jungwoo Lee2026-05-28
💻 computer science

DODO: Discrete OCR Diffusion Models

تقدم الورقة البحثية DODO، وهو أول نموذج رؤية-لغة يستخدم الانتشار المنفصل الكتلي (block discrete diffusion) للتغلب على عقبة فك التشفير المتسلسل في التعرف الضوئي على الحروف (OCR) ذات الطابع التلقائي، محققاً دقة تقارب أحدث ما توصلت إليه التقنيات مع سرعة استدلال تصل إلى 5 أضعاف من خلال التخفيف من عدم الاستقرار الهيكلي لأساليب الانتشار المقنع الحالية.

Sean Man, Gilad Deutch, Roy Ganz, Roi Ronen, Shahar Tsiper, Shai Mazor, Niv Nayman2026-05-28
🔢 mathematics

Noise Scheduling as Information-Guided Allocation in Diffusion Training

تقدم الورقة البحثية InfoNoise، وهي طريقة تكيفية عبر الإنترنت لجدولة الضجيج تقوم بإعادة تخصيص جهد التدريب ديناميكيًا إلى مستويات الضجيج الأكثر إفادة من خلال تقدير ملف تعريف معدل الإنتروبيا الشرطية، مما يحقق أداءً فائقًا وحوسبة أقل بنسبة تصل إلى 3 أضعاف عبر مجالات متنوعة دون الحاجة إلى نماذج مساعدة أو بحث غير متصل بالإنترنت.

Gabriel Raya, Bac Nguyen, Georgios Batzolis, Yuhta Takida, Dejan Stancevic, Naoki Murata, Chieh-Hsin Lai, Yuki Mitsufuji (…)2026-05-28
💻 computer science

Next-Scale Autoregressive Models for Text-to-Motion Generation

تقدم الورقة البحثية MoScale، وهو إطار عمل تكراري من نوع "التوليد الذاتي" (autoregressive) متعدد المقاييس، يقوم بتوليد الحركة من النص بشكل هرمي من الدقة الخشنة إلى الدقة الناعمة مع آليات تحسين عبر المقاييس وداخل المقياس نفسه، محققاً أداءً هو الأفضل في فئته، وكفاءة عالية في التدريب، وقدرة قوية على التعميم في حالات "الصفر المعرفة" (zero-shot).

Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao2026-05-28
💻 computer science

Polygon-mamba: Retinal vessel segmentation using polygon scanning mamba and space-frequency collaborative attention

تقترح الورقة البحثية Polygon-mamba، وهي شبكة هجينة تجمع بين الـ CNN والـ Mamba تدمج نموذج فضاء حالة بصري يعتمد على المسح المضلعي وآلية انتباه تعاونية مكانية-ترددية للحفاظ بفعالية على السلامة الطوبولوجية وتعزيز استخراج الميزات من أجل تقسيم دقيق للأوعية الدموية الشبكية الصغيرة عبر مجموعات بيانات متعددة.

Yuanyuan Peng, Wen Li2026-05-28
🤖 AI

RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?

تؤكد دراسة إعادة الإنتاج هذه أن محاذاة الثلاثيات الهندسية في إطار عمل TRIANGLE تُحسن بشكل كبير أداء الاسترجاع متعدد الوسائط بنمط "التعلم الصفري" مقارنة بالنماذج المرجعية الثنائية، بينما تكشف أيضاً عن عدم استقرار حرج في التحسين عند التدريب من الصفر ومقايضات التعميم المعتمدة على النطاق.

Arijit Ghosh, Aritra Bandyopadhyay, Chiranjeev Bindra, Jingfen Qiao2026-05-28
🤖 AI

Diffusion-Based Ukrainian Handwritten Text Generation with Cross-Domain Style Transfer

تعالج هذه الورقة نقص موارد توليد النصوص المكتوبة بخط اليد باللغة الأوكرانية من خلال بناء مجموعة بيانات ضخمة مصنفة حسب الكاتب، وإثبات أن نموذجاً قائماً على الانتشار، تم تدريبه في الأصل على النصوص اللاتينية، يمكنه التعميم بنجاح لتوليد نصوص سيريلية مقروءة ومتسقة الأسلوب من خلال النقل عبر المجالات والنقل القليل من الأمثلة.

Andrii Ahitoliev, Pavlo Berezin2026-05-28
🤖 machine learning

Representation-Conditioned Diffusion Models for Guided Training Data Generation

تُثبت هذه الورقة أن تدريب المصنفات على صور اصطناعية تم إنشاؤها بواسطة نماذج الانتشار الكامنة المشروطة بالتمثيل (باستخدام DINOv2 وDINOv3 وCLIP) يتفوق بشكل كبير على كل من التوليد المشروط بالفئة والنماذج المدربة على مجموعات البيانات الواقعية، مما يقدم حلاً واعداً لندرة البيانات في التعلم البصري واسع النطاق.

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen2026-05-28
💻 computer science

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios

تقدم هذه الورقة البحثية "عالم ماذا لو" (What-If World)، وهو معيار مرجعي جديد يتكون من 319 زوجًا من الأوامر النصية التي تقيم نماذج توليد الفيديو بناءً على قدرتها على إنتاج نتائج متسقة فيزيائيًا ومتباينة سببيًا استجابةً لتغييرات في متغير واحد، مما يكشف أن النماذج الحالية المتطورة تفشل إلى حد كبير في محاكاة السيناريوهات المتجسدة بشكل موثوق لأغراض التخطيط والتحكم.

Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Y (…)2026-05-28
🤖 AI

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

تقيم هذه الدراسة بشكل منهجي سلوكيات الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط عبر مهام تفسير وتوليد الصور الزراعية، كاشفةً عن عدم اتساق بيولوجي وتناقضات سياقية كبيرة تقوض موثوقية الرؤى الزراعية المدعومة بالذكاء الاصطناعي رغم التحسينات الناتجة عن التلقين بلقطات قليلة.

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid2026-05-28