🤖 machine learning

MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image

تقدم هذه الورقة MulTaBench، وهو معيار شامل يتكون من 40 مجموعة بيانات صور-جدولية ونصوص-جدولية صُممت لإثبات أن الضبط الدقيق المخصص للمهام لتمثيلات الوسائط غير المهيكلة يتفوق بشكل كبير على التمثيلات المجمدة، مما يؤسس لقاعدة لتطوير نماذج تأسيسية جدولية متعددة الوسائط ومبتكرة.

Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia Blayer, David Holzmüller, Lennart Purucker (…)2026-05-12
🤖 machine learning

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

تقدم الورقة البحثية U2Diffine، وهو نموذج انتشار موحد يقوم في آن واحد بإكمال مسارات الوكلاء المتعددين والتنبؤ بها، مع توفير تقديرات لعدم اليقين المتباين لكل حالة وتصنيفات احتمالية الخطأ للأنماط المولدة، متفوقاً بذلك على الأساليب الرائدة عبر أربع مجموعات بيانات رياضية.

Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo2026-05-12
🤖 machine learning

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

تقدم هذه الورقة طريقة "تعزيز مطابقة الـ adjoint" (RAM)، وهي طريقة قابلة للتوسع للتدريب اللاحق باستخدام التعلم المعزز لنماذج الانتشار ومطابقة التدفق، تحقق محاذاة فائقة مع المكافآت عبر اشتقاق فقد اتساق بسيط يصحح أهداف ما قبل التدريب دون الحاجة إلى عمليات تدفق SDE مكلفة، أو مسوحات adjoint خلفية، أو تدرجات مكافأة.

Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach2026-05-12
🤖 AI

GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

يقدم GridProbe نموذجاً حسابياً تكيفياً في وقت الاختبار وخالياً من التدريب لنماذج الرؤية واللغة (VLMs) للفيديوهات الطويلة، يعتمد على سبر البعد اللاحق (posterior probing) على شبكة إطارية لتوليد خرائط أهمية قابلة للتفسير، مما يتيح اختياراً ديناميكياً للإطارات يقلل بشكل كبير من التكلفة الحسابية مع الحفاظ على الدقة أو تحسينها في المهام التي تتطلب قدرات استدلالية عالية.

Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan2026-05-12
🤖 AI

MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation

يُعد MPerS إطار عمل مبتكر لتجزئة مشاهد الاستشعار عن بُعد يستفيد من مطالبات "خليط الخبراء الديناميكي" (Mixture-of-Experts) لتوليد أوصاف عالية الجودة من نماذج لغوية بصرية متعددة (MLLMs)، والتي يتم دمجها تكيفياً عبر وحدة "الخليط الديناميكي للخبراء" (Dynamic MixExperts) وانتباه موجه بالاستعلام اللغوي لتوجيه الميزات البصرية المستخرجة بواسطة DINOv3 لتحقيق أداء تجزئة فائق.

Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun2026-05-12
🤖 AI

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenizatio

تقدم هذه الورقة البحثية DRoRAE، وهو مشفر تلقائي للتمثيل خفيف الوزن يحسن جودة الترميز البصري والتوليد بشكل كبير من خلال دمج الميزات الهرمية من جميع طبقات المشفر البصري المجمد تكيفياً، بدلاً من الاعتماد فقط على الطبقة النهائية، مما يكشف عن علاقة لوغاريتمية خطية قابلة للتوسع بين قدرة الدمج وأداء إعادة البناء.

Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou2026-05-12
🤖 AI

PhyGround: Benchmarking Physical Reasoning in Generative World Models

تقدم الورقة البحثية PhyGround، وهو معيار مرجعي شامل يتميز بـ 250 مطالبة منسقة، وتصنيف مكون من 13 قانوناً، وحكم متخصص في النماذج اللغوية البصرية (PhyJudge-9B) لتقييم وتشخيص قدرات الاستدلال الفيزيائي لنماذج الفيديو التوليدية بصرامة من خلال تعليق بشري واسع النطاق ومحكم الجودة.

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, E (…)2026-05-12
🤖 AI

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

تقدم هذه الورقة البحثية MMVIAD، وهي أول مجموعة بيانات ومعيار مرجعي للفيديو المستمر متعدد المشاهد لكشف الشذوذ الصناعي، وتقترح VISTA، وهو نموذج تم تدريبه عبر مسار تدريب لاحق مبتكر من مرحلتين يتفوق بشكل كبير على النماذج اللغوية الكبيرة متعددة الوسائط للفيديو الحالية والأسس المرجعية بمستوى البشر عبر أربع مهام تفتيش صناعية رئيسية.

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu2026-05-12
🤖 machine learning

Transcoda: End-to-End Zero-Shot Optical Music Recognition via Data-Centric Synthetic Training

تعد Transcoda نظاماً للتعرف الضوئي على الموسيقى يعتمد على البيانات والتعلم الصفري، حيث يستفيد من توليد البيانات الاصطناعية المتقدم، وتطبيع ترميز الـ kern، وفك التشفير القائم على القواعد لتدريب نموذج مدمج يتفوق بشكل كبير على النماذج المرجعية الحالية ذات المليارات من المعلمات في كل من اختبارات النوتات الموسيقية الاصطناعية والتاريخية.

Daniel Dratschuk, Paul Swoboda2026-05-12
🤖 AI

BEACON: A Multimodal Dataset for Learning Behavioral Fingerprints from Gameplay Data

تقدم هذه الورقة البحثية BEACON، وهي مجموعة بيانات متعددة الوسائط واسعة النطاق تضم بيانات لعب متزامنة لـ 28 لاعباً من لعبة Valorant، صُممت لتعزيز أبحاث المصادقة المستمرة وبصمة السلوك عبر التقاط إشارات حركية وإدراكية عالية الدقة تحت ضغط تنافسي واقعي.

Ishpuneet Singh, Gursmeep Kaur, Uday Pratap Singh Atwal, Guramrit Singh, Gurjot Singh, Maninder Singh2026-05-12