🤖 machine learning

How can embedding models bind concepts?

تتقصى هذه الورقة البحثية سبب تعثر نماذج الرؤية واللغة مثل CLIP في عملية ربط المفاهيم رغم احتوائها على معلومات كائنية قابلة للاسترداد، كاشفةً أن وظائف الربط عالية التعقيد لديها تعيق التعميم، بينما تتعلم نماذج المحولات (transformer) المنضبطة المدربة ببيانات كافية تفاعلات ضربية منخفضة التعقيد تتيح ربطاً منهجياً.

Arnas Uselis, Darina Koishigarina, Seong Joon Oh2026-06-01
💻 computer science

Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization

تقترح هذه الورقة تحولاً جذرياً في تعلم الأشياء المتمحور حول الفيديو من خلال إلغاء فقد التباين الصريح بين الفتحات (Slot-Slot Contrastive loss) وفرض الاتساق الزمني بدلاً من ذلك عبر آليتين متآزرتين عديمتي التكلفة الإضافية — وهما تفكيك القنوات الزمنية (Chrono-Channel Decomposition) وإعادة البناء عبر الزمن (Cross-Temporal Reconstruction) — اللتان تعملان على فك الارتباط الهيكلي بين الميزات الثابتة والديناميكية لتحقيق أداء رائد باستخدام خطأ إعادة البناء القياسي فقط.

Rongzhen Zhao, Zhiyuan Li, Juho Kannala, Joni Pajarinen2026-06-01
💻 computer science

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

تقدم الورقة البحثية SVI-Bench، وهو معيار مرجعي واسع النطاق يستفيد من الرياضات الجماعية كعالم مجهري ديناميكي لتقييم ذكاء الفيديو الاستراتيجي عبر تسلسل هرمي رباعي الركائز يتكون من الإدراك، والاستدلال السببي، والمحاكاة، والتخطيط، مما يكشف عن منحدر قدرات حاد حيث تعاني النماذج الحالية مع المهام الوكيلية المعقدة رغم أدائها القوي في الأسئلة الإدراكية.

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo Torresani, Gedas Bertasius2026-06-01
🤖 AI

Feature-Optimized Vision for Adaptive 3D Scene Reconstruction

تقترح هذه الورقة واجهة رؤية أمامية متكيفة ومُحسّنة للميزات، تقوم بتخصيص ميزانيات الميزات لكل عرض ديناميكياً بناءً على النسيج، والقابلية للتكرار، والتميز، والمنفعة الهندسية، وذلك لتعظيم جودة واكتمال إعادة البناء مع تقليل الهدر الحسابي في إعادة بناء المشاهد ثلاثية الأبعاد.

Eric Liang2026-06-01
🧬 biology

Automated Prediction of Postoperative Pancreatic Fistula Using Preoperative Computed Tomography

تقدم هذه الورقة مساراً آلياً للتعلم العميق متكامل الأطراف يستخدم الأشعة المقطعية قبل الجراحة للتنبؤ بتسرب البنكرياس بعد الجراحة وتصنيف مخاطره، مما أظهر أداءً واعداً عبر بنيات ثلاثية الأبعاد متعددة لدعم تحسين اتخاذ القرار السريري.

Ashok Choudhary, Chris Varghese, Leo Y. Li-Han, Frank G. Lee, Ellen L. Larson, Elizabeth B. Habermann, Cornelius A. Thie (…)2026-06-01
💻 computer science

SMART: SMPLest-X Mesh Adaptation and RAFT Tracking for Soccer Pose Estimation

تقدم الورقة البحثية نظام SMART، وهو نظام لتقدير وضعيات لاعبي كرة القدم يجمع بين نموذج SMPLest-X مضبوط بدقة وتتبع كاميرا قائم على RAFT وتنعيم زمني لتحقيق تحسن بنسبة 38.6% عن النموذج المرجعي في تحدي FIFA لتتبع الهياكل العظمية لعام 2026.

Parthsarthi Rawat2026-06-01
💬 NLP

Vision-Language Models Suppress Female Representations Under Ambiguous Input

تكشف هذه الورقة أنه بينما تقوم نماذج الرؤية واللغة غالباً بترميز الارتباطات الأنثوية داخلياً للصور الغامضة، فإن مخرجاتها تلتزم بشكل منهجي بالتمثيلات الذكورية بسبب آلية تصفية غير متماثلة تعمل على تضخيم الإشارات الذكورية وتثبيط الأنثوية أثناء التوليد.

Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji2026-06-01
💻 computer science

EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision

تقدم الورقة البحثية EGOSTREAM، وهو معيار تشخيصي للذاكرة العرضية المتدفقة في الرؤية من منظور الشخص الأول، والذي يستخدم مقياس "نافذة صلاحية الإجابة" (Answer Validity Window) المبتكر وإطار عمل موحد يعتمد على Qwen3-VL لتقييم وكشف الفجوات الأدائية الحرجة في آليات إدارة الذاكرة لدى النماذج الرائدة عبر سبعة أبعاد معرفية بدقة.

Rosario Forte, Giuseppe Lando, Antonino Furnari2026-06-01
💻 computer science

Joint Multi-Camera LiDAR Extrinsic Calibration via Learned Pairwise Initialization and Geometric Refinement

تقترح هذه الورقة إطار عمل ثنائي المراحل يجمع بين التهيئة الزوجية المتعلمة والتحسين الهندسي لتحقيق معايرة خارجية متسقة عالمياً وعالية الدقة لأنظمة الليدار متعددة الكاميرات المشتركة، مما يتفوق بشكل كبير على الطرق المستقلة لكل كاميرا على كل من مجموعات البيانات داخل النطاق وخارجه.

Aziz Al-Najjar, Marzieh Amini, James R. Green, Felix Kwamena2026-06-01
💻 computer science

Recognizing Co-Speech Gestures in-the-Wild

تقدم هذه الورقة البحثية GRW، وهي أول مجموعة بيانات واسعة النطاق تضم 156,688 مقطع فيديو تم تعليمه يدويًا لربط الإيماءات المصاحبة للكلام غير المقيدة بكلمات محددة، وذلك للتغلب على ندرة البيانات وتمكين تدريب واختبار النماذج متعددة الوسائط لتصنيف الإيماءات الدلالية، والتعرف عليها، وتحديد موقعها الزمني.

Sindhu B Hegde, K R Prajwal, Andrew Zisserman2026-06-01