🤖 AI

Beyond Vision: Contextually Enriched Image Captioning with Multi-Modal Retrieval

تقترح هذه الورقة مساراً متعدد الوسائط يعزز وصف الصور من خلال استرجاع ومحاذاة الصور المتشابهة دلالياً واستخراج المعلومات السياقية من المقالات ذات الصلة لتعزيز الأوصاف البصرية الأساسية، مما يؤدي إلى توليد أوصاف أكثر ثراءً وإدراكاً للأحداث تم تقييمها على مجموعة بيانات OpenEvents v1.

Nguyen Lam Phu Quy, Pham Phu Hoa, Tran Chi Nguyen, Dao Sy Duy Minh, Nguyen Hoang Minh Ngoc, Huynh Trung Kiet2026-02-03
🤖 AI

UNIC: Learning Unified Multimodal Extrinsic Contact Estimation

تقدم هذه الورقة البحثية UNIC، وهو إطار عمل موحد متعدد الوسائط يتيح تقديرًا قويًا وغير معتمد على المعايرة للتلامس الخارجي من أجل المناولة الغنية بالتلامس، وذلك عبر دمج البيانات البصرية، والحسية الخاصة، واللمسية من خلال تمثيل خريطة إمكانات المشهد، محققًا دقة عالية وقدرة على التعميم على الأجسام غير المرئية وزوايا الرؤية الديناميكية.

Zhengtong Xu, Yuki Shirai2026-02-03
🤖 machine learning

VibrantSR: Sub-Meter Canopy Height Models from Sentinel-2 Using Generative Flow Matching

يُعد VibrantSR إطار عمل توليدي لرفع الدقة الفائقة يقوم بتقدير نماذج ارتفاع الغطاء الشجري بدقة تقل عن المتر من صور القمر الصناعي Sentinel-2 ذات الدقة 10 أمتار، محققاً دقة متفوقة مقارنة بالمعايير المرجعية الحالية للأقمار الصناعية، مما يتيح مراقبة مستمرة للغابات على نطاق واسع دون الاعتماد على عمليات الاستحواذ الجوية غير المتكررة.

Kiarie Ndegwa, Andreas Gros, Tony Chang, David Diaz, Vincent A. Landau, Nathan E. Rutenbeck, Luke J. Zachmann, Guy Bayes (…)2026-02-03
🤖 AI

Model-Centric Diagnostics: A Framework for Internal State Readouts

تقدم هذه الورقة إطاراً تشخيصياً متمحوراً حول النموذج يوحد مختلف القراءات الداخلية — مثل معايير تدرج الرأس، واليقين، والاعتلاج — باعتبارها إسقاطات لحالة تدريب كامنة، مما يقدم منظوراً هيكلياً لمهام مثل اختيار نقاط التحقق والتوقف المبكر، مع تأجيل التحقق الخوارزمي والتجريبي الكامل إلى منشور مستقبلي.

Fangzheng Wu, Brian Summa2026-02-03
💻 computer science

VGGT-SLAM 2.0: Real-time Dense Feed-forward Scene Reconstruction

يُعد نظام VGGT-SLAM 2.0 نظاماً للملاحة وتحديد الموقع ورسم الخرائط آنياً وكثيفاً يعتمد على التغذية الأمامية، وهو يحسن دقة الوضع وموثوقية إغلاق الحلقة بشكل كبير مقارنة بسلفه من خلال تقديم تصميم مبتكر لمخطط العوامل للقضاء على الانجراف والترهل المستوي، والاستفادة من طبقات الانتباه مسبقة التدريب للتحقق من استرجاع الصور مجاناً، وإظهار أداء قوي على مجموعات بيانات متنوعة وعلى متن جهاز Jetson Thor.

Dominic Maggio, Luca Carlone2026-02-03
🤖 AI

TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention

يُعد TraceRouter إطار عمل جديد للتدخل على مستوى المسار، يعزز سلامة النماذج التأسيسية الضخمة من خلال تحديد وقطع الدوائر السببية الموزعة للدلالات الضارة، مما يحقق متانة فائقة ضد الهجمات العدائية دون المساس بالمنفعة العامة.

Chuancheng Shi, Shangze Li, Wenjun Lu, Wenhua Wu, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua2026-02-03
⚡ electrical engineering

Attention Isn't All You Need for Emotion Recognition:Domain Features Outperform Transformers on the EAV Dataset

تُظهر هذه الدراسة أنه بالنسبة للتعرف على العواطف متعدد الوسائط على نطاق صغير في مجموعة بيانات EAV، فإن هندسة الميزات الخاصة بالمجال والتنفيذ السليم يتفوقان باستمرار على بنيات المحولات المعقدة القائمة على الانتباه، والتي تعاني من الإفراط في التخصيص وتدهور الميزات مسبقة التدريب.

Anmol Guragain2026-02-03
💬 NLP

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

تقدم هذه الورقة إطار عمل لتفسير الصندوق الأسود يتعلم "دساتير" لغوية طبيعية قابلة للتحقق من خلال التطبيق المنهجي لتعديلات المفاهيم الذرية على المطالبات، مما يتيح رؤى عميقة وتحكماً فعالاً في سلوكيات النماذج عبر مهام مثل توليد النصوص إلى الصور والاستدلال الرياضي.

Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek2026-02-03
🤖 AI

Mirage2Matter: A Physically Grounded Gaussian World Model from Video

تقدم الورقة البحثية "محاكاة أي شيء" (Simulate Anything)، وهو إطار عمل يعيد بناء بيئات العالم الحقيقي من فيديوهات متعددة الزوايا باستخدام تقنية "Gaussian Splatting" ثلاثية الأبعاد والنماذج التوليدية لإنشاء عمليات محاكاة قائمة على أسس فيزيائية وقابلة للتحرير، مما يمكّن نماذج الرؤية واللغة والعمل (Vision Language Action models) من تحقيق أداء قوي في التعميم الصفري دون الحاجة إلى مستشعرات باهظة الثمن أو بيانات تفاعل من العالم الحقيقي.

Zhengqing Gao, Ziwen Li, Xin Wang, Jiaxin Huang, Zhenyang Ren, Mingkai Shao, Hanlue Zhang, Tianyu Huang, Yongkang Cheng (…)2026-02-03
🤖 AI

SITUATE -- Synthetic Object Counting Dataset for VLM training

تقدم الورقة البحثية SITUATE، وهي مجموعة بيانات اصطناعية مبتكرة مصممة لتدريب نماذج الرؤية واللغة على مهام العد ذات القيود المكانية، مما يثبت أن الضبط الدقيق على هذه البيانات المنضبطة يحسن بشكل كبير من التعميم على معايير الاختبار خارج نطاق التوزيع مقارنة بمجموعات البيانات الواقعية الحالية.

René Peinl, Vincent Tischler, Patrick Schröder, Christian Groth2026-02-03