🤖 AI

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

تُعد عائلة نماذج Molmo2 عائلة جديدة من النماذج اللغوية البصرية ذات الأوزان المفتوحة التي تحقق أداءً رائدًا في فهم الفيديو والتحديد الدقيق على مستوى البكسل، وذلك عبر الاستفادة من سبع مجموعات بيانات فيديو جُمعت حديثًا ووصفة تدريب مبتكرة، جرى تطويرها جميعًا دون الاعتماد على نماذج مملوكة لجهات أخرى.

Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Re (…)2026-02-27
💻 computer science

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

تقدم الورقة البحثية OneVision-Encoder، وهي بنية متعددة الوسائط تتوافق مع مبادئ ترميز الفيديو من خلال تركيز الحوسبة على المناطق المتفرقة وعالية الإنتروبيا بدلاً من شبكات البكسل الموحدة، مما يحقق كفاءة ودقة فائقتين عبر معايير فهم الصور والفيديو والمستندات.

Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng (…)2026-02-27
💻 computer science

GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning

تقدم الورقة البحثية نموذج GigaBrain-0.5M*، وهو نموذج رؤية-لغة-عمل يستفيد من التعلم المعزز القائم على النموذج العالمي عبر إطار عمل RAMP للتغلب على القيود في فهم المشهد وتوقع المستقبل، محققاً مكاسب أداء كبيرة وتنفيذاً موثوقاً طويل الأمد في مهام المناولة الروبوتية المعقدة.

GigaBrain Team, Boyuan Wang, Bohan Li, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Jie Li, Jindi Lv, Jingyu Liu, Lv F (…)2026-02-27
💻 computer science

Benchmarking Video Foundation Models for Remote Parkinson's Disease Screening

تقدم هذه الورقة تقييماً معيارياً منهجياً واسع النطاق لسبعة نماذج تأسيسية للفيديو على مجموعة بيانات جديدة مكونة من 32,847 مقطع فيديو من 1,888 مشاركاً، مما يكشف أن أداء النماذج في الفحص عن بُعد لمرض باركنسون يعتمد بشكل كبير على المهمة، ويضع خط أساس صارم بمساحات تحت المنحنى (AUCs) تصل إلى 85.3%، مع تسليط الضوء على الحاجة إلى المعايرة المدركة للمهمة لتحسين الحساسية.

Md Saiful Islam, Ekram Hossain, Abdelrahman Abdelkader, Tariq Adnan, Fazla Rabbi Mashrur, Sooyong Park, Praveen Kumar, Q (…)2026-02-27
💬 NLP

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

تقترح هذه الورقة إطار عمل "الاستيعاب البصري المؤجل" (DVI)، الذي يستبدل عملية التضمين المسبق للمحتوى البصري ذات الفقد العالي باستراتيجية فهرسة هرمية قائمة على البنية وتحليل مؤجل عبر النماذج اللغوية البصرية الكبيرة (VLM)، محققاً دقة أعلى بكثير في مهام الأسئلة والأجوبة الخاصة بالوثائق الهندسية كثيفة المحتوى البصري من خلال التغلب على قيود الاسترجاع وفقدان التفاصيل التي تعاني منها طرق "الاستيعاب المسبق" الحالية.

Tao Xu2026-02-27
💻 computer science

Depth from Defocus via Direct Optimization

تقدم هذه الورقة نهجاً قابلاً للتطبيق للتحسين العالمي لاستعادة العمق من خلال التشتت، يعتمد على التقليل المتناوب بين التحسين المحدب والبحث الشبكي المتوازي لتحقيق استعادة عالية الدقة للعمق على كل من مجموعات البيانات الاصطناعية والحقيقية، متفوقة بذلك على الأساليب الحالية القائمة على التعلم العميق.

Holly Jackson, Caleb Adams, Ignacio Lopez-Francos, Benjamin Recht2026-02-27
⚡ electrical engineering

Automated Disentangling Analysis of Skin Colour for Lesion Images

تقترح هذه الورقة إطار عمل جديداً لفك تشابك لون البشرة يستخدم إزالة اللون العشوائية ومعالجة لاحقة محاذية للهندسة لتعلم فضاء كامن مهيكل لتوليد مجموعات بيانات متنوعة وعادلة لآفات الجلد، مما يؤدي إلى تحسين أداء نماذج تعلم الآلة عبر درجات لون البشرة وظروف التصوير المتفاوتة.

Wenbo Yang, Eman Rezk, Walaa M. Moursi, Zhou Wang2026-02-27
💻 computer science

TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering

يعالج TextPecker العقبة الحرجة المتمثلة في إدراك الشذوذ الهيكلي في التصيير البصري للنصوص من خلال تقديم استراتيجية تعزيز تعلم تعزيزي (RL) قابلة للتوصيل والتشغيل مدعومة بمجموعة بيانات تعرّف متخصصة ومحرك توليد يعتمد على تحرير ضربات الفرشاة، مما يعزز بشكل كبير الدقة الهيكلية والمواءمة الدلالية لنماذج تحويل النص إلى صورة.

Hanshen Zhu, Yuliang Liu, Xuecheng Wu, An-Lan Wang, Hao Feng, Dingkang Yang, Chao Feng, Can Huang, Jingqun Tang, Xiang B (…)2026-02-27
💻 computer science

Solaris: Building a Multiplayer Video World Model in Minecraft

تقدم الورقة البحثية "سولاريس" (Solaris)، وهو نموذج عالم فيديو متعدد اللاعبين للعبة ماينكرافت يستفيد من نظام مبتكر لجمع البيانات آلياً ومسار تدريب مرحلي للتغلب على قيود النماذج أحادية الوكيل عبر محاكة ملاحظات متعددة المشاهد متسقة وتفاعلات معقدة متعددة الوكلاء.

Georgy Savva, Oscar Michel, Daohan Lu, Suppakit Waiwitlikhit, Timothy Meehan, Dhairya Mishra, Srivats Poddar, Jack Lu, S (…)2026-02-27
💻 computer science

Adaptive Prefiltering for High-Dimensional Similarity Search: A Frequency-Aware Approach

تقترح هذه الورقة إطار عمل للتصفية المسبقة التكيفية للبحث عن التشابه عالي الأبعاد، يقوم بتخصيص الميزانيات الحسابية ديناميكيًا بناءً على أنماط تكرار الاستعلام وتماسك العناقيد، مما يحقق استدعاءً مكافئًا مع تقليل عمليات حساب المسافة بنسبة 20.4% مقارنة بالطرق الثابتة مع الحفاظ على زمن انتقال يقل عن الميلي ثانية.

Teodor-Ioan Calin2026-02-27