💻 computer science

Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception

تقترح هذه الورقة البحثية إطار عمل SD-RPN، وهو إطار عمل فعال وخالٍ من التوسيم يعزز الإدراك دقيق التفاصيل للنماذج اللغوية الكبيرة متعددة الوسائط عبر تدريب شبكة اقتراح مناطق خفيفة الوزن باستخدام تسميات مستعارة منزوعة الضجيج مستخلصة من خرائط الانتباه الداخلية للنموذج نفسه.

Yuheng Shi, Xiaohuan Pei, Minjing Dong, Chang Xu2026-02-12
💻 computer science

Enhancing Vehicle Detection under Adverse Weather Conditions with Contrastive Learning

تقترح هذه الورقة إطار عمل "sideload-CL-adaptation" الذي يستخدم التعلم التبايني على بيانات غير مشروحة لتعزيز أداء كشف المركبات للنماذج خفيفة الوزن في ظروف الطقس الإسكندنافي القاسية.

Boying Li, Chang Liu, Petter Kyösti, Mattias Öhman, Devashish Singha Roy, Sofia Plazzi, Hamam Mokayed, Olle Hagner2026-02-12
⚡ electrical engineering

A UAV-Based VNIR Hyperspectral Benchmark Dataset for Landmine and UXO Detection

تقدم هذه الورقة مجموعة بيانات مرجعية جديدة عالية الدقة للطيف المرئي والأشعة تحت الحمراء القريبة (VNIR) مستندة إلى طائرات بدون طيار، وتتميز بـ 143 نموذجاً محاكياً واقعياً للألغام الأرضية والمخلفات المتفجرة غير المنفجرة (UXO) في حالات دفن مختلفة لدعم الأبحاث القابلة للتكرار في مجال الكشف الآلي.

Sagar Lekhak, Emmett J. Ientilucci, Jasper Baur, Susmita Ghosh2026-02-12
💬 NLP

From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models

تقدم هذه الورقة البحثية **VideoBiasEval**، وهو إطار تشخيصي يكشف كيف يؤدي ضبط المحاذاة —بينما يحسن جودة الفيديو— إلى تضخيم وتثبيت التحيزات الاجتماعية عن غير قصد من خلال نقل الصور النمطية من مجموعات بيانات التفضيلات البشرية عبر نماذج المكافأة إلى نماذج انتشار الفيديو.

Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, Junjie Hu2026-02-12
💻 computer science

H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows

يُعد H2OFlow إطار عمل مبتكر يتعلم الإمكانيات الوظيفية الشاملة للتفاعل بين الإنسان والأشياء ثلاثية الأبعاد —بما في ذلك التلامس، والتوجه، والاشغال الفراغي— وذلك عبر استخدام عملية انتشار كثيفة على السحب النقطية لاستخراج أنماط تفاعل غنية من بيانات اصطناعية ناتجة عن نماذج توليدية ثلاثية الأبعاد، مما يلغي الحاجة إلى التوصيفات اليدوية.

Harry Zhang, Luca Carlone2026-02-12
🤖 AI

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

تقدم هذه الورقة البحثية WaymoQA، وهي مجموعة بيانات للأسئلة والأجوبة المرئية متعددة الرؤى المصممة لتعزيز قدرات الاستنتاج المتعلقة بالسلامة الحرجة في النماذج اللغوية الكبيرة متعددة الوسائط في القيادة الذاتية من خلال معالجة السيناريوهات المعقدة حيث يمكن أن يؤدي حل المخاطر المباشرة إلى خلق مخاطر جديدة لاحقة.

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim2026-02-12
💻 computer science

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

تقترح الورقة البحثية **ضغط الرموز المتدفق (STC)**، وهو إطار عمل هرمي جاهز للاستخدام يعمل على تسريع نماذج الفيديو اللغوية الكبيرة (VideoLLMs) المتدفقة عبر استخدام آلية تخزين مؤقت لتقليل عبء ترميز محول الرؤية (Vision Transformer)، وآلية تقليم لضغط تسلسلات الرموز البصرية قبل مرحلة التعبئة المسبقة للنموذج اللغوي الكبير (LLM).

Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang2026-02-12
💻 computer science

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

تقدم هذه الورقة البحثية **CityNav**، وهو معيار جديد لتقييم قدرة النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) على إجراء ملاحة حضرية في العالم الحقيقي تعتمد على المعرفة من خلال الإشارات البصرية وحدها، وتقترح **التعبير اللفظي عن المسار (VoP)** لتحسين الأداء عبر حث النماذج على استخدام خرائطها الإدراكية الداخلية بشكل صريح.

Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic2026-02-12
🤖 AI

Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment

تُعد NOVA إطار عمل للمحاذاة بين الرؤية واللغة غير تبايني، وهي تبسط التدريب المسبق متعدد الوسائط من خلال التنبؤ بتضمينات النصوص من مشاهد الصور المعززة مع استخدام تقنية تنظيم متخصصة لضمان تعلم مستقر وفعال وكفء في التعامل مع المعلمات الفائقة دون الحاجة إلى أخذ العينات السلبية.

Lukas Kuhn, Giuseppe Serra, Florian Buettner2026-02-12
💻 computer science

SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback

يُعد SAIL إطار عمل مبتكر يُمكّن نماذج الانتشار من تحقيق محاذاة فعالة مع التفضيلات البشرية باستخدام حد أدنى من التغذية الراجعة، وذلك عبر التحسين الذاتي المتكرر من خلال عملية مغلقة الحلقة من التصنيف الذاتي ومزج التفضيلات المرتبة.

Xiaoxuan He, Siming Fu, Wanli Li, Zhiyuan Li, Dacheng Yin, Kang Rong, Fengyun Rao, Bo Zhang2026-02-12