💬 NLP

LinguDistill: Recovering Linguistic Ability in Vision- Language Models via Selective Cross-Modal Distillation

تُعد LinguDistill طريقة تقطير خالية من المهايئات تعمل على استعادة القدرات اللغوية المتدهورة لنماذج الرؤية واللغة عبر الاستفادة من نموذج لغوي مجمد كمعلم من خلال مشاركة ذاكرة التخزين المؤقت لمفاتيح وقيم (KV-cache) على مستوى الطبقات، مما يحقق استعادة كبيرة في الأداء على الاختبارات المعيارية اللغوية دون المساس بأداء المهام البصرية أو إضافة تعقيد معماري.

Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji, Yova Kementchedjhieva2026-04-03
💬 NLP

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

تقدم هذه الورقة IKEA-Bench، وهو معيار شامل لتقييم نماذج الرؤية واللغة في محاذاة تعليمات التجميع عبر التمثيلات البصرية المختلفة، كاشفةً أن العائلة المعمارية تفوق عدد المعلمات أهميةً في الأداء، مع تحديد الفضاءات الفرعية البصرية المنفصلة والاستدلال المدفوع بالنص كعقبات ميكانيكية رئيسية.

Zhuchenyang Liu, Yao Zhang, Yu Xiao2026-04-03
💻 computer science

Camouflage-aware Image-Text Retrieval via Expert Collaboration

تقدم هذه الورقة مهمة استرجاع الصور والنصوص المدركة للتمويه (CA-ITR) ومجموعة بيانات مقابلة لها (CamoIT)، مقترحةً شبكة تعاون الخبراء للتمويه (CECNet) ذات مشفر ثنائي الفروع وانتباه رسومي مشروط بالثقة لتحسين دقة الاسترجاع بشكل كبير في المشاهد المموهة المعقدة.

Yao Jiang, Zhongkuan Mao, Xuan Wu, Keren Fu, Qijun Zhao2026-04-03
💻 computer science

Sparse Spectral LoRA: Routed Experts for Medical VLMs

تقدم الورقة البحثية MedQwen، وهو نموذج رؤية-لغة طبي يعتمد على كفاءة المعلمات ويستخدم بنية "خليط من الخبراء" (Mixture-of-Experts) ذات توجيه طيفي مع خبراء تم تهيئتهم باستخدام تحليل القيم المفردة (SVD) وقاعدة توسيع مبتكرةة لتحقيق أداء يقارب أداء الضبط الدقيق الكامل مع تقليل النسيان الكارثي والمعلمات القابلة للتدريب بشكل كبير عبر مهام طبية متنوعة.

Omid Nejati Manzari, Hojat Asgariandehkordi, Taha Koleilat, Yiming Xiao, Hassan Rivaz2026-04-03
💻 computer science

Human Pose Estimation in Trampoline Gymnastics: Improving Performance Using a New Synthetic Dataset

تقدم هذه الورقة مجموعة بيانات اصطناعية جديدة (STP) تم إنشاؤها من بيانات التقاط الحركة لضبط نموذج ViTPose بدقة، مما يحسن بشكل كبير من دقة تقدير الوضعية البشرية ثنائية وثلاثية الأبعاد للوضعيات والزوايا القصوى التي تميز جمباز الترامبولين.

Léa Drolet-Roy, Victor Nogues, Sylvain Gaudet, Eve Charbonneau, Mickaël Begon, Lama Séoud2026-04-03
💻 computer science

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

يُعد EgoFlow إطار عمل جديد لمطابقة التدفق الموجه بالتدرج، يستفيد من بنية هجينة تجمع بين Mamba وTransformer وPerceiver لتوليد مسارات حركة للأجسام بـ 6 درجات من الحرية (6DoF) تكون متسقة فيزيائياً وخالية من الاصطدامات من فيديوهات المنظور الشخصي، متفوقاً بذلك على النماذج المرجعية الحالية القائمة على الانتشار (diffusion) والمحولات (transformer) من حيث الدقة والواقعية.

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang2026-04-03
💻 computer science

Nonlinear Methods for Analyzing Pose in Behavioral Research

تقدم هذه الورقة مسار تحليل مرن وعام الأغراض يدمج المعالجة المسبقة، وخفض الأبعاد، وطرق السلاسل الزمنية القائمة على التكرار لاستخراج أنماط خطية وغير خطية ذات مغزى من بيانات وضعية جسم الإنسان المعقدة وعالية الأبعاد عبر سياقات سلوكية متنوعة.

Carter Sale, Margaret C. Macpherson, Gaurav Patil, Kelly Miles, Rachel W. Kallen, Sebastian Wallot, Michael J. Richardso (…)2026-04-03
🤖 machine learning

Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptation

تقترح الورقة البحثية إطار عمل AReS، وهو إطار تكيف فعال يقوم بتهيئة مشفر محلي عبر تفاعل واحد مع واجهة برمجة التطبيقات (API) ثم يقوم بعد ذلك بإعادة برمجة "الصندوق الزجاجي" محلياً، مما يحقق أداءً فائقاً على النماذج الحديثة "مغلقة الصندوق" مع القضاء على جميع التكاليف اللاحقة لواجهة برمجة التطبيقات تقريباً مقارنة بطرق التحسين التقليدية من الدرجة صفر.

Yunbei Zhang, Chengyi Cai, Feng Liu, Jihun Hamm2026-04-03
💻 computer science

Prototype-Based Low Altitude UAV Semantic Segmentation

تقترح الورقة البحثية إطار عمل PBSeg، وهو إطار عمل فعال للتجزئة القائم على النماذج الأولية يتميز بآلية انتباه متقاطع مبتكرة قائمة على النماذج الأولية ووحدة استخراج ميزات متعددة المقاييس، والذي يحقق أداءً تنافسيًا في صور الطائرات بدون طيار ذات الارتفاع المنخفض مع معالجة تحديات تباين المقياس والقيود الحسابية.

Da Zhang, Gao Junyu, Zhao Zhiyuan2026-04-03
💻 computer science

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

يقدم VideoZeroBench معياراً هرمياً يتضمن 500 سؤالاً لأسئلة الفيديو الطويلة تم تعليقها يدوياً وبروتوكول تقييم من خمس مستويات للتحقق بدقة من الأدلة المكانية والزمانية، مما يكشف أن حتى نماذج MLLM للفيديو المتطورة مثل Gemini-3-Pro تفشل في تحقيق الاستدلال المرتكز الدقيق عندما يتطلب الأمر تحديداً زمانياً ومكانياً دقيقاً.

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Dua (…)2026-04-03