🤖 AI

Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models

تقدم هذه الورقة "تصحيح السرعة والمسار" (Pace-and-Path Correction)، وهو عامل تشغيلي وقت الاستدلال، مغلق الصيغة، ولا يتطلب تدريباً، يعالج عمى الديناميكيات الزمنية في نماذج الرؤية واللغة والعمل (Vision-Language-Action models) عبر تفكيك تعديلات الحركة إلى قناتي السرعة والمسار، مما يحسن معدلات النجاح بشكل كبير في البيئات الديناميكية دون الحاجة إلى إعادة التدريب.

Yanyan Zhang, Chaoda Song, Vikash Singh, Xinpeng Li, Kai Ye, Zhe Hu, Zhongzhu Pu, Yu Yin, Vipin Chaudhary2026-05-13
🤖 AI

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

تقدم الورقة البحثية SpatialForge، وهو خط معالجة لتخليق البيانات قابل للتوسع يحول صور العالم المفتوح ثنائية الأبعاد إلى مجموعة بيانات مكونة من 10 ملايين زوج لتعزيز وتطوير قدرات الاستدلال المكاني المدركة للثلاثي الأبعاد في النماذج اللغوية البصرية الكبيرة بشكل فعال وكبير.

Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu2026-05-13
💻 computer science

Deep Probabilistic Unfolding for Quantized Compressive Sensing

تقترح هذه الورقة نموذج كشف احتمالي عميق للضغط الشعاعي المكمم يعمل على تحسين دقة وكفاءة إعادة البناء من خلال استبدال عمليات إسقاط L2 التقليدية بتدرج احتمالية ذي صيغة مغلقة لاحترام فيزياء التكميم، ودمج وحدة "مامبا" ثنائية النطاق لدمج الميزات متعددة المقاييس بشكل فعال.

Gang Qu, Ping Wang, Siming Zheng, Xin Yuan2026-05-13
💻 computer science

LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

يُعد LDDR إطار عمل خالٍ من التدريب وقابل للتشغيل المباشر، يعمل على تعزيز فهم الفيديو في النماذج اللغوية الكبيرة متعددة الوسائط من خلال الجمع بين اختيار عملية "لينيير ديتيرمينانتال بوينت بروسيس" (Linear Determinant Point Process) المدركة للاستعلام مع التخصيص الديناميكي للدقة لتحديد وتحديد أولويات الإطارات المعلوماتية بكفاءة ضمن ميزانيات الرموز (tokens).

Jingfeng Chen, Jiawen Qian, Wendi Deng, Yinuo Guo, Jiaqi Yu, Sicong Leng, Raghuveer Thirukovalluru, Bhuwan Dhingra2026-05-13
💻 computer science

A Mimetic Detector for Adversarial Image Perturbations

تقترح هذه الورقة كاشفاً محاكياً أحادي المحاولة وخالياً من التدريب يستغل طاقة التدرج عالية التردد للاضطرابات العدائية باستخدام مؤثرات كوربينو-كاستيلو للتمييز بفعالية بين الصور النظيفة والهجمات المقيدة بـ \ell^\infty دون الحاجة إلى الوصول إلى المصنف المستهدف.

Johnny Corbino2026-05-13
💬 NLP

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

تقدم هذه الورقة البحثية Checkup2Action، وهي مجموعة بيانات ومعيار مرجعي متعدد الوسائط يضم 2,000 تقرير فحص سريري مجهول الهوية، صُممت لتقييم وتحسين قدرة النماذج اللغوية الكبيرة على توليد بطاقات إجراءات آمنة، ومنظمة، وموجهة للمريض من أدلة طبية معقدة.

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei2026-05-13
💻 computer science

GeoR-Bench: Evaluating Geoscience Visual Reasoning

تقدم هذه الورقة البحثية GeoR-Bench، وهو معيار مرجعي جديد يتكون من 440 عينة منسقة عبر 6 فئات من علوم الأرض لتقييم الاستدلال البصري من خلال مهام التحرير، مما يكشف أن النماذج متعددة الوسائط الحالية تعاني في تحقيق الدقة العلمية الحقيقية رغم إنتاجها غالباً لمخرجات متسقة بصرياً.

Yushuo Zheng, Zicheng Zhang, Huiyu Duan, Chunyi Li, Zijian Chen, Ziheng Jia, Yue Shi, Ke Gu, Xiongkuo Min, Guangtao Zhai2026-05-13
💻 computer science

Dynamic Execution Commitment of Vision-Language-Action Models

تقدم الورقة البحثية A3، وهي آلية قبول الإجراء التكيفي (Adaptive Action Acceptance) التي تعيد صياغة الالتزام بالتنفيذ الديناميكي كمسألة تحقق من البادئة ذاتية التكهن (self-speculative prefix verification) لتحديد أفق التنفيذ الأمثل تلقائياً بناءً على الإجماع والاتساق، مما يلغي الضبط اليدوي مع تحسين المقايضة بين متانة التنفيذ وكفاءة الاستدلال في نماذج الرؤية واللغة والأفعال (Vision-Language-Action models).

Feng Chen, Xianghui Wang, Yuxuan Chen, Boying Li, Yefei He, Zeyu Zhang, Yicheng Wu2026-05-13
💻 computer science

TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning

تقترح الورقة البحثية إطار عمل TB-AVA، وهو إطار ضبط دقيق فعال من حيث المعلمات يستفيد من النص كمرتكز دلالي للربط بين الوسائط السمعية والبصرية عبر آلية تعديل دلالي بوابي، محققاً أداءً هو الأفضل في فئته على العديد من الاختبارات المرجعية السمعية البصرية.

Seongah Kim, Dinh Phu Tran, Hyeontaek Hwang, Saad Wazir, Duc Do Minh, Daeyoung Kim2026-05-13
💻 computer science

Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

تتناول هذه الورقة البحثية انحياز الموضع الشديد في النماذج اللغوية الكبيرة متعددة الوسائط لعمليات استرجاع الصور المتعددة من خلال تحديد "تباعد لوجيت-الانتباه" (Logit-Attention Divergence) واقتراح إطار عمل للمعايرة موجه بالانتباه وخالٍ من التدريب، مما يحسن بشكل كبير من ثبات التبديل ودقة الاسترجاع دون الحاجة إلى تدريب إضافي.

Mingtao Xian, Yifeng Yang, Qinying Gu, Xinbing Wang, Nanyang Ye2026-05-13