💻 computer science

LESSViT: Robust Hyperspectral Representation Learning under Spectral Configuration Shift

تقدم هذه الورقة LESSViT، وهي بنية "ترانسفورمر رؤية" (Vision Transformer) مرنة تجاه المستشعرات، توظف انتباهً مكانيًا-طيفيًا منخفض الرتبة ومشفرًا تلقائيًا مقنعًا متخصصًا لتحقيق تعلم تمثيلي فائق الأطياف يتسم بالقوة والكفاءة والقدرة على التعميم عبر تكوينات طيفية متباينة.

Haozhe Si, Yuxuan Wan, Yuqing Wang, Minh Do, Han Zhao2026-05-19
💻 computer science

StableHand: Quality-Aware Flow Matching for World-Space Dual-Hand Motion Estimation from Egocentric Video

تُعد StableHand إطار عمل لمطابقة التدفق مدركاً للجودة، يعمل على تحسين تقدير حركة اليد المزدوجة في الفضاء العالمي من خلال الفيديو من منظور الشخص الأول عبر التكيف ديناميكياً مع موثوقية الملاحظة لكل إطار من خلال إشارة جودة رباعية القنوات، محققاً أداءً هو الأفضل في حالته في التعامل مع حالات الاحتجاب والبيانات المفقودة.

Huajian Zeng, Chaohua Yao, Yuantai Zhang, Jiaqi Yang, Rolandos Alexandros Potamias, Xingxing Zuo2026-05-19
💻 computer science

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

تقدم الورقة البحثية "التجويع من أجل الإدراك" (Starve to Perceive)، وهو نموذج تدريبي يقضي على "الإدراك الكسول" في النماذج الرؤية-اللغوية عبر تقييد عرض النطاق البصري لفرض عملية البحث البصري النشط ومتعدد الخطوات الضروري لإتمام المهام، مما يحقق مكاسب كبيرة في الأداء دون الحاجة إلى تغييرات هيكلية أو خسائر مساعدة.

Yuhuan Wu, Cong Wei, Fangzhen Lin, Wenhu Chen, Haozhe Wang2026-05-19
💻 computer science

ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics

تقدم هذه الورقة ManiSoft، وهو معيار ومحاكي جديد مصمم لمعالجة تحديات التلاعب بالرؤية واللغة في الروبوتات المستمرة اللينة من خلال توفير مسار قابل للتوسع لتوليد مهام ومسارات متنوعة، مع الكشف عن القيود الحالية في تقدير الاستقبال الحسي وتجنب العوائق التكيفي.

Ziyu Wei, Luting Wang, Chen Gao, Li Wen, Si Liu2026-05-19
💻 computer science

Articulation in Prime: Primitive-Based Articulated Object Understanding from a Single Casual Video

تقدم هذه الورقة البحثية "Articulation in Prime"، وهو إطار عمل للتحسين غير مرتبط بفئة معينة يستعيد الحركية ثلاثية الأبعاد للأجسام المفصلية من فيديو عارض واحد عن طريق ملاءمة الأشكال الهندسية الأولية المقيدة بمفاصل دورانية وانزلاقية، مما يتغلب بفعالية على تحديات مثل حالات الاحتجاب الشديد وحركة الكاميرا السريعة حيث تفشل الأساليب الحالية.

Arslan Artykov, Tom Ravaud, Nicolás Violante-Grezzi, Vincent Lepetit2026-05-19
💻 computer science

Semantic Generative Tuning for Unified Multimodal Models

تقدم هذه الورقة البحثية الضبط التوليدي الدلالي (SGT)، وهو نموذج جديد لمرحلة ما بعد التدريب يستفيد من تجزئة الصور كوسيط توليدي لسد الفجوة بين الفهم البصري والتوليد في النماذج متعددة الوسائط الموحدة، مما يعزز بشكل كبير كلاً من الإدراك الاستيعابي والدقة التوليدية.

Songsong Yu, Yuxin Chen, Ying Shan, Yanwei Li2026-05-19
💻 computer science

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

يقدم SafeDiffusion-R1 إطار عمل للتعلم المعزز عبر الإنترنت باستخدام تحسين السياسة النسبي للمجموعات (GRPO) وآلية مكافأة توجيهية مبتكرة قائمة على نموذج CLIP لمواءمة نماذج الانتشار بفعالية مع قيود السلامة وتحسين جودة التوليد دون الحاجة إلى بيانات خاضعة للإشراف باهظة التكلفة أو المعاناة من النسيان الكارثي.

Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar2026-05-19
💻 computer science

EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos

تقدم الورقة البحثية EgoExpMem، وهو أول معيار للاستدلال الذاكراتي عبر الرؤى باستخدام فيديوهات متزامنة من منظور الشخص الأول (egocentric) ومن منظور الشخص الثالث (exocentric)، إلى جانب طريقة E2^2-Select الخالية من التدريب التي تستفيد من الإشارات المزدوجة المتكاملة لتحقيق أداء رائد في هذه المهمة الصعبة التي تعاني فيها النماذج الحالية.

Ruiping Liu, Junwei Zheng, Yufan Chen, Di Wen, Shaofang Quan, Chengzhi Wu, Jiaming Zhang, Kailun Yang, Kunyu Peng, Raine (…)2026-05-19
🤖 machine learning

PIXLRelight: Controllable Relighting via Intrinsic Conditioning

يُعد PIXLRelight مُصيّرًا عصبيًا سريعًا يعمل بنظام التغذية الأمامية، ويحقق إعادة إضاءة للصور الفردية ذات تحكم فيزيائي وبأداء رائد من خلال الربط بين التصيير القائم على الفيزياء والتوليد المُتعلم عبر شروط جوهرية مشتركة مستمدة من الألبيدو، والتظليل المنتشر، والمتبقيات.

Miguel Farinha, Ronald Clark2026-05-19
💬 NLP

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

تُعد Vision-OPD إطار عمل للتقطير الذاتي يعمل على تعزيز الفهم البصري دقيق التفاصيل في النماذج اللغوية الكبيرة متعددة الوسائط من خلال تدريب سياسة الصورة الكاملة على محاكاة الأداء المتفوق لمعلم مشروط بالقصاصات (crop-conditioned) على مخرجاته الخاصة، مما يُمكّن النموذج من استيعال فوائد التركيز على الأدلة ذات الصلة دون إشراف خارجي أو أدوات.

Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, Yaojie Lu2026-05-19