💻 computer science

Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

تقدم الورقة البحثية "Polyphony"، وهو إطار عمل لتجزئة أفعال اليدين المزدوجة يعتمد على الانتشار (diffusion) ويستخدم محول رؤية (vision transformer) متبادلاً وتكييفاً دلالياً للتغلب على التبعيات بين اليدين وعدم توازن التدرج، محققاً أداءً هو الأفضل في فئته على مجموعات بيانات متعددة من خلال نموذج موحد وفعال.

Hao Zheng, Hu Wang, Tiantian Zheng, Prajjwal Bhattarai, Tuka Alhanai2026-06-01
💻 computer science

NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving

تقدم هذه الورقة البحثية "إعادة بناء الرموز العصبية" (NTR)، وهو إطار عمل للقيادة من طرف إلى طرف خالٍ من الإدراك، يعزز تعلم رموز المشهد المدمجة من خلال هدف إعادة بناء مقنع بالتقطير الذاتي وعناصر دلالية مسبقة مستمدة من النماذج التأسيسية، محققاً أداءً هو الأفضل في فئته على عدة معايير مرجعية عبر إجبار عنق الزجاجة على الحفاظ على معلومات بصرية أغنى وأقل تكراراً دون تغيير المخطط أثناء وقت الاستدلال.

Jiahui Li, Jiawei Sun, Zixiang Ren, Ming Liu, Jiamin Shi, Ruiteng Zhao, Zhiyang Liu, Liying Liu, Zuoguan Wang, Kaidi Yan (…)2026-06-01
💻 computer science

QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer

تقدم هذه الورقة البحثية إطار عمل QVGGT، وهو إطار للكمّ ما بعد التدريب يُمكّن من نشر نموذج Visual Geometry Grounded Transformer (VGGT) واسع النطاق على الأجهزة الطرفية ذات الموارد المحدودة عبر توظيف استراتيجية دقة مختلطة انتقائية، وتصفية الرموز مع تعويض الكاميرا، والبحث عن المقياس المدرك للمهمة لتحقيق كمّ بنمط W4A16 قريب من عدم الفقد مع تقليل كبير في الذاكرة وتسريع في الأداء.

Zhizhen Pan, Hesong Wang, Huan Wang2026-06-01
🤖 AI

FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization

تقدم هذه الورقة البحثية FOCUS، وهو إطار تدريب ثنائي المراحل يجمع بين قيود الدعم البصري وتحسين السياسة النسبي للمجموعات (GRPO) لتحقيق تحديد موضعي للأجسام داخل السياق بشكل قوي ومستقل عن الفئة دون إشراف صريح، مما يمكّن نموذجاً بـ 7 مليارات معلمة من التفوق بشكل ملحوظ على نماذج أكبر تصل إلى 72 مليار معلمة.

Mohammed Asad Karim, Vinay Kumar Verma2026-06-01
🤖 machine learning

Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning

تقدم هذه الورقة DetAS، وهو إطار عمل وكيل يستفيد من نموذج لغوي كبير متعدد الوسائط لتكوين سير عمل ديناميكي وتكيفي لترميم الصور وكشف متعدد الخبراء، معزز بآلية حصاد خبرة ذاتية التطور للتفوق بشكل كبير على الكواشف الحالية في السيناريوهات الواقعية الصعبة.

Wenlun Zhang, Jun Yin, Kentaro Yoshioka2026-06-01
💻 computer science

Vanilla ViT for Automotive Point Cloud Semantic Segmentation

تقدم هذه الورقة البحثية VaViT، وهي طريقة تعمل على تكييف نماذج "Vision Transformers" التقليدية غير الهرمية لمهام التجزئة الدلالية للسحب النقطية في السيارات من خلال استخدام أداة ترميز متخصصة، وفك تشفير خفيف الوزن، وعمليات تعزيز بيانات مصممة خصيصاً لتحقيق أداء رائد على مجموعات البيانات واسعة النطاق مثل nuScenes وSemanticKITTI وWaymo Open Dataset.

Gilles Puy, Nermin Samet, Alexandre Boulch, Spyros Gidaris, Tuan-Hung VU, Renaud Marlet2026-06-01
🤖 machine learning

From Local Geometry to Global Pseudo Labeling for Robust Positive Unlabeled Learning under Covariate Shift

تقدم هذه الورقة إطار عمل "التعليق التوضيحي للجوار الطيفي للموجب غير المعلوم" (SPUNA)، وهو إطار عمل مدرك للهندسة يستفيد من هياكل المتشعبات المحلية لتمكين التعلم الموجب غير المعلوم القوي للكشف عن انزياح المتغيرات المصاحبة، محققاً أداءً يضاهي الطرق الخاضعة للإشراف الكامل دون الحاجة إلى بيانات مصنفة من التوزيعات المنزاحة.

Firas Gabetni, Alexandre Rocchi Henry, Nacim Belkhir, Ziyi Liu, Gianni Franchi2026-06-01
🤖 machine learning

Student Capacity Moderates Knowledge Distillation Effectiveness: A Systematic Study Across ResNet Teacher-Student Pairs on CIFAR-10

تُظهر هذه الدراسة المنهجية على مجموعة بيانات CIFAR-10 أن سعة الطالب تعد وسيطاً حاسماً لفعالية تقطير المعرفة، حيث كشفت أن الطلاب الأكبر حجماً (R34) يستفيدون بشكل أكبر بكثير من الطلاب الأصغر (R18)، مع تسليط الضوء أيضاً على ضرورة إصلاح أخطاء التنفيذ وعدم تطابق دقة المدخلات لتحقيق الأداء الأمثل للتقطير.

Umut Onur Yasar2026-06-01✓ Author reviewed
💬 NLP

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

تقدم هذه الورقة البحثية TouchSafeBench، وهو معيار مرجعي قائم على الفيزياء في Habitat 3.0 يقيم قدرة النماذج الرؤية-اللغوية على استنتاج مخاطر الاصطدام من أجل تعاون آمن بين الإنسان والروبوت، كاشفةً أن النماذج الحالية تفتقر إلى المساءلة الفيزيائية الضرية والاستدلال الهندسي الصريح للتمييز بشكل موثوق بين حالات الأمان، والاصطدام، والتلامس الوشيك.

Jun Wang, Xiaohao Xu, Xiaonan Huang2026-06-01
💻 computer science

Probabilistic Precipitation Nowcasting with Rectified Flow Transformers

تقدم هذه الورقة نموذج FREUD، وهو نموذج يعتمد على محول التدفق المصحح (rectified flow transformer) يتميز بمشفر لكل إطار وفك تشفير موحد يحافظ على عدم اليقين العشوائي (aleatoric uncertainty) من خلال التجميع (ensembling) لتحقيق تنبؤ احتمالي عالي الدقة لخرائط هطول الأمطار الآنية على معيار SEVIR يتفوق على أحدث ما توصلت إليه التقنيات.

Johannes Schusterbauer, Jannik Wiese, Nick Stracke, Timy Phan, Björn Ommer2026-06-01