🤖 AI

X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations

يُعد X-Diffusion إطار عمل للتعلم عبر الهياكل المختلفة يستفيد من الانتشار المحيطي (Ambient Diffusion) لتدريب سياسات الروبوت بشكل انتقائي على عروض بشرية مشوشة، مما يستخلص بفعالية القصد ذي الصلة بالمهمة مع تصفية عدم الإمكانية المرتبطة بهيكل معين، مما يؤدي إلى تحسين معدلات نجاح عمليات المعالجة بشكل كبير.

Maximus A. Pace, Prithwish Dan, Chuanruo Ning, Atiksh Bhardwaj, Audrey Du, Edward W. Duan, Wei-Chiu Ma, Kushal Kedia2026-04-16
💻 computer science

RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph

تقدم هذه الورقة البحثية RoboTAG، وهو إطار عمل متكامل لتقدير وضعية الروبوت من صور RGB أحادية الكاميرا، والذي يستفيد من رسم بياني للمحاذاة الطوبولوجية مع فروع ثنائية وثلاثية الأبعاد متطورة معاً لدمج الأولويات ثلاثية الأبعاد وتقليل الاعتماد على البيانات المصنفة النادرة، مما يعالج الفجوة بين المحاكاة والواقع.

Yifan Liu, Fangneng Zhan, Wanhua Li, Haowen Sun, Katerina Fragkiadaki, Hanspeter Pfister2026-04-16
💻 computer science

Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

تقدم الورقة البحثية SandboxVLM، وهو إطار عمل يسد الفجوة النوعية بين التدريب ثنائي الأبعاد والمهام ثلاثية الأبعاد في نماذج الرؤية واللغة عبر الاستفادة من صناديق الإحاطة المجردة ومسار إعادة بناء متعدد المراحل لتعزيز الذكاء المكاني وقدرات الاستنتاج بشكل كبير دون الحاجة إلى تدريب إضافي.

Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister2026-04-16
💻 computer science

Delineate Anything Flow: Fast, Country-Level Field Boundary Detection from Any Source

تقدم الورقة البحثية DelAnyFlow، وهي منهجية قابلة للتوسع وفعالة من حيث التكلفة تجمع بين نموذج تجزئة مثيل يعتمد على YOLOv11 مدرب على مجموعة بيانات FBIS 22M الضخمة مع معالجة لاحقة مهيكلة لتوليد حدود حقول زراعية عالية الدقة على مستوى الدول من صور أقمار صناعية متعددة الدقة، مما يتفوق بشكل كبير على الحلول الحالية في كل من السرعة واكتمال الكشف.

Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov, Yevhenii Salii, Volodymyr Kuzin, Sergii Skakun, Zoltan Szantoi2026-04-16
💻 computer science

Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?

تقدم هذه الورقة Target-Bench، وهو معيار مرجعي مبتكر يتكون من 450 سيناريو تم جمعها بواسطة روبوتات، صُممت لتقييم قدرات الاستدلال الدلالي وتخطيط المسار بدون خرائط لنماذج العالم المرئية، مما يكشف عن فجوة كبيرة بين الواقعية البصرية وأداء التخطيط، مع إثبات أن الضبط الدقيق على بيانات من العالم الحقيقي يمكن أن يحسن النتائج على مستوى المهام بشكل كبير.

Dingrui Wang, Zhihao Liang, Hongyuan Ye, Zhexiao Sun, Zhaowei Lu, Yuchen Zhang, Yuyu Zhao, Yuan Gao, Marvin Seegert, Fin (…)2026-04-16
💻 computer science

From Instruction to Event: Sound-Triggered Mobile Manipulation

تقدم هذه الورقة البحثية مفهوم التلاعب المتنقل المحفز بالصوت كنموذج جديد حيث تكتشف الوكلاء الأجسام باعثة الصوت وتتفاعل معها ذاتياً دون تعليمات صريحة، مدعومة بمنصة بيانات Habitat-Echo ونظام أساسي يظهر أداءً قوياً حتى في السيناريوهات الصوتية المعقدة والمتداخلة.

Hao Ju, Shaofei Huang, Hongyu Li, Zihan Ding, Si Liu, Meng Wang, Zhedong Zheng2026-04-16
💻 computer science

Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models

تُثبت هذه الورقة أن مصنفاً خطياً بسيطاً، يتم تدريبه على ميزات مجمدة من نماذج الرؤية التأسيسية الحديثة، يحقق قدرة تعميم هي الأفضل في مجال اكتشاف الصور المولدة بواسطة الذكاء الاصطناعي، متفوقاً بذلك على الكواشف المتخصصة في السيناريوهات الواقعية عبر الاستفادة من المعرفة الجنائية الناشئة المكتسبة أثناء التدريب المسبق واسع النطاق.

Yue Zhou, Xinan He, Kaiqing Lin, Bing Fan, Feng Ding, Bin Li2026-04-16
🤖 AI

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

تقدم هذه الورقة البحثية شبكة MMHNet، وهي شبكة هرمية متعددة الوسائط تدمج نموذج Mamba غير السببي، مما يمكّن نماذج تحويل الفيديو إلى صوت المدربة على عينات قصيرة من التعميم بنجاح وتوليد صوت عالي الجودة تتجاوز مدته خمس دقائق، متفوقة بذلك على الأساليب السابقة التي تمثل حالة الفن الراهنة.

Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke (…)2026-04-16
💻 computer science

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

تحدد هذه الورقة "انزياح المعلومات البصرية ذات الصلة" (RVIS) كسبب رئيسي لفشل تقليم الرموز البصرية في مهام الاستدلال المعقدة داخل النماذج اللغوية الكبيرة متعددة الوسائط، وتقترح إطار عمل يسمى DSTP يعمل في مرحلة فك التشفيد ولا يتطلب تدريباً، وذلك لمواءمة اختيار الرموز ديناميكياً مع متطلبات الاستدلال المتغيرة، مما يؤدي إلى تحسين الأداء بشكل كبير عبر مختلف البنيات.

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park2026-04-16
💻 computer science

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

تتقصى هذه الورقة هجمات حقن الأوامر الطباعية على نماذج الرؤية واللغة، كاشفةً أن نجاح الهجوم يتأثر بشدة بحجم الخط والتحلل البصري، ويتفاوت بشكل كبير عبر النماذج والوسائط المختلفة، ويرتبط ارتباطاً عكسياً قوياً بمسافة التضمين بين النص والصورة، مما يثبت أن الدفاعات الفعالة يجب أن تُصمم لتناسب بنيات نماذج محددة بدلاً من الاعتماد على حلول عالمية.

Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg2026-04-16