💻 computer science

Exploring Conditions for Diffusion models in Robotic Control

تقدم هذه الورقة ORCA، وهو نهج مبتكر يستفيد من نماذج الانتشار (diffusion models) لإنشاء الصور من النصوص والمُدربة مسبقاً للتحكم الروبوتي عبر توظيف مطالبات مهام قابلة للتعلم وشروط بصرية خاصة بكل إطار للتغلب على قيود التكييف النصي الساذج، محققاً بذلك أداءً رائداً دون الحاجة إلى ضبط النموذج الأساسي.

Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim2026-04-09
💻 computer science

Splatblox: Traversability-Aware Gaussian Splatting for Outdoor Robot Navigation

يُعد Splatblox نظاماً يعمل في الوقت الفعلي يقوم بدمج صور RGB المجزأة مع بيانات ليدار (LiDAR) باستخدام تقنية التغطية الغاوسية (Gaussian Splatting) لتوليد حقل مسافة متوقع (ESDF) مدركاً لقابلية العبور، مما يمكّن الروبوتات الخارجية من التمييز بفعالية بين النباتات القابلة للعبور والعوائق الصلبة لتحقيق أداء ملاحة فائق في البيئات المعقدة.

Samarth Chopra, Jing Liang, Gershom Seneviratne, Yonghan Lee, Jaehoon Choi, Jianyu An, Stephen Cheng, Dinesh Manocha2026-04-09
💻 computer science

Asking like Socrates: Socrates helps VLMs understand remote sensing images

لمعالجة "تأثير اللمحة" (Glance Effect) الذي يسبب الاستنتاج الزائف في مهام الاستشعار عن بعد، تقدم هذه الورقة RS-EoT، وهو نموذج بحث عن الأدلة تكراري مدفوع باللغة، تم تدريبه عبر نظام وكلاء متعددين سقراطي وتعلم تعزيزي تدريجي، والذي يحقق أداءً هو الأفضل في فئته من خلال تمكين الاستنتاج الحقيقي القائم على الأدلة البصرية.

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen (…)2026-04-09
💻 computer science

SciPostGen: Bridging the Gap between Scientific Papers and Poster Layouts

تقدم الورقة البحثية SciPostGen، وهي مجموعة بيانات واسعة النطاق تربط الأوراق العلمية بتخطيطات الملصقات، وتقترح إطار عمل يعتمد على الاسترجاع المعزز يستفيد من هذه البيانات لإنشاء تصميمات ملصقات فعالة ومتوافقة مع القيود بناءً على هيكل الورقة.

Shun Inadumi, Shohei Tanaka, Tosho Hirasawa, Atsushi Hashimoto, Koichiro Yoshino, Yoshitaka Ushiku2026-04-09
💻 computer science

REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection

تقدم هذه الورقة REVEAL، وهو إطار عمل جنائي معزز بالاستدلال تم تدريبه باستخدام التعلم المعزز القائم على خبرات الخبراء وتم تقييمه على REVEAL-Bench الجديد، والذي يحقق تعميماً فائقاً عبر المجالات وتفسيرات دقيقة من خلال بناء سلاسل أدلة قابلة للتحقق للكشف عن الصور المُنشأة بواسطة الذكاء الاصطناعي.

Huangsen Cao, Qin Mei, Zhiheng Li, Yuxi Li, Zhan Meng, Ying Zhang, Chen Li, Zhimeng Zhang, Xin Ding, Yongwei Wang, Jing (…)2026-04-09
💰 quantitative finance

PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents

تقدم هذه الورقة إطار عمل PyFi، الذي يستخدم آلية تنافسية متعددة الوكلاء لتخليق مجموعة بيانات مالية بهيكل هرمي وحجم يصل إلى 600 ألف، مما يمكّن نماذج اللغات المرئية من تحقيق تحسينات كبيرة في الدقة في الاستدلال المالي المعقد عبر التفكيك التدريجي للأسئلة من الإدراك الأساسي إلى التحليل على مستوى الخبراء.

Yuqun Zhang, Yuxuan Zhao, Sijia Chen2026-04-09
💻 computer science

FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision

يعد FlexAvatar طريقة قائمة على المحولات (transformer) تُنشئ نماذج رمزية ثلاثية الأبعاد للرأس عالية الجودة وكاملة من صورة واحدة عبر إدخال "مصبات انحياز" (bias sinks) قابلة للتعلم لفصل إشارات القيادة عن زوايا الرؤية المستهدفة، مما يتيح تدريباً موحداً على كل من البيانات أحادية العدسة والبيانات متعددة الزوايا لتحقيق استقراء فائق للمشاهد وتحريك واقعي.

Tobias Kirschstein, Simon Giebenhain, Matthias Nießner2026-04-09
💻 computer science

AstraNav-World: World Model for Foresight Control and Consistency

يُعد AstraNav-World نموذج عالم متكامل يوحّد بين توليد الفيديو القائم على الانتشار وتعلم السياسات الرؤية-اللغوية لتمكين الاستشراف والتحكم المتزامنين وثنائيي الاتجاه، مما يؤدي إلى تحسين دقة المسار والتعميم في حالة الصفر في مهام الملاحة المجسمة المفتوحة والديناميكية.

Jintao Chen, Junjun Hu, Haochen Bai, Minghua Luo, Xinda Xue, Botao Ren, Chengyu Bai, Shichao Xie, Ziyi Chen, Fei Liu, Ze (…)2026-04-09
💻 computer science

A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures

تقدم هذه الورقة البحثية EB-JEPA، وهي مكتبة مفتوحة المصدر وخفيفة الوزن تتيح تدريبًا فعالًا باستخدام وحدة معالجة رسومية واحدة لبنى التنبؤ بالتمثيل المشترك القائمة على الطاقة (energy-based Joint-Embedding Predictive Architectures) لتعلم تمثيلات ذات معنى دلالي عبر الصور، والفيديوهات، ونماذج العالم المشروطة بالأفعال، كما يتضح من خلال الأداء العالي في مهام CIFAR-10، وMoving MNIST، ومهام الملاحة.

Basile Terver, Randall Balestriero, Megi Dervishi, David Fan, Quentin Garrido, Tushar Nagarajan, Koustuv Sinha, Wancong (…)2026-04-09
💻 computer science

CraterBench-R: Instance-Level Crater Retrieval for Planetary Scale

تقدم هذه الورقة CraterBench-R، وهو معيار واسع النطاق لاسترجاع فوهات الكواكب على مستوى العينات، وتقترح مسار عمل ثنائي المراحل وقابل للتوسع يجمع بين نماذج المحولات الرؤية ذات التعلم الذاتي وطريقة مبتكرة لتجميع رموز العينات لتحقيق دقة عالية مع تقليل تكاليف التخزين والحوسبة بشكل كبير.

Jichao Fang, Lei Zhang, Michael Phillips, Wei Luo2026-04-09