💬 NLP

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills

تقدم الورقة البحثية "Auto-Robotist"، وهو وكيل نماذج لغوية كبيرة (LLM) ذاتي التطور، يحول تصميم الروبوتات التطوري عديم الذاكرة إلى عملية قابلة للنقل عبر تقطير آثار البحث في مكتبة مهارات صريحة وقابلة للفحص بلغة طبيعية، مما يحسن كفاءة البحث بشكل كبير ويمكّن من نقل المعرفة بنجاح عبر مساحات تصميم مختلفة.

Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang2026-05-26
💻 computer science

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

تقدم هذه الورقة WBench، وهو معيار مرجعي شامل متعدد الجولات صُمم لتقييم نماذج عالم الفيديو التفاعلية بشكل منهجي عبر خمسة أبعاد رئيسية — جودة الفيديو، والالتزام بالإعدادات، والالتزام بالتفاعل، والاتساق، والامتثال للفيزياء — باستخدام 289 حالة اختبار ومقاييس تلقائية تم التحقق من صحتها للكشف عن عدم تفوق أي نموذج حالي من طراز الحالة الراهنة في جميع المجالات.

Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding2026-05-26
💻 computer science

DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

تقدم هذه الورقة البحثية DyCoRM، وهو إطار عمل لنمذجة المكافأة الديناميكية الواعية بالمعايير يعالج الحاجة إلى تقييم الصور بدقة وتخصيص حسب المهمة في توليد الصور من النصوص عبر الاستفيد من مجموعة بيانات ومعيار مرجعي تم إنشاؤهما حديثاً لتمكين محاذاة أكثر دقة مع متطلبات المستخدم.

Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min2026-05-26
💻 computer science

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

يُعد AgentGrounder إطار عمل للتوطين البصري ثلاثي الأبعاد بنمط "التعلم الصفري" (zero-shot)، يعمل مباشرة على السحب النقطية الملونة من خلال الجمع بين جدول بحث عن الكائنات يتم استخدامه دون اتصال (offline) ووكيل يعمل عبر الإنترنت (online) مدفوع بالأدوات، يقوم باسترجاع المرشحين بشكل انتقائي، وإجراء تقييم هندسي، وتفعيل عملية رندرة الصور عند الطلب لتحقيق توطين قوي مفتوح المفردات دون الحاجة إلى تدريب ثلاثي الأبعاد خاص بالمهام.

Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin2026-05-26
💻 computer science

R5DGS: Semantic-Aware 4D Gaussian Splatting with Rigid Body Constraints for Efficient Dynamic Scene Reconstruction

يُعد R5DGS إطار عمل مبتكر يعزز تقنية "Gaussian Splatting" رباعية الأبعاد لإعادة بناء المشاهد الديناميكية من خلال دمج الربط بين الكائنات القائم على الوعي الدلالي عبر جداول بحث مستندة إلى نموذج CLIP، وفرض قيود الأجسام الصلبة على مراكز ثقل الكائنات، مما يحقق استقراءً فعالاً للإطارات المستقبلية ذات المفردات المفتوحة مع تقليل العبء الحسابي بشكل كبير.

Denis Gridusov, Maxim Popov, Sergey Kolyubin2026-05-26
💻 computer science

Curve Skeletonization in Continuous domain for Meshes and Point Clouds

تقدم هذه الورقة إطار عمل CSCD، وهو إطار عمل جديد للهياكل العظمية للمنحنيات في النطاق المستمر يعمم نهج الهيكلة عبر الفواصل المحلية من الحالة المنفصلة إلى المتشعبات، موفرًا طرقًا جوهرية قوية لكل من الشبكات (CSCD-M) والسحب النقطية (CSCD-PC) تتفوق على الخوارزميات الحالية الأحدث في الدقة والحفاظ على الطوبولوجيا.

Jai Bardhan, Ramya Hebbalaguppe, Aravind Udupa2026-05-26
💻 computer science

Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models

تقترح هذه الورقة البحثية "التلقين ثنائي الاتجاه ذو الحلقة المغلقة" (Closed-Loop Bidirectional Prompting)، وهو آلية دفاع مبتكرة تعزز المتانة العدائية للنماذج اللغوية الرؤيوية من خلال إنشاء حلقة تغذية راجعة ديناميكية بين الوسائط البصرية والنصية لاستعادة التوافق الدلالي عبر الوسائط مع استخدام "مرتكز دلالي" (Semantic Anchor) لتقييد التحديثات وتخفيف فساد الميزات.

Xiao Liu, Jiaxiang Liu, Boci Peng, Boren Hu, Yusong Wang, Xiwen Chen, Prayag Tiwari, Liming Zhang, Mingkun Xu2026-05-26
💻 computer science

LRDDv3: High-Resolution Long-Range Drone Detection Dataset with Range Information and Thermal Data

تقدم هذه الورقة البحثية LRDDv3، وهي مجموعة بيانات عالية الدقة تتكون من أكثر من 100,000 صورة RGB بدقة 4K وما يقرب من 30,000 صورة حرارية مقترنة لطائرات بدون طيار تم التقاطها من مسافات طويلة في ظروف متنوعة، والمصممة لتعزيز قدرات كشف الطائرات بدون طيار بعيدة المدى.

Knut Peterson, Zaid Mayers, Azmain Yousuf, Priontu Chowdhury, Asher Zaczepinski, Solmaz Arezoomandan, Reihaneh Maarefdou (…)2026-05-26
🤖 AI

VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding

يُعد VEN-VL إطار عمل لخليط الخبراء المعتمد على التجميع البصري، والذي يسد الفجوة بين الأداء والكفاءة في الفهم متعدد الوسائط من خلال إثراء سعة المعلومات البصرية أولاً عبر التوحيد متعدد المنظورات، ثم ضغطها تدريجياً عبر التوجيه التكيفي والإشراف البصري الصريح.

Yinghao Wu, Zhuoyan Luo, Yiyao Yu, Zhaojian Yu, Yujiu Yang, Xiao-Ping Zhang2026-05-26
💻 computer science

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

يُعد RAPTOR+ إطار عمل لغوي بصري يعتمد على التأسيس البصري، حيث يستبدل مسارات العمل التقليدية القائمة على التعرف الضوئي على الحروف (OCR) بنماذج متعددة الوسائط مضبوطة بدقة لتحسين دقة الاستخراج وتحديد الأدلة بشكل كبير في حالات الإحالات العاجلة لسرطان القولون والمستقيم، مما يعزز الثقة السريرية وقابلية التدقيق.

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Benjamin Wallace, William Poulett, Adam Byfield, Lukman Akanbi, Mu (…)2026-05-26