💻 computer science

Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances

تقدم الورقة البحثية AFFORDMEM، وهو إطار عمل لا يتطلب تدريباً يعزز تحديد الإمكانات الوظيفية ثلاثية الأبعاد من خلال الاستفادة من الذاكرة عبر المشاهد للأمثلة المشروحة لتوجيه نماذج الرؤية واللغة نحو المناطق دقيقة التفاصيل، ومن الذاكرة المكانية داخل المشهد لحل الاستعلامات العلاقاتية المعقدة، محققاً أداءً هو الأفضل في فئته على معيار SceneFun3D دون الحاجة إلى ضبط النموذج.

Qirui Wang, Jingyi He, Yining Pan, Xulei Yang, Shijie Li2026-05-13
💬 NLP

Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation

تقدم هذه الورقة إطار عمل جديد لتقطير النماذج اللغوية البصرية (VLM) يسمى "Hide to See" يعزز قدرات الاستدلال متعدد الوسائط للنماذج الطلابية المدمجة من خلال توظيف قناع بادئة الاستدلال البارزة والجدولة ذاتية الخطوات لإجبار النموذج على الاعتماد على الأدلة البصرية أثناء عملية التفكير، مما يؤدي إلى التفوق على أساليب التقطير والتقطير الذاتي الحالية.

Seonghoon Yu, Dongjun Nam, Byung-Kwan Lee, Jeany Son2026-05-13
🤖 AI

Weather-Robust Cross-View Geo-Localization via Prototype-Based Semantic Part Discovery

تقدم الورقة البحثية SkyPart، وهو نموذج أولي خفيف الوزن لاكتشاف الأجزاء الدلالية يعتمد على النماذج الأولية (prototype-based) لشبكات المحولات الرؤيوية (vision transformers)، والذي يحقق أفضل النتائج الحالية في تحديد المواقع الجغرافية عبر الرؤى المختلفة والمتينة تجاه الظروف الجوية من خلال الفصل الصريح بين التخطيط والنسيج، وتهميش تباينات الارتفاع، واستخدام تدريب متعدد الأهداف بوزن عدم اليقين.

Chi-Nguyen Tran, Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Phu-Hoa Pham, Long Tran-Thanh2026-05-13
💻 computer science

ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes

تقدم الورقة البحثية ShapeCodeBench، وهو معيار مرجعي اصطناعي متجدد مصمم لتقييم النماذج في مهام إعادة بناء الإدراك إلى برنامج من خلال مطالبتها بتوليد برامج رسم قابلة للتنفيذ من صور مُصورة، مما يكشف أنه بينما تحافظ النماذج متعددة الوسائط الحالية على بنية المقدمة، إلا أنها لا تزال تعاني من صعوبة في المطابقة التامة بسبب أخطاء طفيفة في المعلمات.

Shivam Kumar2026-05-13✓ Author reviewed
🤖 AI

Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning

تُثبت هذه الورقة أن الوكلاء البصريين غير المتجانسين يمكنهم تطوير رموز تواصل مشتركة ومعلوماتية من خلال التعلم اللامركزي والتقييم الإدراكي المحلي وحدهما، حيث يتم تشكيل خصوصية اللغة وتماثلها بشكل مباشر عبر مدى تشابه تمثيلاتها البصرية الأساسية.

Mikako Ochiai, Masatoshi Nagano, Tadahiro Taniguchi2026-05-13
🤖 machine learning

Unlocking Compositional Generalization in Continual Few-Shot Learning

تقترح هذه الورقة إطار عمل جديد للتعلم المستمر بلقطات قليلة، يقوم بفصل تعلم التمثيل عن الاستدلال التركيبي عبر استغلال الهندسة على مستوى الرقع (patch-level geometry) لنماذج المحولات الرؤية ذاتية الإشراف لتحسين تمثيلات الفتحات (slot representations) من أجل الهوية الكلية للفئة أثناء التدريب، وتركيبها ديناميكياً للمفاهيم الجديدة عند الاستدلال، مما يحقق تعميماً رائداً مع تقليل النسيان الكارثي إلى أدنى حد.

Phu-Quy Nguyen-Lam, Phu-Hoa Pham, Dao Sy Duy Minh, Chi-Nguyen Tran, Huynh Trung Kiet, Long Tran-Thanh2026-05-13
🤖 AI

CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating

تقدم الورقة البحثية نموذج CaC، وهو نموذج مكافأة تركيز مكاني-زماني هرمي يستفيد من مجموعة بيانات ضخمة وموسومة بطريقة مبتكرة ومنهج تدريب تقدمي ثلاثي المراحل مع مكافآت IoU متخصصة لتعزيز دقة اكتشاف الشذوذ بشكل كبير وتحسين جودة الفيديوهات المولدة.

Jiyuan Wang, Huan Ouyang, Jiuzhou Lin, Chunyu Lin, Dewen Fan, Boheng Zhang, Haonan Fan, Fei Zuo, Jia Sun, Huaiqing Wang (…)2026-05-13
🤖 machine learning

WorldComp2D: Spatio-semantic Representations of Object Identity and Location from Local Views

يُعد WorldComp2D إطار عمل جديداً وخفيف الوزن يقوم بهيكلة هندسة الفضاء الكامن بشكل صريح باستخدام مجالات استقبال محلية متعددة المقاييس لالتقاط كل من هوية الكائن والموقع المكاني بكفاءة، مما يحقق تخفيضات كبيرة في عدد المعلمات والتكلفة الحسابية مع الحفاظ على الأداء في الوقت الفعلي.

SeongMin Jin, Doo Seok Jeong2026-05-13
📊 statistics

One-Step Generative Modeling via Wasserstein Gradient Flows

تقدم الورقة البحثية W-Flow، وهو إطار عمل للنمذجة التوليدية من خطوة واحدة يقوم بضغط تدفقات تدرج واسرستاينين (Wasserstein gradient flows) في استنتاج شبكة عصبية واحدة لتحقيق أفضل النتائج الحالية في توليد صور ImageNet بقيمة 1.29 FID وسرعة أخذ عينات تبلغ حوالي 100 ضعف نماذج الانتشار متعددة الخطوات.

Jiaqi Han, Puheng Li, Qiushan Guo, Renyuan Xu, Stefano Ermon, Emmanuel J. Candès2026-05-13
🤖 AI

Focusable Monocular Depth Estimation

تقدم هذه الورقة تقدير العمق أحادي المنظور القابل للتركيز (FDE)، وهو مهمة مدركة للمناطق، وإطار عمل FocusDepth المقابل الذي يستفيد من دمج الميزات متعدد المقاييس المشروط بالوصف لتعزيز دقة المنطقة المستهدفة مع الحفاظ على الهندسة العالمية للمشهد، والذي تم التحقق من صحته بواسطة معيار FDE-Bench الجديد.

Yuxin Du, Tao Lin, Zile Zhong, Runting Li, Xiyao Chen, Jiting Liu, Chenglin Liu, Ying-Cong Chen, Yuqian Fu, Bo Zhao2026-05-13