💻 computer science

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

تقترح الورقة البحثية CapDepth، وهو إطار عمل جديد لتقدير العمق أحادي العين يستفيد من الأوصاف النصية الطويلة والمفصلة وآلية فك تشفير متكيفة مع النص لحل الغموض البصري بفعالية وتحسين المتانة بشكل كبير في السيناريوهات الصعبة مثل الأسطح غير اللمبرتية والظروف الجوية السيئة.

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao2026-07-31
💻 computer science

Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

تقدم الورقة البحثية Tycho، وهو نظام وكيل برمجي يعالج تحدي ARC-AGI-3 من خلال صياغة البيئات كآلات مور (Moore machines) ذات معاملات، وتوظيف "التجريد النشط" لبناء واختبار وإصلاح نماذج عالم قابلة للتنفيذ ديناميكيًا، محققًا كفاءة إعادة تشغيل بشرية مثالية في جميع المستويات الـ 183 مع تقليل عدد الإجراءات بشكل كبير مقارنة بالمعايير البشرية المرجعية.

Jens Lehmann, Andrei Aioanei, Sahar Vahdati2026-07-31
🤖 machine learning

Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D Cameras

تقترح هذه الورقة نهجين يعتمدان على الوعي بالأجهزة لدمج بيانات RGB-D في شبكات عميقة مدمجة لتقسيم الإمكانيات (affordance segmentation) على الأجهزة المدمجة، محققةً بنجاح أداءً في الوقت الفعلي ضمن حدود الطاقة المتوافقة مع الهواتف الذكية مع تحديد الحلول المثلى في منحنى باريتو التي توازن بين دقة التعميم والقيود العتادية.

Edoardo Ragusa, Giovanni Paolo Canuti, Simone Lugani, Rodolfo Zunino, Paolo Gastaldo2026-07-31
💻 computer science

ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

يُعد ObjectStream إطار عمل لا يتطلب تدريباً يعمل على تعزيز فهم الفيديو المتدفق من خلال تنظيم تمثيلات نماذج الفيديو اللغوية الكبيرة (Video-LLM) المجمدة في مراسي كائنات كامنة مستمرة، مما يتيح استنتاجاً عالي الأداء وفعالاً حول تاريخ الكائنات وتفاعلاتها مع تقليل استخدام الذاكرة وعدد الرموز (tokens) بشكل كبير.

Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny (…)2026-07-31
💻 computer science

AdaAnchor4D: Anchor-Conditioned Spatiotemporal Feature Aggregation for Monocular UAV 4D Reconstruction

يُعد AdaAnchor4D إطار عمل لتشويه المرساة التكيفي يعالج عدم التجانس المكاني والزماني لفيديوهات الطائرات بدون طيار أحادية العدسة من خلال توظيف تجميع الميزات المشروط بالمرساة وتشويه الهندسة المنفصل لتحقيق إعادة بناء رباعية الأبعاد عالية الجودة وفي الوقت الفعلي للمشاهد الحضرية الديناميكية المعقدة.

Peiyi Xu, Junpeng Zhang, Guanbin Li, Ronghua Shang, Mingtao Feng, Le Dong, Weisheng Dong, Guangming Shi, Jie Feng2026-07-31
💻 computer science

Same Branches, Different Trees: A Bifurcation Connectedness Metric for Coronary Artery Segmentation and FFR-CT Decision Agreement

تقدم هذه الورقة "درجة اتصال التفرع" (BCS) وبديلها القابل للتفاضل "soft-BCS" لمعالجة قصور المقاييس الحجمية القياسية في تقسيم الشرايين التاجية، مما يثبت أن الحفاظ على اتصال التفرع المحلي أمر بالغ الأهمية لاتخاذ قرارات دقيقة بشأن علاج FFR-CT ويجب الإبلاغ عنه جنباً إلى جنب مع مقاييس استعادة الفروع.

Maame Owusu-Ansah, Kelvin Lee, Dr Vinod Venugopal, Muhammad Moazzam Jawaid, Wenting Duan, James Brown2026-07-31
💻 computer science

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

تقترح هذه الورقة البحثية "التقليم المدرك للاتجاه" (Trend-aware Pruning)، وهو إطار عمل خالٍ من التدريب للنماذج اللغوية الكبيرة متعددة الوسائط يعمل على تحسين الكفاءة من خلال نمذجة التطور الديناميكي لأهمية الرموز عبر الطبقات لمنع الفقدان المبكر للمؤشرات البصرية الحرجة، محققاً تقليلاً في الرموز بنسبة تزيد عن 77.8% مع الحفاظ على أداء تنافسي.

Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji2026-07-31
🤖 machine learning

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow

يقدم ShadowDancer إطار عمل مبتكر للتحكم في نماذج عوالم الفيديو التفاعلية على مستوى الإطار ولأي إجراء، وذلك عبر الاستفادة من "مكتبة الظل" (Shadow Library) لإنشاء أزواج فيديو ذات ديناميكيات متطابقة ولكن بمظاهر متباينة، مما يتيح تعلم تمثيل ديناميكي موحد من خلال التنبؤ عبر الظل (cross-shadow prediction) يسمح بنقل الإجراءات الموضحة بسلاسة إلى بيئات جديدة دون الحاجة إلى تسميات أو ضبط دقيق.

Jin Cao, Zian Meng, Kaipeng Zhang2026-07-31
💻 computer science

Explaining Image Similarity with Automatically Extracted Concept Activation Vectors

تقدم هذه الورقة إطار عمل غير مرتبط بنموذج أو مقياس محدد يفسر تشابه الصور من خلال الاستخراج التلقائي لمتجهات تنشيط المفاهيم عبر المشفِّرات التلقائية المتفرقة، مما يتيح رؤى دقيقة وقابلة للتفسير حول مفاهيم محددة (مثل الملمس، أو الشكل، أو اللون) التي تقود درجات التشابه لكل من أزواج الصور الفردية ومجموعات الصور.

Isaac Roberts, Petra Bevandic, Alexander Schulz, Barbara Hammer2026-07-31
🤖 machine learning

QQWorld: Quantile-Quantile Matching for World Model Regularization

تقدم هذه الورقة QQWorld، وهي طريقة جديدة لتنظيم نماذج العالم تستبدل هدف Epps-Pulley بنهج مطابقة الكميات المئوية-الكميات المئوية (بما في ذلك متغير عبر الدفعات) للحفاظ على تدرجات تصحيحية فعالة في أطراف التوزيع، مما يحقق محاذاة غاوسية أفضل وأداء تخطيط محسّن مقارنة بالنموذج المرجعي LeWorldModel.

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu2026-07-31