🤖 AI

H2AL: Hyperbolic Hierarchy-aware Aggregative Learning for Registration-based Few-shot Medical Image Segmentation

تقترح هذه الورقة البحثية إطار عمل H2AL، وهو إطار عمل جديد لتجزئة الصور الطبية بلقطات قليلة تعتمد على التسجيل، والذي يستفيد من الفضاء الزائدي لنمذجة التسلسلات الهرمية التشريحية ويستخدم تجميع التدرج للتحسين المشترك، مما يتغلب على قيود الطرق القائمة على الفضاء الإقليدي لتحسين كل من دقة التسجيل وأداء التجزئة بشكل كبير.

Jia Wang, Jiaming Cai, Zunying Hu, Zhanjie Wu, Jinyuan Liu, Hua Cheng, Yun Peng2026-08-10
💻 computer science

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

تُثبت هذه الورقة أن النية القيادية الدلالية في نموذج الرؤية واللغة والعمل (Vision-Language-Action) قابلة للفك خطياً من طبقات فك التشفير المبكرة، مما يتيح تقليم 8 من أصل 32 طبقة لتحقيق تسريع بمقدار 1.33 ضعف مع زيادة طفيفة فقط في خطأ المسار.

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell2026-08-10
🤖 machine learning

Addressable Memory for Video World Models

تقدم الورقة البحثية WorldTrace، وهو إطار عمل خالٍ من التدريب يتيح الاستمرارية البصرية طويلة الأمد في نماذج العالم المرئية عبر تخصيص مواضع افتراضية متميزة لفتحات الذاكرة المضغوطة، مما يتغلب على قيود تضمين الموضع الدوار الزمني ويحسن بشكل كبير كلاً من الاتساق الزمني والاستدعاء الحقائقي في معيار LoopBench الجديد.

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša (…)2026-08-10
💻 computer science

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

يقدم UniJEPA إطار عمل موحدًا ذاتي الإشراف وغير مرتبط بمهمة محددة، يتعلم بشكل مشترك التنبؤات الضوئية على مستوى الصورة والتنبؤات الزمنية على مستوى الفيديو ضمن فضاء كامن واحد، مما يتيح تخطيطًا فعالًا صفري القدرة ويتفوق على النماذج المتخصصة مع إلغاء الحاجة إلى آليات تدريب معقدة مثل المتوسط المتحرك الأسي (EMA) أو تدرجات التوقف (stop-gradients).

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian2026-08-10
💻 computer science

Conformal Coverage Guarantees for Any Video Temporal Grounder

تقدم هذه الورقة البحثية إطار عمل COVER، وهو إطار عمل لاحق للنموذج (post-hoc) ومستقل عن النموذج (model-agnostic)، يعمل على تحويل أي أداة تحديد زمني للفيديو إلى متنبئ موثوق عبر إصدار مناطق زمنية بضمانات خالية من التوزيع (distribution-free) وعينات محدودة (finite-sample) لاحتواء لحظة الحدث الحقيقية، مما يعالج الغموض المتأصل في حدود الأحداث والافتقار إلى مقاييس الموثوقية في الأنظمة الحالية.

Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban2026-08-10
💬 NLP

LADDER: Language-Driven Slice Discovery and Error Rectification in Vision Classifiers

يُعد LADDER إطار عمل مبتكر يسخر النماذج اللغوية الكبيرة لاكتشاف شرائح خطأ متماسكة ومدفوعة باللغة وتوليد سمات زائفة للتخفيف الشامل من الانحياز في مصنفات الرؤية، متجاوزاً بذلك قيود طرق التجميع والأسالسة القائمة على السمات عبر دمج المعرفة بالمجال والاستدلال المتقدم دون الحاجة إلى تسميات توضيحية صريحة.

Shantanu Ghosh, Rayan Syed, Chenyu Wang, Vaibhav Choudhary, Binxu Li, Clare B. Poynton, Shyam Visweswaran, Kayhan Batman (…)2026-08-07
⚡ electrical engineering

Tree-NET: Enhancing 2D Medical Image Segmentation Through Efficient Low-Level Feature Training

تُعد Tree-NET إطار عمل مبتكر لتجزئة الصور الطبية يستخدم إشرافاً مزدوجاً عند عنق الزجاجة لضغط بيانات المدخلات والبيانات التسموية عبر الترميز التلقائي، مما يقلل بشكل كبير من التكلفة الحسابية واستهلاك الذاكرة مع الحفاظ على دقة التجزئة أو تحسينها عبر مختلف نماذج العمود الفقري.

Orhan Demirci, Bulent Yilmaz2026-08-07
💻 computer science

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

تقدم الورقة البحثية نموذج Afford-X، وهو نموذج مدمج وفعال وقابل للتدريب من البداية إلى النهاية، معزز بمجموعة بيانات LVIS-Aff واسعة النطاق، والذي يحقق استدلالاً فائقاً وقابلاً للتعميم في القدرات المتاحة (affordance) من أجل التلاعب الروبوتي الموجه نحو المهام، مع تفوقه بشكل كبير على الطرق غير القائمة على النماذج اللغوية الكبيرة (non-LLM) وتقديمه استدلالاً أسرع من GPT-4V.

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao2026-08-07
💻 computer science

FashionPose: Unified Text-Driven Fashion Synthesis with Joint Geometric and Photometric Control

يُعد FashionPose إطار عمل موحداً مدفوعاً باللغة يتغلب على قيود التوليد التقليدي الموجه بالوضعية من خلال توظيف بنية متتالية لتوليد أوضاع خالية من القوالب وإعادة إضاءة مدركة للمشهد بشكل مشترك، مما يتيح توليد ملابس واقعي وقابل للتحكم لأغراض التجارة الإلكترونية في مجال الأزياء.

Chuancheng Shi, Shaotian Li, Zhenlong Yuan, Zifeng Cheng, Fei Shen2026-08-07
🤖 AI

APTx Neuron: A Unified Trainable Neuron Architecture Integrating Activation and Computation

تقدم الورقة البحثية "APTx Neuron"، وهي بنية موحدة قابلة للتدريب تدمج التنشيط غير الخطي والتحويل الخطي في تعبير واحد لتعزيز كفاءة التحسين والقدرة التعبيرية، مما أظهر أداءً فائقاً على مجموعة بيانات MNIST مقارنة بالخلايا العصبية التقليدية.

Ravin Kumar2026-08-07