🤖 AI

ARM: Advantage Reward Modeling for Long-Horizon Manipulation

تقترح الورقة البحثية نموذج مكافأة الميزة (ARM)، وهو إطار عمل يستخدم استراتيجية تسمية ثلاثية الحالات منخفضة التكلفة لتقدير الميزة النسبية بدلاً من التقدم المطلق، مما يتيح تعلماً تعزيزياً غير متصل عبر الإنترنت لمهام المناولة الروبوتية طويلة الأمد مع تدخل بشري يقترب من الصفر.

Yiming Mao, Zixi Yu, Weixin Mao, Yinhao Li, Qirui Hu, Zihan Lan, Minzhao Zhu, Hua Chen2026-04-06
🤖 machine learning

The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling

تكشف هذه الورقة أن توسيع نطاق نماذج الرؤية واللغة والأفعال (Vision-Language-Action) محدود جوهرياً بـ "فجوة الضغط"، حيث يؤدي التجزئة المنفصلة للأفعال إلى إنشاء عنق زجاجة معلوماتي ثابت يمنع مكاسب الأداء الناتجة عن تحسين مشفرات الرؤية، على عكس تمثيلات الأفعال المستمرة التي تسمح لهذه التحسينات بالانتشار بفعالية.

Takuya Shiba2026-04-06
🤖 machine learning

PR3DICTR: A modular AI framework for medical 3D image-based detection and outcome prediction

تقدم الورقة البحثية PR3DICTR، وهو إطار عمل للتعلم العميق مفتوح المصدر ومعياري مبني على PyTorch وMONAI، يعمل على تبسيط تطوير نماذج تصنيف الصور الطبية ثلاثية الأبعاد والتنبؤ بالنتائج من خلال الموازنة بين الوظائف المعيارية والتخصيص المرن.

Daniel C. MacRae, Luuk van der Hoek, Robert van der Wal, Suzanne P. M. de Vette, Hendrike Neh, Baoqiang Ma, Peter M. A. (…)2026-04-06
⚡ electrical engineering

HyperCT: Low-Rank Hypernet for Unified Chest CT Analysis

تُعد HyperCT إطار عمل فعال من حيث المعلمات يجمع بين الشبكة الفائقة (Hypernetwork) والتكيف منخفض الرتبة (LoRA) لتكييف هيكل محول الرؤية (Vision Transformer) ديناميكيًا، مما يتيح تحليلًا موحدًا ومتفوقًا لمهام متعددة لصور الأشعة المقطعية للصدر غير المتباينة التي لا تعتمد على التباين، وذلك لكل من فحص الرئة وما وراء الرئة.

Fengbei Liu, Sunwoo Kwak, Hao Phung, Nusrat Binta Nizam, Ilan Richter, Nir Uriel, Hadar Averbuch-Elor, Daborah Estrin, M (…)2026-04-06
👁️ computer vision

Face Density as a Proxy for Data Complexity: Quantifying the Hardness of Instance Count

تُثبت هذه الورقة أن كثافة العينات هي محرك جوهري وقابل للقياس لتعقيد البيانات، وذلك من خلال إثبات أن أداء تعلم الآلة يتدهور بشكل رتيب مع زيادة أعداد الوجوه، وأن النماذج التي يتم تدريبها على بيانات منخفضة الكثافة تفشل في التعميم على سيناريوهات أكثر كثافة بسبب انحيازات منهجية في نقص العد.

Abolfazl Mohammadi-Seif, Ricardo Baeza-Yates2026-04-06✓ Author reviewed
⚡ electrical engineering

Estimating Head Motion from MR-Images

تقدم هذه الورقة طريقة للتعلم العميق تُقدر بدقة حركة الرأس الطفيفة وغير المكتشفة مباشرة من صور الرنين المغناطيسي من نوع T1w وT2w وFLAIR باستخدام بيانات كاميرا العمق داخل الماسح الضوئي كمرجع حقيقي، مما يُظهر أداءً فائقاً مقارنة بالطرق الحالية ويحافظ على الارتباط المعروف بين الحركة والعمر.

Clemens Pollak, David Kügler, Martin Reuter2026-04-03
🤖 machine learning

Robust Adaptation of Foundation Models with Black-Box Visual Prompting

تقترح هذه الورقة BlackVIP، وهو إطار عمل فعال من حيث المعلمات يعمل على تكييف النماذج سابقة التدريب واسعة النطاق في بيئات الصندوق الأسود دون الوصول إلى معاملاتها أو تنشيطاتها المتوسطة، وذلك عبر استخدام منسق للمطالبات البصرية المعتمدة على المدخلات وخوارزمية SPSA-GC لتقدير التدرج بكفاءة، مع تقديم رابط نظري بالمتانة المعتمدة.

Changdae Oh, Gyeongdeok Seo, Geunyoung Jung, Zhi-Qi Cheng, Hosik Choi, Jiyoung Jung, Kyungwoo Song2026-04-03
💻 computer science

OOD-SEG: Exploiting out-of-distribution detection techniques for learning image segmentation from sparse multi-class positive-only annotations

تقترح هذه الورقة البحثية OOD-SEG، وهو إطار عمل جديد للتعلم من العينات الموجبة غير المصنفة (positive-unlabeled learning) يستفيد من تقنيات كشف البيانات خارج التوزيع (out-of-distribution detection) لإجراء تقسيم متعدد الفئات للصور باستخدام تعليقات توضيحية موجبة متفرقة فقط، مع إلغاء الحاجة إلى تسمية الخلفية ومعالجة تحدي المخرجات الزائفة أثناء النشر.

Junwen Wang, Zhonghao Wang, Oscar MacCormac, Jonathan Shapey, Tom Vercauteren2026-04-03
💻 computer science

InTraGen: Trajectory-controlled Video Generation for Object Interactions

تُعد InTraGen مسار معالجة مبتكر يعزز توليد الفيديو من النصوص للتفاعلات بين الأجسام المتعددة عبر إدخال آلية ترميز متعددة الوسائط مع حقن معرف الجسم، مدعومة بأربع مجموعات بيانات جديدة ومقياس جودة المسار لتقييم وتحسين الدقة البصرية وواقعية التفاعل.

Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool (…)2026-04-03
⚡ electrical engineering

Learning to Translate Noise for Robust Image Denoising

تقترح هذه الورقة إطار عمل جديد لترجمة الضجيج يقوم بتحويل الضجيج الواقعي المعقد وغير المعروف إلى ضجيج غاوسي عبر شبكة مخصصة، مما يتيح لمزيل الضجيج الغاوسي المُدرب مسبقاً تحقيق متانة وقدرة تعميم فائقتين على البيانات الخارجة عن التوزيع مقارنة بالأساليب الرائدة الحالية.

Inju Ha, Donghun Ryou, Seonguk Seo, Bohyung Han2026-04-03