💻 computer science

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

تقترح الورقة البحثية إطار عمل ADOPD، وهو إطار تقطير في السياسة (on-policy) يتمتع بامتياز المرجع، والذي يعمل على استيعاب فوائد المقارنة القائمة على المرجع داخل نموذج طالب يعتمد على الاستعلام فقط من خلال الاستفادة من معلم مدرك للمرجع لتوجيه الكشف عن الشذوذ بدقة متناهية، محققاً بذلك أداءً هو الأفضل في فئته (state-of-the-art) في اختبار الصفر (zero-shot) على معيار MMAD.

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang2026-08-11
🤖 AI

MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation

يُعد MedPixel نموذجاً موحداً لغوياً-بكسلياً طبياً يسد الفجوة بين الاستدلال البصري والتحديد الدقيق من خلال الاستفمادة من مجموعة بيانات تم إنشاؤها حديثاً تضم 440 ألف عينة (MedPLG-440K) واستراتيجية مبتكرة لتحسين التفضيل على مستوى البكسل لتحقيق أداء قوي عبر مهام طبية متنوعة، بما في ذلك التجزئة، والاستدلال، والنقل صفري المعرفة.

Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai Jiang2026-08-11
🤖 machine learning

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

يُعد RynnValue نموذجاً تأسيسياً للقيم الروبوتية مفتوح المصدر، يتوسع ليشمل ملايين المقاطع المشروطة بالتعليمات عبر استخدام المسافة الزمنية كهدف للإشراف، متفوقاً بذلك على الأساليب القائمة على التفضيل في التقييم، ومعززاً بشكل كبير نجاح السياسات في العالم الحقيقي دون الحاجة إلى تعليقات توضيحية صريحة للمكافأة أو التقدم.

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Ya (…)2026-08-11
💬 NLP

Towards Expert-level Medical AI for Real-time Video Consultations

تقدم هذه الورقة البحثية نظام AMIE (الفيديو)، وهو نظام متعدد الوكلاء يعتمد على نموذج Gemini، يحقق أداءً بمستوى الخبراء في الاستشارات الطبية المرئية في الوقت الفعلي من خلال دمج الإدراك السمعي البصري والاستنتاج السريري، مما يثبت في دراسة عشوائية مع أطباء وممثلين للمرضى أنه يضاهي أو يتفوق على الأطباء البشر في دقة التشخيص وأخذ التاريخ المرضي، مع توفير واجهة مفضلة للتواصل مع المرضى.

Mahvish Nagda, Jihyeon Lee, Matthew Thompson, Chunjong Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, T (…)2026-08-11
🤖 AI

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

تقدم هذه الورقة Sci-VBench، وهو معيار شامل يتكون من 1,253 مثالاً تم تعليمه من قبل خبراء عبر أربعة تخصصات علمية لتقييم قدرات توليد الفيديو كثيفة المعرفة والاستدلال لـ 16 نموذجاً من النماذج الرائدة، كاشفةً أنه بينما تحسنت الواقعية البصرية، لا تزال هناك فجوات كبيرة في الصحة العلمية والسببية، لا سيما بين الأنظمة المملوكة والأنظمة مفتوحة المصدر.

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao2026-08-11
🤖 machine learning

Financial Numerical Prediction and Allocation as Token Generation

تقدم هذه الورقة بحث FinATOM، وهو إطار عمل موحد وخالٍ من الرأس (head-free) يستفيد من توليد الرموز المقيد في النماذج اللغوية السببية للقيام مباشرة بالتنبؤ المالي وتخصيص الأصول الديناميكي، مما يظهر عوائد محسنة معدلة حسب المخاطر في مهام صناديق الاستثمار المتداولة (ETF) والمهام الاستثمارية القائمة على النصوص مقارنة بنهج الانحدار أو التصنيف التقليدية.

Xu Ouyang, Moontae Lee2026-08-11
🤖 machine learning

Space-Creating versus Dead Possession: An Off-Ball Possession-Quality Index for Broadcast Football

تقدم هذه الورقة مؤشرًا ثنائي الطبقات لجودة الاستحواذ بدون كرة، يميز بين الاستحواذ العقيم "الميت" وبين التدوير لخلق المساحات من خلال الجمع بين علامة "الاستحواذ غير المجدي" القائمة على التهديد ومؤشر خلق المساحة المستمد من الفيديو، مما يثبت أن هذا المقياس يستوعب قيمة هجومية حاسمة تتجاوز النماذج التقليدية القائمة على الاستحواذ مع الكرة.

Seongjin Choi2026-08-11
💬 NLP

Multimodal Model Diffing for Feature Discovery and Control

تقدم هذه الورقة البحثية MMDiff، وهو إطار عمل لتمييز النماذج متعددة الوسائط (multimodal model-diffing) يستخدم المشفرات التلقائية المتفرقة (sparse autoencoders) لعزل واكتشاف والتحكم السببي في سمات محددة في النماذج اللغوية الكبيرة متعددة الوسائط، مما يتيح تحسينات مستهدفة في الفهم المكاني، والتعرف الضوئي على الحروف (OCR)، والسلامة مع الحفاظ على الأداء العام.

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Cla (…)2026-08-11
💻 computer science

MotionStrata: Hierarchical Motion Latents for Compact Video Autoencoding

يقدم MotionStrata إطار عمل للترميز التلقائي للفيديو هرمي التنظيم، يقوم بتنظيم ميزانية حركة ثابتة إلى حركة عالمية مضغوطة زمنياً وحركة تفصيلية متوافقة مع الإطارات عبر توجيه موجه بالتردد، مما يحقق جودة إعادة بناء فائقة تحت ضغط شديد مقارنة بالتمثيلات الموحدة.

Wenzhang Sun, Huaize Liu, Chunfeng Wang, Biao Gong, Hao Li, Changqing Zou2026-08-10
💻 computer science

Identity-Preserving Aging and De-Aging of Faces in the StyleGAN Latent Space

تقترح هذه الورقة طريقة لتعمير وتصغير سن الوجه مع الحفاظ على الهوية من خلال نمذجة اتجاهات التقدم في السن داخل فضاء كامن لنموذج StyleGAN2 باستخدام نمذجة ناقلات الدعم واختيار الميزات، مما يتيح توليد مجموعة بيانات اصطناعية جديدة لاختبار أنظمة التعرف عبر الأعمار وأنظمة ضمان العمر.

Luis S. Luevano, Pavel Korshunov, Sebastien Marcel2026-08-10