🤖 machine learning

Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription

تتناول هذه الورقة تحدي النسخ النصي للمستندات المكتوبة بخط اليد متعددة الصفحات بنمط التعلم الصفري من خلال تقديم معيار "مالفيرن-هيلز" (Malvern-Hills) واستراتيجيات صياغة أوامر مبتكرة (OCR+PAGE-1 و OCR+PAGE-N) تستفيد من النماذج اللغوية الكبيرة متعددة الوسائط لمشاركة المعلومات السياقية عبر الصفحات، متفوقة بذلك على النهج الحالية أحادية الصفحة أو أحادية الوسائط.

Benjamin Gutteridge, Matthew Thomas Jackson, Toni Kukurin, Xiaowen Dong2026-04-21
🤖 machine learning

EmbodiTTA: Resource-Efficient Test-Time Adaptation for Embodied Visual Systems

تقدم هذه الورقة البحثية OD-TTA، وهو إطار عمل فعال في استهلاك الموارد للأنظمة البصرية المتجسدة، والذي يستخدم التكيف عند الاختبار عند الطلب والمحفز باكتشاف تغير النطاق، مقترناً باختيار النموذج المصدر وتحديثات تطبيع الدفعات المنفصلة، لتحقيق دقة عالية مع تقليل عبء الذاكرة والطاقة بشكل كبير على أجهزة الحافة.

Xiao Ma, Young D. Kwon, Dong Ma2026-04-21
💬 NLP

CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks

تقدم هذه الورقة البحثية CROC، وهو إطار عمل قابل للتوسع لإجراء فحوصات متناقضة مؤتمتة للصلابة، يقوم بتوليد مجموعة بيانات ضخمة ذات تسميات زائفة ومعيار مرجعي خاضع للإشراف البشري لتقييم مقاييس تحويل النص إلى صورة بشكل منهجي، مما يكشف عن عيوب كبيرة في الصلابة في الأساليب الحالية ويُمكّن من تدريب المقياس مفتوح المصدر والأحدث حالياً، CROCScore.

Christoph Leiter, Yuki M. Asano, Margret Keuper, Steffen Eger2026-04-21
💬 NLP

ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows

تقدم الورقة البحثية ScienceBoard، وهو بيئة واقعية متعددة المجالات ومعيار مرجعي يتكون من 169 مهمة علمية تم التحقق منها بدقة صُممت لتقييم الوكلاء المستقلين متعددي الوسائط، مما يكشف أن النماذج الحالية المتطورة لا تحقق سوى نسبة نجاح تبلغ 15% في سير العمل العلمي المعقد ويسلط الضوء على الحاجة إلى تحسين مبادئ التصميم لدعم الاكتشاف العلمي المؤتمت.

Qiushi Sun, Zhoumianze Liu, Chang Ma, Zichen Ding, Fangzhi Xu, Zhangyue Yin, Haiteng Zhao, Zhenyu Wu, Kanzhi Cheng, Zhao (…)2026-04-21
💬 NLP

MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding

تقترح الورقة البحثية MUSEG، وهي طريقة تعتمد على التعلم المعزز تعمل على تعزيز الاستدلال الزمني دقيق التفاصيل للنماذج اللغوية الكبيرة متعددة الوسائط من خلال إدخال التأسيس متعدد القطع الواعي بالطوابع الزمنية واستراتيجية تدريب مكافأة مرحلية، مما يتفوق بشكل كبير على النهج الحالية في مهام التأسيس الزمني والأسئلة والأجوبة المرئية الحساسة للوقت.

Fuwen Luo, Shengfeng Lou, Chi Chen, Ziyue Wang, Chenliang Li, Weizhou Shen, Jiyue Guo, Peng Li, Ming Yan, Ji Zhang, Fei (…)2026-04-21
💻 computer science

OD3: Optimization-free Dataset Distillation for Object Detection

تقدم هذه الورقة البحثية OD3، وهو إطار عمل لتقطير مجموعات البيانات لتعرف الأشياء لا يعتمد على التحسين، يقوم بتخليق مجموعات بيانات مدمجة من خلال وضع المرشحين بشكل تكراري وفحص النماذج سابقة التدريب، محققاً أداءً هو الأفضل في حالته على مجموعتي بيانات COCO وPASCAL VOC بدقة أعلى بكثير من الطرق الحالية.

Salwa K. Al Khatib, Ahmed ElHagry, Shitong Shao, Zhiqiang Shen2026-04-21
🤖 machine learning

Rethinking Post-Unlearning Behavior of Large Vision-Language Models

تتناول هذه الورقة مسأًلة الاستجابات المتدهورة أو الهلوسة التي تلي عملية "إلغاء التعلم الآلي" في النماذج اللغوية البصرية الضخمة من خلال تقديم مهمة جديدة وطريقة PUBG، التي تضمن بقاء المخرجات الحافظة للخصوصية غنية بالمعلومات ومرتبطة بصرياً.

Minsung Kim, Nakyeong Yang, Kyomin Jung2026-04-21
⚡ electrical engineering

LLaMA-XR: A Novel Framework for Radiology Report Generation using LLaMA and QLoRA Fine Tuning

تقدم الورقة البحثية LLaMA-XR، وهو إطار عمل مبتكر يجمع بين LLaMA 3.1، وتضمينات صور DenseNet-121، وضبط دقيق باستخدام QLoRA لإنشاء تقارير إشعاعية دقيقة ومتماسكة سريريًا بكفاءة، محققًا أداءً هو الأفضل في فئته على مجموعة بيانات IU X-ray.

Md. Zihad Bin Jahangir, Muhammad Ashad Kabir, Sumaiya Akter, Israt Jahan, Minh Chau2026-04-21
💻 computer science

A VLM-based Method for Visual Anomaly Detection in Robotic Scientific Laboratories

تقترح هذه الورقة طريقة استدلال بصري قائمة على نماذج اللغة والرؤية (VLM) تتضمن أربعة تكوينات للمطالبات تزداد معلوماتية بشكل تدريجي للكشف عن الشذوذ في المختبرات العلمية الروبوتية، والتي تم التحقق من صحتها من خلال معيار مرجعي تم إنشاؤه حديثاً وتجارب واقعية تُظهر تحسناً في الدقة مع زيادة المعلومات السياقية.

Shiwei Lin, Chenxu Wang, Xiaozhen Ding, Yi Wang, Boyuan Du, Lei Song, Chenggang Wang, Huaping Liu2026-04-21
🤖 machine learning

R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation

تقدم هذه الورقة البحثية R3D2، وهو نموذج انتشار خفيف الوزن بـخطوة واحدة يتيح الإدراج الواقعي واللحظي لأصول ثلاثية الأبعاد كاملة داخل مشاهد القيادة القائمة على الرندرة العصبية، وذلك عبر توليد ظلال وإضاءة منطقية، مما يتغلب على قيود طرق "Gaussian Splatting" ثلاثية الأبعاد التقليدية من أجل محاكاة القيادة الذاتية القابلة للتوسع.

William Ljungbergh, Bernardo Taveira, Wenzhao Zheng, Adam Tonderski, Chensheng Peng, Fredrik Kahl, Christoffer Petersson (…)2026-04-21