💻 computer science

Can Vision-Language Models Reason about AI Edits in Images?

تقترح هذه الورقة إطار عمل للتعلم التعزيزي يعتمد على تحسين السياسة النسبية للمجموعة (GRPO)، والذي يُمكّن نماذج الرؤية واللغة من التفكير في تعديلات الصور المُنشأة بواسطة الذكاء الاصطناعي وتحديد مواقع التلاعب باستخدام مكافآت بسيطة للدقة والتنسيق، محققةً أداءً تنافسياً في الكشف دون الحاجة إلى إشراف صريح على التفكير.

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji2026-07-31
💻 computer science

Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation

تقترح هذه الورقة سير عمل للمراقبة عبر الأقمار الاصطناعية النانوية ذاتية التحكم يجمع بين الاستدلال الطرفي على متن القمر الاصطناعي وبين تعزيز البيانات التوليدي القائم على نماذج الانتشار للتغلب على قيود عرض نطاق التردد الهابط وعدم توازن الفئات، محققاً معالجة في الوقت الفعلي وتحسناً كبيراً في دقة الكشف عن فئات الطائرات النادرة.

Antonio Delgado-Rosa, David Muñoz-Valero, Enrique Adrian Villarrubia-Martin, Juan Moreno-Garcia2026-07-31
💻 computer science

Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

تقدم الورقة البحثية GenEvA، وهو إطار عمل توليدي لتجميع الأدلة الكامنة ينظم إطارات الفيديو المختارة في أدلة عابرة للإطارات ذات صلة بالاستعلام عبر واجهة كامنة موجهة بالتوزيع، مما يحسن بشكل كبير من أداء فهم الفيديوهات الطويلة مع حد أدنى من التكاليف الحسابية الإضافية.

Bowen Liu, Shuning Wang, Xinpeng Ding, Zhiheng Wu, Bodong Du, Xiaomeng Li2026-07-31
💻 computer science

What to Remove, What to Preserve: Dual-Ambiguity Rectification for All-in-One Image Restoration

تقترح الورقة البحثية DAR-Net، وهو إطار عمل جديد وشامل لترميم الصور يعالج تحديات الغموض الدلالي والمكاني من خلال تمثيل نمطي للتدهور (Degradation Archetype Representation) ووحدات تصحيح مخصصة، محققاً أداءً هو الأفضل في فئته عبر مختلف معايير قياس التدهور المتنوعة.

Cencen Liu (University of Electronic Science and Technology of China), Wen Yin (University of Electronic Science and Tec (…)2026-07-31
💻 computer science

MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition

تقدم هذه الورقة MarkushGlyph وOCSRGlyph، وهما نموذجان لترجمة الصور إلى نصوص يحسنان بشكل كبير من التعرف على البنى الكيميائية من خلال الاستفادة من نهج الرؤية واللغة لبنى ماركوش (Markush structures) وتعزيز التعامل مع الكيمياء الفراغية للجزيئات المفردة، إلى جانب مقياس جديد لتقييم دقة ترجمة بنى ماركوش.

Alex Andonian, Samuel G Rodriques, Andrew D White, Siddharth M Narayanan2026-07-31
💻 computer science

Finding Change in Satellite Archives from Text: How to Combine Before-and-After Images Efficiently

تقدم هذه الورقة تقييماً منضبطاً لثمانية تصميمات لوحدات الدمج من أجل مطابقة استعلامات اللغة الطبيعية مع أرشيفات صور الأقمار الصناعية ثنائية الزمن بكفاءة، مما يثبت أن البحث ثنائي المرحلة الخالي من التدريب يقلل تكاليف الاستعلام بشكل كبير مع الحفاظ على الأداء، ويكشف أن النماذج الخطية المقيدة بالذاكرة مثل Mamba لا توفر أي ميزة في السرعة مقارنة بآليات الانتباه عند مقاييس الرؤية النموذجية.

Simon Roy, Mark Bong, Giovanni Beltrame2026-07-31
🤖 machine learning

MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

تُعد MixFrag إطار عمل للكمّ بعد التدريب مختلط الدقة وموجّه بالهشاشة لنماذج المحولات الرؤيوية (Vision Transformers)، حيث يقوم بتقدير حساسية مستوى المكونات عبر تباعد كولباك - ليبلر (KL divergence) ويُحسّن تخصيص البتات باستخدام مسألة حقيبة متعددة الخيارات لتحقيق أداء رائد في مهام تصنيف الصور وكشف الأشياء.

Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar Faruk2026-07-31
💬 NLP

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

تقدم هذه الورقة تقنية "تقطير العزو البصري" (VAD)، وهي خوارزمية مضادة للواقع تعمل على عزل التصحيحات المنسوبة بصرياً من إشارات المعلم المختلطة في عملية التقطير متعدد الوسائط القائمة على السياسة، وذلك لإعادة بناء أهداف تدريبية أكثر فعالية ومتوافقة مع الأدلة، والتي تتفوق على الأساليب الحالية في معايير الاختبار البصرية دقيقة التفاصيل.

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen (…)2026-07-31
💻 computer science

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

تقدم الورقة البحثية "Beacon"، وهو نموذج استدلال بصري وكيل (agentic) مبتكر يحسن الأداء العام من خلال معالجة أوجه القصور في النماذج الحالية في مجالي التكيف مع الأنماط (Mode Adaptiveness) وتأثير الأدوات (Tool Effect) عبر إطار عمل للتعلم المعزز يتميز بمكافآت تكيفية مدركة للضرورة (Necessity-Aware Adaptive Rewards) وتوسيع القدرات الموجه بالتلميح (Hint-Guided Capability Expansion).

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuan (…)2026-07-31
💬 NLP

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

تقدم هذه الورقة البحثية OSReward، وهو معيار شامل يكشف عن أوجه القصور في نماذج الرؤية واللغة الحالية كحكام للوكلاء المستخدمين للحاسوب، وتعالج هذه الفجوة من خلال إطلاق OS-Shepherd، وهي عائلة من نماذج المكافأة المفتوحة ومنخفضة التكلفة والمدربة على مجموعة بيانات جديدة موسومة بالاستدلال تضاهي الأداء التجاري بجزء بسيط من التكلفة.

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, X (…)2026-07-31