🤖 AI

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

تقدم الورقة البحثية Seg-Agent، وهو إطار عمل خالٍ من التدريب يحقق أحدث ما توصل إليه العلم في مجال التجزئة الموجهة لغوياً عبر توظيف حلقة استنتاج متعددة الوسائط صريحة مع تلميحات بصرية من نوع "مجموعة العلامات" (Set-of-Mark) لتمكين التغذية الراجعة البصرية التكرارية، إلى جانب اقتراح معيار تقييم جديد يسمى Various-LangSeg للتقييم الشامل.

Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu2026-05-14
🤖 AI

AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding

يُعد AdaFocus إطار عمل فعال لفهم الفيديوهات الطويلة يتغلب على قيود الترميز أحادي المرحلة الجامد من خلال الجمع بين عينة ذات صلة وتنوع تكيفي مدركة للاستعلام وبين آلية استرجاع من القرص بدون ذاكرة تخزين مؤقت تُحفزها حالة عدم اليقين، وذلك للحصول تدريجياً على أدلة عالية الدقة عند الطلب، محققاً توازناً فائقاً بين الدقة والكفاءة عبر معايسات متعددة.

Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin2026-05-14
💻 computer science

Reducing Bias and Variance: Generative Semantic Guidance and Bi-Layer Ensemble for Image Clustering

تقترح هذه الورقة البحثية إطار عمل GSEC، وهو إطار عمل جديد لتجميع الصور يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط للتوجيه الدلالي التوليدي واستراتيجية تجميع ثنائية الطبقات لتقليل الانحياز والتباين في آن واحد، متفوقاً بذلك على 18 طريقة من أحدث الأساليب عبر ست مجموعات بيانات مرجعية.

Feijiang Li, Zhenxiong Li, Jieting Wang, Zizheng Jiu, Saixiong Liu, Liang Du2026-05-14
💻 computer science

ImageAttributionBench: How Far Are We from Generalizable Attribution?

لمعالجة أوجه القصور في مجموعات البيانات الحالية في أبحاث إسناد الصور، تقدم هذه الورقة ImageAttributionBench، وهو معيار شامل يتميز بصور اصطناعية متنوعة ومتطورة تكشف عن فجوات كبيرة في متانة وطبيعة تعميم طرق الإسناد الحالية.

Tingshu Mou, Zhipeng Wei, Chao Gong, Jingjing Chen, Xingjun Ma2026-05-14
⚡ electrical engineering

Amortized Guidance for Image Inpainting with Pretrained Diffusion Models

تقدم هذه الورقة البحثية طريقة "الترميم المستهلك عبر الانتشار" (AID)، وهي منهجية تعمل على تدريب وحدة توجيه صغيرة قابلة لإعادة الاستخدام على نموذج انتشار مسبق التدريب وثابت لتحقيق ترميم صور عالي الجودة وفعال دون الحاجة إلى تحسين لكل حالة على حدة، وذلك من خلال الاستفادة من صياغة غاوسية مبتكرة وخوارزمية "الممثل-الناقد" للربط بين التوجيه الحتمي والأهداف العشوائية القابلة للتعلم.

Yilie Huang, Xun Yu Zhou2026-05-14
💻 computer science

PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution

يُعد PRISM إطار عمل يعتمد على الانتشار في خطوة واحدة لرفع دقة صور النصوص، وهو يحقق أداءً هو الأفضل في فئته واستدلالاً بمستوى الميلي ثانية من خلال توظيف تصحيح مسبق لمطابقة التدفق لتصحيح الشروط النصية العالمية غير الموثوقة، ومشفّر متبقٍ مستند إلى البنية ومدرك لعدم اليقين لتنقية حدود الضربات المحلية الغامضة.

Zihang Xu, Xiaoyang Liu, Zheng Chen, Yulun Zhang, Xiaokang Yang2026-05-14
🤖 AI

CoGE: Sim-to-Real Online Geometric Estimation for Monocular Colonoscopy

تقدم هذه الورقة CoGE، وهو إطار عمل مبتكر للتقدير الهندسي أحادي العدسة عبر الإنترنت في تنظير القولون، والذي يستفيد من وحدة إشراف مدركة للإضاءة ووحدة إدراك مدركة للهيكل لتحقيق أداء رائد على البيانات الواقعية مع التدريب حصرياً على البيانات المحاكية.

Liangjing Shao, Beilei Cui, Hongliang Ren2026-05-14
🤖 AI

Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency

تقدم هذه الورقة البحثية "البروز الدلالي المضاد للواقع" (CSS)، وهو إطار عمل للصندوق الأسود يكشف عن فجوة كبيرة بين الإدراك البشري وإدراك نماذج اللغة والرؤية (VLM) للمشاهد، مما يظهر أن النماذج تعتمد بشكل مفرط على حجم الأشياء، ومركزيتها، وبروزها، بينما تقلل من وزن البشر مقارنة بالأسس النفسية الفيزيائية البشرية.

Ziqi Wen, Parsa Madinei, Miguel P. Eckstein2026-05-14
💻 computer science

BrainAnytime: Anatomy-Aware Cross-Modal Pretraining for Brain Image Analysis with Arbitrary Modality Availability

تُعد BrainAnytime إطار عمل موحداً للتدريب المسبق يستفيد من مشفر تلقائي ثلاثي الأبعاد مقنع مشترك مع تقنيات التقطير عبر الوسائط والتقنيات القائمة على التغطية المنهجية الموجهة بالأطلس لتمكين تحليل قوي لصور الدماغ عبر مجموعات عشوائية من الوسائط، مما يتفوق بشكل كبير على النماذج الحالية في التعامل مع بيانات التصوير السريري غير المتجانسة وغير المكتملة.

Guangqian Yang, Tong Ding, Wenlong Hou, Yue Xun, Ye Du, Qian Niu, Shujun Wang2026-05-14
💻 computer science

Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling

تقدم هذه الورقة البحثية Edit-Compass وEditReward-Compass، وهي مجموعة معايير موحدة تضم 2,388 حالة مشروحة و2,251 زوجًا من التفضيلات مع بروتوكولات تقييم دقيقة للتغلب على أوجه القصور في مجموعات البيانات الحالية في التقييم الدقيق لنماذج تحرير الصور الرائدة ونماذج المكافأة المخصصة للتحسين القائم على التعلم المعزز (RL).

Xuehai Bai, Yang Shi, Yi-Fan Zhang, Xuanyu Zhu, Yuran Wang, Yifan Dai, Xinyu Liu, Yiyan Ji, Xiaoling Gu, Yuanxing Zhang2026-05-14