💻 computer science

Oh Deer, How Should I Handle This? Seasonal Priors for Selective Wildlife Annotation and Classification

تُثبت هذه الورقة أن دمج الأولويات الموسمية القائمة على الأسس البيولوجية مع البيانات متعددة الأنماط (المرئية والحرارية) يعزز بشكل كبير من موثوقية تصنيف وتوسيم الحياة البرية لآيل الأرخص، وذلك عبر تحديد نوافذ الأدلة المتوقعة، وحل التسميات الغامضة من خلال المراجعة البشرية، وتحسين التنبؤ الانتقائي لتحقيق دقة عالية مع إدارة عدم اليقين.

Hugo Markoff, Christoph Praschl, Anton Hjalte Jørgensen, Christian Emil Mogensen, Mathias Bech Skadhauge, Sara Beery, Mi (…)2026-08-05
💻 computer science

PixelUp: Zero-Shot Semantic Feature Upsampling for Fine-Grained Vision Tasks

تُعد PixelUp طريقةً لرفع دقة الصور تعتمد على التعلم الصفري (zero-shot) وتكون مستقلة عن نماذج الرؤية الأساسية (VFM-agnostic)، حيث تستفيد من بنية انتباه تقاطعي نافذي من الخشن إلى الناعم موجه بميزات دلالية متعددة المقاييس للتغلب على الدقة المنخفضة لنماذج الرؤية الأساسية، محققةً أداءً رائدًا في مهام التنبؤ الكثيف مثل التجزئة الدلالية وتقدير العمق دون الحاجة إلى إعادة التدريب.

Deepank Singh, Anurag Nihal, Vedhus Hoskere2026-08-05
💻 computer science

SAGE: Semantic Explainability of Attention-Based Survival Models in Computational Pathology

تقدم الورقة البحثية SAGE، وهو إطار عمل لاحق للتحليل (post-hoc) يستفيد من نموذج رؤية-لغة متخصص في علم الأمراض لتوليد تفسيرات عالمية قائمة على اللغة لنماذج البقاء القائمة على الانتباه في علم الأمراض الحسابي، مما يكشف كيفية دفع مفاهيم نسيجية محددة للتنبؤات عبر مجموعات المرضى وتمكين اكتشاف المؤشرات الحيوية.

Abdallah Lamane, Abdul Rahman Diab, Ren-Chin Wu, William Lotter2026-08-05
💻 computer science

A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation

تقدم هذه الورقة إطار عمل موحداً ثنائي الأبعاد يدمج الاستدلال القائم على النماذج اللغوية الكبيرة مع كشف الآفات، وتجزئتها، وتوليد تقارير قصيرة على مجموعة بيانات DeepLesion، محققةً تحسينات ملحوظة في الأداء مقارنة بالنماذج الحالية مثل nnUNet مع إطلاق كودها وبياناتها ونماذجها كأساس مفتوح المصدر.

Ruida Cheng, Tejas S. Mathai, Benjamin Hou, Qingqing Zhu, Zhiyong Lu, Matthew McAuliffe, Ronald M. Summers2026-08-05
💻 computer science

In-Context Collapse in Vision-Language Models and How to Mitigate it?

تكشف هذه الورقة أن التعلم في السياق متعدد الأمثلة (many-shot in-context learning) في نماذج الرؤية واللغة يمكن أن يؤدي إلى "انهيار في السياق" كارثي حيث تنخفض الدقة بشكل حاد مع تراكم الأمثلة التوضيحية، وتحدد هذا الفشل باعتباره خللاً محددًا في مسار تكامل الرؤية واللغة، وتقترح تدخلًا خفيف الوزن وقابلًا للنقل يسمى CircA لاستعادة التعلم القوي.

Mohammad Rostami2026-08-05
💬 NLP

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

تقدم الورقة البحثية CURV، وهو إطار عمل للتعلم المنهجي مقترن بمجموعة بيانات CCQA، والذي يعزز الإجابة على الأسئلة المتعلقة بالمخططات البيانية من خلال تدريب النماذج متعددة الوسائط على أداء استدلال بصري جوهري متعدد الخطوات ومرتبط بالواقع، مما يؤدي إلى تحسينات كبيرة في الأداء عبر مختلف المعايير المرجعية.

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li2026-08-05
💻 computer science

Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews

تُثبت هذه الدراسة أن تقنيات القناع والتركيب من جانب العميل يمكن أن تنجح في حصر تعديلات جراحة التجميل في مناطق وجه محددة عبر مختلف واجهات برمجة التطبيقات التجارية دون الحاجة إلى الوصول إلى المكونات الداخلية للنماذج، مما يوفر حلاً منخفض التكلفة لمنع التغييرات غير المقصودة في ملامح الوجه الأخرى.

Sukhrobbek Ilyosbekov2026-08-05
💻 computer science

Test Time Adaptation Methods for Point Cloud Registration in Laparoscopic Surgery

تقترح هذه الورقة وتقيم طرقًا معدلة للتكيف في وقت الاختبار (TTA) لتسجيل السحب النقطية ثلاثية الأبعاد في جراحة المناظير، مظهرةً أن التكيف مع المدخلات يقدم التوازن الأكثر واعدًا بين زمن الاستجاء المنخفض وتحسن الأداء المتسق عبر مجموعات البيانات الاصطناعية والواقعية مقارنةً بالنهج القائم على النموذج والنهج القائم على التطبيع.

Nina Bodelot, Soufiane Belharbi, Eric Granger2026-08-05
💻 computer science

Material-Segmented Per-Pixel Emissivity Correction for Thermographic Anomaly Detection in Cultural Heritage Digital Twins

تقدم هذه الورقة مسار عمل لا يتطلب تدريباً يقوم بتصحيح عيوب درجات الحرارة التصويرية الحرارية في التوائم الرقمية للتراث الثقافي من خلال اشتقاق الانبعاثية لكل بكسل من تقسيم الصور (RGB) ذي المفردات المفتوحة، مما يكشف عن أنه بينما يحسن هذا الأسلوب الدقة بشكل كبير بالنسبة للتشوهات ذات الانبعاثية المنخفضة، فإن تأثيره على أسطح التراث المعتادة المتجوية يكون محدوداً نظراً لانبعاثيتها العالية والمتجانسة طبيعياً.

Jonathan Klingspon, Scott McAvoy, Maurizio Seracini, Falko Kuester2026-08-05
💻 computer science

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

يُعد Qwen-3D نموذجاً لغوياً متعدد الوسائط جديداً مدركاً للهندسة، حيث يستفيد من تضمينات الموضع الدورانية ثلاثية الأبعاد ومفكك ترميز تجزئة قائم على الاستعلام لتوحيد الاستدلال المكاني، والتأصيل المرجعي، وتجزئة الكائنات عبر الصور ومقاطع الفيديو، مما يجسّر بفعالية الفجوة بين اللغة والتنبؤات الهندسية ثلاثية الأبعاد الكثيفة مع التفوق على النماذج المتخصصة والمملوكة الحالية.

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki2026-08-05