💻 computer science

Path2ST: Hierarchical Cell-Tissue Grounded Cross-Modal Translation for Spatial Transcriptomics

يُعد Path2ST إطار عمل هرمي مبتكر يعمل على تحسين التنبؤ بالتعبير الجيني المكاني من الصور المصبوغة بصبغة الهيماتوكسيلين والإيوسين (H&E) عبر الاستفادة من التسلسلات الهرمية البيولوجية المتأصلة بين الخلايا والأنسجة من خلال نهج ترجمة دلالية متعدد الوسائط، محققاً أداءً هو الأفضل في حالته في توليد ملفات تعريف ترانسكريبتومية دقيقة ومتماسكة مكانياً.

Ruochen Liu, Wei Lou2026-08-18
💻 computer science

Local Gains and Fixed-Assignment Set Losses in Shared Set Decoders

تُظهر هذه الورقة أنه في أجهزة فك التشفير ذات المجموعات المشتركة مثل DETR وDINO، يؤدي حذف علاقة استعلام محددة إلى تحسين "الفتحة" (slot) المعدلة محلياً مع تدهور فائدة مجموعة التنبؤ الإجمالية في الوقت نفسه، مع تباين استمرار هذا التأثير السلبي على مستوى المجموعة بشكل كبير عبر نقاط فحص النماذج وظروف القراءة المختلفة.

Ze Zhang, Yang Zhang2026-08-18
💻 computer science

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

لمعالجة تشبع معايير فهم الفيديو التقليدية أحادية الدور، تقدم هذه الورقة VideoGAIA، وهو معيار صارم متعدد الأدوار ومعزز بالأدوات يضم 271 مهمة تم التحقق منها من قبل خبراء، والتي تكشف عن فجوات كبيرة في أداء النماذج اللغوية الكبيرة متعددة الوسائط الرائدة حالياً، وتهدف إلى دفع المجال نحو فهم الفيديو القائم على الوكالة.

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng2026-08-18
💻 computer science

Braided Vision Transformer for Stroke Detection in Multi-view Retinal Fundus Imaging

تقدم هذه الورقة نموذج "Braided Vision Transformer" (BViT)، وهو نموذج تعلم عميق مبتكر يستفيد من صور قاع العين متعددة المشاهد لكلا العينين للكشف عن السكتة الدماغية والنوبات الإقفارية العابرة من خلال استخراج الميزات ونمذجة العلاقات بين المشاهد في آن واحد، محققاً مساحة تحت المنحنى (AUC) تبلغ 0.75 على مجموعة بيانات جُمعت حديثاً.

Aysen Degerli, Mika Hilvo2026-08-18
💻 computer science

Low Cost Two-Stage Fabric Defect Detection at the Edge

تقدم هذه الورقة نظاماً من مرحلتين ومنخفض التكلفة للكشف عن عيوب الأقمشة، تم نشره على منصة NVIDIA Jetson Nano، يستخدم مشفراً تلقائياً مدمجاً لفرز الإطارات من أجل كاشف YOLOv5n، محققاً استدعاءً عالياً مع الكشف عن أن تسريع الأداء الملحوظ ناتج بشكل أساسي عن فك تشفير JPEG المتوازي بدلاً من بنية الشلال نفسها.

Rasel Hossen, Diptajoy Mistry, Mosaddek Hossain Kamal2026-08-18
💻 computer science

Do CNNs Internally Represent Real and Fake Images Differently? A Hidden-Layer Analysis

تُظهر هذه الورقة أن الشبكات العصبية الالتفافية تعالج الصور الحقيقية والاصطناعية بشكل مختلف من خلال استحثاث أنماط تنشيط متميزة في الطبقات الخفية حتى عندما يتم الحفاظ على المحتوى الدلالي، مما يشير إلى أن هذه الاختلافات الداخلية يمكن استغلالها لتحسين كشف الصور المزيفة.

Moumita Sen Sarma, Pascal Hitzler, Eugene Y. Vasserman2026-08-18
💻 computer science

IP Protection in the Era of Visual Generative AI: A Survey

تقترح هذه المسح الاستقصائي تصنيفاً جديداً ثنائي الأبعاد لحماية الملكية الفكرية في الذكاء الاصطناعي التوليدي البصري، حيث تُصنف الدفاعات التقنية وفقاً لمنطق التحكم ونوع الأصل المستهدف لمراجعة الأساليب الحالية بشكل منهجي، ومواءمة بروتوكولات التقييم، وتحديد التحديات المستقبلية الرئيسية.

Zhuan Shi, Shunchang Liu, Alireza Dehghanpour Farashah, Qian Yang, Han Yu, Cao Yang, Chaochao Chen, Yuping Yan, Yaochu J (…)2026-08-18
💻 computer science

Emergence of Transfer Learning towards Specific Identification of Alzheimer's Disease A Prospective Approach

تتناول هذه المراجعة الاستشرافية تطبيق التعلم بنقل المعرفة لتحسين دقة وقابلية التفسير لتشخيص مرض الزهايمر باستخدام بيانات التصوير العصبي، مع معالجة تحديات مثل الإفراط في التخصيص ومحدودية مجموعات البيانات، وتوجيه الأبحاث المستقبلية في هذا المجال.

Soumik Podder, Chandramouli Haldar2026-08-18
💻 computer science

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

تقترح هذه الورقة إطار عمل موحداً لإنشاء الصور والفيديو يعزز التحرير الدقيق والمتسق زمنياً من خلال دمج التنبؤ بالعمق والناظم السطحي كإشراف بصري مهيكل ضمن عمود فقري مشترك لمحول انتشار متعدد الوسائط، مما ينقل المعرفة الهيكلية المفيدة إلى مهام التوليد اللاحقة.

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen2026-08-18
💻 computer science

PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models

تقدم الورقة البحثية PolyComp، وهو معيار يتم إنشاؤه إجرائياً يتكون من 120 مسألة مصممة لتقييم الاستدلال المكاني ثلاثي الأبعاد التركيبي في النماذج متعددة الوسائط، كاشفةً أنه بينما تحقق النماذج المتقدمة مثل GPT-5.6 Sol دقة متوسطة (50%)، فإن النماذج الأخرى تعاني بالقرب من مستويات التخمين العشوائي رغم تباين التكاليف وتنسيقات العرض.

Siddharth Patel2026-08-18