💻 computer science

PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining

يُعد PaSTel إطار عمل للتدريب المسبق متعدد الوسائط هرمي يعزز تمثيلات النسخ المكاني من خلال دمج الأولويات البيولوجية على مستويات البقعة والوظيفة والمنطقة للتغلب على قيود طرق اختيار الجينات والمحاذاة الحالية.

Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati, Walid Abdelmoula, Tommaso Mansi, Rui Liao2026-08-18
💻 computer science

Looks Can be Deceiving: Annotator and Reviewer Performance Across Imagery Sources in Crowd-Sourced Aerial Damage Assessment

تثبت هذه الورقة تجريبياً أن أداء المقيّمين والمراجعين يتفاوت بشكل كبير عبر الصور الجوية متعددة المصادر، حيث تُظهر بيانات الأقمار الصناعية ذات الدقة المنخفضة معدلات مراجعة أعلى بكثير من صور الطائرات بدون طيار أو الطيران المأهول ذات الدقة العالية، مما يتحدى فعالية سير عمل ضبط الجودة الموحد ويشير إلى الحاجة إلى استراتيجيات تنسيق تكيفية واعية بالمصدر.

Thomas Manzini, Priyankari Perali, Raisa Karnik, Stephen Johnson, Robin R. Murphy2026-08-18
💻 computer science

Benchmarking Frontier Text-to-Image Models on Image-Description Prompts

تقيم هذه الورقة أربعة من النماذج الرائدة لتحويل النص إلى صورة (Gemini 3 Pro Image، وFLUX.2، وIdeogram 3.0، وHunyuan 3.0) بناءً على 48 مطالبة شديدة التعقيد، كاشفةً أن نموذج Gemini 3 Pro Image يتصدر بنتيجة 84.8/100، مع تسليط الضوء على أن الأنظمة الحالية تعاني أساساً في عد الأشياء، والدقة الهندسية، ووضوح النصوص.

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmed Rashad2026-08-18
💻 computer science

FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making

تقدم هذه الورقة البحثية FZ-VLM، وهو إطار عمل جديد لنماذج الرؤية واللغة ثنائي المراحل يجمع بين Florence-2 وZephyr-7B، والذي يتفوق على النماذج المرجعية الحالية والخبراء البشريين في توصيف العقيدات الرئوية من الأشعة المقطعية بدقة وتوليد توصيات متابعة ذات صلة سريرياً.

Pramit Dutta, Jenita Manokaran, Richa Mittal, Ryan Appleby, Eranga Ukwatta2026-08-18
🤖 machine learning

DualMiT-Net: Local-Global Transformer-Convolutional Fusion for Breast Mass Segmentation in Mammographic Regions of Interest

تقدم الورقة البحثية شبكة DualMiT-Net، وهي شبكة ثنائية الفروع تدمج تفاصيل الكتلة المحلية من مشفر Mix Transformer مع سياق الثدي العالمي من مشفر EfficientNet عبر وحدة فك تشفير ذات بوابة مكانية لتحقيق أداء هو الأفضل في حالته في تقسيم كتلة الثدي على مجموعة بيانات CBIS-DDSM.

Alibek Kamiluly, Milana Muratova, Yash Patel, Fan Li2026-08-18
💻 computer science

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

يُعد Handoff-H1 نظام وكيل رؤية مُنسق يدمج نماذج رؤية حاسوبية متخصصة، ووكلاء مستخدمين للأدوات، وقاعدة معرفية إنشائية لتحقيق استخراج متطور لحجم كميات المواد من المخططات المعمارية الخام، متفوقاً بذلك على كل من النماذج الذكية الرائدة والمقدرين المهنيين المستقلين من حيث التغطية والدقة.

Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla2026-08-18
💻 computer science

Frequency and Edge-Guided Segment Anything Model for Remote Sensing Image Semantic Segmentation

تقترح هذه الورقة FE-SAM، وهو إطار عمل قابل للتوسع للتجزئة الدلالية لصور الاستشعار عن بعد يعمل على تعزيز نموذج "Segment Anything" من خلال تقديم مُكيِّف مُعدَّل بالتردد (Frequency-Modulated Adapter) لتفكيك الميزات الترددية تكيفيًا، ومُحسِّن حواف (EGRefiner) لدمج معلومات الحواف متعددة المقاييس، وذلك للتغلب على قيود تكييف الميزات وغموض الحدود لتحقيق أداء هو الأفضل في فئته.

Feng Gao, Zizhe Pan, Haoting Wang, Ruzhuang Hua, Jingchao Cao, Junyu Dong, Qian Du2026-08-18
💻 computer science

Do Visual Grounding Decoders Need Feed-Forward Networks? A Controlled Study over Frozen Vision-Language Features

تُظهر هذه الدراسة المنضبطة أن إزالة الشبكات التغذوية الأمامية من فكوك التشفير الخاصة بالتأسيس البصري يمكن أن تضاهي أو تتجاوز أداء البنيات القياسية مع تقليل عدد المعلمات القابلة للتدريب وزمن الاستجابة بشكل كبير، شريطة تعويض قدرة النموذج عن طريق زيادة عدد طبقات الانتباه فقط.

Tarun Tomar2026-08-18
💻 computer science

ProjFormer: Point Cloud Completion via Geometric-Projective Transformer and Cross-Modal Semantic Constraints

يُعد ProjFormer إطار عمل خفيف الوزن متعدد الوسائط لإكمال السحابة النقطية، يعالج الطبيعة غير محددة الحل لهذه المهمة من خلال فرض الاتساق الهندسي عبر الإسقاط الصريح وتوجيه الميزات التكيفي لدمج القيود الدلالية ثنائية الأبعاد مع صقل البنية ثلاثية الأبعاد بشكل فعال.

Sheng Liu, Meng Wang, Ruihui Li, Huilong Pi, Zhuo Tang, Kenli Li2026-08-18
🤖 AI

CETalk: Continuous Valence-Arousal Control for Audio-Driven 3D Talking Head Generation

تقدم هذه الورقة البحثية CETalk، وهو إطار عمل لتوليد الرؤوس المتحدثة ثلاثية الأبعاد المدفوعة بالصوت، والذي يستفيد من تمثيلات التكافؤ والاستثارة المستمرة وبنية نمذجة زمنية متعددة المقاييس لتحقيق تحكم عاطفي دقيق ومزامنة دقيقة لحركة الشفاه مع التغلب على قيود فئات العواطف المنفصلة.

Peng Jia, Li Dai, Zhen Xiao, Xueliang Liu, Jia Li2026-08-18