🔬 physics

Three-Photon Bayesian Imaging of Ortho-Positronium

تقترح هذه الورقة البحثية خوارزمية TRIO، وهي خوارزمية بايزية جديدة لتقدير الاحتمال الأقصى اللاحق توحد بين الزمان والطاقة والبوادر المستندة إلى الفيزياء في الكهروديناميكا الكمية (QED) لإعادة بناء أحداث إفناء "أورثو-بوزيترونيوم" ثلاثية الفوتونات، مما يحقق تحسناً كبيراً في الدقة المكانية يتوافق مع ماسحات PET القياسية التي تعتمد على زمن الطيران (TOF-PET) والنظائر المشعة مثل 18F.

L. Raczynski, W. Krzemien, A. Coussat, M. Bala, B. C. Hiesmayr, K. Klimaszewski, M. Obara, R. Y. Shopa2026-07-31
🤖 machine learning

DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement

تقترح الورقة البحثية إطار عمل DAS-PMVC، وهو إطار عمل مبتكر للتجميع متعدد الرؤى الجزئي يعالج عدم محاذاة وعدم تماثل الرؤى من خلال عملية ثلاثية المراحل تتضمن محاذاة بنية الرسم البياني للمرساة، وتعلم الميزات المعزز بالبنية، واستراتيجية محاذاة مزدوجة تجمع بين التعلم التبايني وخوارزمية هانغاريان لتحقيق أداء تجميع فائق.

Shubin Ma, Liang Zhao, Chuanye He, Zhenjiao Liu, Liang Zou, Lin Yuanbo Wu, Yu Shao2026-07-31
🤖 machine learning

DS@GT ARC at ImageCLEFmedical 2026: Architectural Diversity for Concept Detection and Foundation-Model Scaling for Caption Prediction in Medical Image Analysis

حقق فريق DS@GT المركز الأول في مهمة كشف المفاهيم ضمن مسابقة ImageCLEFmedical 2026 باستخدام نموذج تجميع دمج متأخر متنوع مع ضبط عتبة صادق، بينما أثبت أيضاً أن خط معالجة استرجاع KNN الخالي من التدريب يمكنه مضاهاة أداء الضبط الدقيق بجزء بسيط من التكلفة، إلى جانب مشاركات متنوعة في وصف الصور تشمل أحجاماً مختلفة من النماذج.

Bowen Wang, Youwen Zhang, Ritesh Mehta2026-07-31
💻 computer science

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

تقدم هذه الورقة CXR-Retrieve، وهو معيار هيكلي وطريقة ضبط دقيق تبايني مدركة للعلامات تحسن بشكل كبير عملية استرجاع الصور من النصوص في التصوير الشعاعي للصدر من خلال ضمان استيفاء الصور المسترجعة للقيود السريرية المعقدة، بما في ذلك العطف والنفي، بدلاً من مجرد مطابقة الكلمات المفتاحية.

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin2026-07-31
💻 computer science

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

تقدم هذه الورقة البحثية LoMeVQA، وهو معيار شامل يتكون من 206 ألف زوج من أزواج الأسئلة والأجوبة المرئية الطبية الطولية المصممة لتقييم الاستدلال الزمني في النماذج متعددة الوسائط، إلى جانب نموذج MedLong-8B المقترح الذي يحقق أداءً هو الأفضل في مجاله على هذه المهام.

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He2026-07-31
💻 computer science

SPFM-Net: Semantic-Prior-Guided Frequency-Constrained Mamba for Invisible Watermark Attack

تقترح هذه الورقة البحثية إطار عمل SPFM-Net، وهو إطار عمل "مامبا" (Mamba) موجه بالأولويات الدلالية ومقيد بالتردد، والذي يهاجم العلامات المائية غير المرئية بفعالية من خلال الجمع بين القناع عالي النسبة، ومشفر تلقائي مقنع مضبوط بدقة، ووحدة نمذجة حالة مكانية عالمية لتحقيق توازن متفوق بين فعالية الإزالة والدقة البصرية.

Chunpeng Wang, Yanan Shi, Zhiqiu Xia, Jidong Yang, Suo Gao, Qi Li2026-07-31
💻 computer science

SAFViT: Spatial Attention Fusion Gating for Vision Transformer-Based Nucleus Segmentation and Classification

تقدم هذه الورقة البحثية نموذج SAFViT، وهو نموذج قائم على "Vision Transformer" لتجزئة وتصنيف النواة، والذي يستبدل وصلات التخطي القياسية بوحدة "Spatial Attention Fusion Gating" مبتكرة لوزن ميزات المشفر وفك التشفير ديناميكيًا، مما يحسن بشكل كبير جودة البانوبتيك متعدد الفئات والكشف عن الفئات الأقلية في مجموعتي بيانات PanNuke وMoNuSeg.

Harshit Mittal, Arash Rabbani2026-07-31
💻 computer science

Learning to Understand Body Language from Flight through Robust 3D Avatar Placing

تقدم هذه الورقة البحثية Drones2BodyLanguage، وهي مجموعة بيانات مبتكرة تم إنشاؤها عبر وضع نماذج ثلاثية الأبعاد (avatars) ذات نوايا تواصلية بشكل قوي داخل لقطات طائرات بدون طيار حقيقية باستخدام نموذج عالم هندسي خفيف الوزن، مما يحسن بشكل كبير من قدرة الروبوتات الجوية على تعلم وفهم لغة جسد الإنسان ونواياه من فيديوهات الطائرات بدون طيار بعيدة المدى.

Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu2026-07-31
💻 computer science

Unifying Adversarially Robust Model Experts in Vision-Language Models

تقترح هذه الورقة إطار عمل CARE، وهو إطار للضبط الدقيق التنافسي التعاوني يوحد نماذج خبيرة متعددة متخصصة في المتانة من خلال التناغم في فضاء التضمين لإنشاء نموذج واحد للرؤية واللغة يتمتع بمتانة تنافسية فائقة ومتكاملة عبر إعدادات تقييم متنوعة.

Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong2026-07-31
💻 computer science

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

تقترح هذه الورقة إطار عمل SPaTS، وهو إطار عمل مُحسَّن بالتعزيز يعمل على تحسين رصد النصوص في المشاهد ضمن نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) عن طريق توجيه كل مثيل نصي عبر رمز مرئي مرساة واحد يتم اختياره عبر SPaSO ويتم صقله باستخدام محاذاة التضمين الاتجاهي وفك التشفير المعزز بالرقع لتحقيق دقة فائقة مقارنة بالطرق الحالية.

Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin2026-07-31