💻 computer science

Dynamic Resolution Routing for Efficient Egocentric Grounding

تقترح الورقة البحثية SmartRes، وهو إطار عمل لتوجيه الدقة الديناميكية يعمل على تحسين الكفاءة في عملية التأسيس البصري من منظور الشخص الأول (egocentric) عبر التنشيط الانتقائي للرقع عالية الدقة في المناطق المتمحورة حول الأجسام، مما يقلل بشكل كبير من الرموز البصرية ووقت الاستدلال مع الحفاظ على دقة عالية في تحديد مواقع الأجسام الصغيرة.

Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao2026-08-04
🤖 AI

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

يُعد StreamTalk إطار عمل في الوقت الفعلي وذو حلقة مغلقة لتوليد إيماءات مصاحبة للكلام، حيث يعمل على الحد من الانحراف طويل المدى عبر توظيف دورة (توليد-استرجاع-تحسين) مرتكزة على وضعيات مفتاحية معقولة وبنية محول انتشار (DiT) مدركة للأجزاء.

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi2026-08-04
🤖 machine learning

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

حقق فريق جامعة FAU المركز الثالث في اختبار الاختيار من متعدد البصري (Visual MCQ) والمركز الأول في الاختبار المفتوح البصري (Visual OpenQA) في مسابقة ImageCLEF 2026 من خلال إعطاء الأولوية لهندسة الاستدلال القوية — مثل التقييم المباشر للمرشحين، ودمج الدرجات، والتحكم الصارم في المخرجات — بدلاً من التدريب المتخصص للمهام لتعزيز الاستدلال البصري متعدد اللغات وتنسيق الإجابات.

Mohamed Basem, Vincent Christlein2026-08-04
💻 computer science

Generative AI and Foundation Models in Medical Image

تقدم هذه الورقة نظرة عامة على الذكاء الاصطناعي التوليدي والنماذج التأسيسية، بما في ذلك نماذج الانتشار والنماذج اللغوية الكبيرة، وتناقش بناءها، وتطبيقاتها في معالجة ودعم الصور الطبية، واستراتيجيات تطوير ذكاء اصطناعي عالي الأداء للرعاية الصحية باستخدام البيانات والموارد الحسابية الوطنية.

Masahiro Oda2026-08-04
🤖 AI

ARM: Detector-Agnostic Changepoint Attribution with Finite-Sample Error Control

تقدم الورقة البحثية إطار عمل ARM (العزو عن طريق القيم القصوى للرتب)، وهو إطار عمل غير مرتبط بكاشف محدد، يعمل على تحديد وتوثيق إحداثيات معينة مسؤولة عن نقطة تغير في السلاسل متعددة المتغيرات مع ضبط دقيق للخطأ في العينات المحدودة، بغض النظر عن دقة الكاشف المستخدم أو توزيع البيانات.

Chenchen Peng, Mixia Wu, Qijing Yan, Da Chen, Zhiqi Shen2026-08-04
🤖 AI

Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting

تقترح الورقة البحثية بنية "نقل تسلسل إزالة الضجيج متعدد الكيانات" (ME-DST)، وهي بنية مبتكرة تحافظ على بُعد اللاعب-الدور من خلال آليات انتباه زمنية ومكانية مُحللة لتحسين أداء رصد أفعال الكرة المتمحور حول اللاعب بشكل كبير في مجموعة بيانات FOOTPASS مقارنة بالنماذج المرجعية الحالية.

Ruifeng Wang, Di Yang, Jiangtao Wang2026-08-04
💻 computer science

UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization

يُعد UniSim-SLAM نظام SLAM بنظام التغذية الأمامية يجمع بين تتبع ثنائي المنظر خفيف الوزن وتحسين دوري للخرائط الفرعية متعددة المناظر، مستخدماً مخطط عامل $Sim(3)$ موحداً لتحسين الوضعيات العالمية ووضعيات الخرائط الفرعية بشكل مشترك، مما يحقق دقة تضاهي أحدث المعاياي ويقلل بشكل كبير من انزياح المسار في الإعدادات غير المعايرة.

Inha Lee, Dongjae Jeong, Junhee Lee, Kyungdon Joo2026-08-04
💻 computer science

STC-Net: Electroluminescence-Based Solar Cell Crack Segmentation for Power Loss Estimation

تقدم هذه الورقة البحثية STC-Net، وهو إطار عمل جديد للتعلم العميق يستفيد من الأولويات الحافية والطيفية جنباً إلى جنب مع وحدة تحسين حدود الطوبولوجيا لتقسيم الشقوق الرفيعة والمستطيلة في صور التألق الكهربائي بدقة، مما يتيح تقديراً موثوقاً لفقدان الطاقة في الخلايا الكهروضوئية.

Shanaka Ramesh Gunasekara, Akila Eranda Devanarayana, Imasha Guruge, Nuwantha Fernando, Ehsan Asadi2026-08-04
💻 computer science

G-Skin: Learning to Bind 3D Gaussians with Generative Visual Priors

يقترح G-Skin إطار عمل توليدي جديد لتغليف الأجسام يتغلب على ندرة مجموعات بيانات تجهيز نماذج Gaussian ثلاثية الأبعاد من خلال الاستفادة من نماذج الرؤية الأساسية ثنائية الأبعاد لاستخلاص أولويات الحركة في شكل توجيه زائف، مما يمكّن من تعلم أوزان تغليف سلسة ومتماسكة هيكلياً لتحريك أصول Gaussian ثلاثية الأبعاد بهياكل عظمية ذات طوبولوجيا عشوائية.

Yuxin Yao, Kendong Liu, Shiqi Zhou, Jiazhi Xia, Junhui Hou2026-08-04
💻 computer science

Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency

تقدم الورقة البحثية نموذج ReLIQS، وهو نموذج لتقييم جودة الصور بدون مرجع يعتمد على CLIP ومستقل عن الدقة، يتعلم بكفاءة تحديد المناطق البارزة وتجميع تضمينات الرقع متعددة الدقة لتحقيق تعميم فائق عبر مجموعات البيانات والتشوهات المتنوعة دون الحاجة إلى تغيير الحجم بشكل عدواني أو تكاليف حوسبة باهظة.

Hakan Emre Gedik, Shashank Gupta, Alan Bovik2026-08-04