💻 computer science

SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

تقدم الورقة البحثية SEER، وهي واجهة استدلال وقت التشغيل خالية من التدريب لنماذج الرؤية واللغة المجمدة، والتي تعمل على تحسين تصنيف العلاقات المكانية من خلال بناء رؤى أدلة محددة للاستعلام مع أدوار صريحة للموضوع/المفعول به وسياق هندسي تكميلي، مما يقلل بشكل كبير من الأخطاء الناجمة عن الرؤى العالمية الغامضة أو الاختيار غير الصحيح للنماذج.

Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng2026-08-05
💻 computer science

When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware

تُثبت هذه الورقة أن تقليل الرموز المرئية لا يؤدي تلقائياً إلى تسريع الاستدلال متعدد الوسائط، حيث كشفت من خلال تحليل نقطة التعادل القابل لإعادة الإنتاج أن التوجيه قبل الرؤية (pre-vision routing) يتفوق على التقليم بعد الرؤية (post-vision pruning) على وحدات معالجة الرسومات مثل A100 عبر تجنب أعباء المعالجة المسبقة والترميز، على الرغم من تحقيقه لتقليل أصغر في الرموز اللاحقة.

Hao Dou, Ruiwen Tian2026-08-05
💻 computer science

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

تقدم هذه الورقة معياراً يوضح أن النماذج اللغوية الكبيرة متعددة الوسائط تظهر انحيازاً قوياً لإكمال الأنماط عند تحويل لقطات شاشة صفحات الويب إلى كود برمجي، حيث تقوم غالباً باستبدال العناصر المشوهة بصرياً بأنماط واجهة مستخدم متكررة حتى عندما تمتلك القدرة الاستدلالية لتحديد تلك الشذوذات.

Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo2026-08-05
⚡ electrical engineering

Unsupervised Adversarial Domain Adaptation for Uterine layer Segmentation: From Labeled Cine to Unlabeled Dynamic EPI MRI

تقدم هذه الورقة إطار عمل للتكيف النطاقي التنافسي غير الخاضع للإشراف ينقل معرفة التجزئة من صور الرنين المغناطيسي السينمائي (cine MRI) المسمّاة إلى صور الرنين المغناطيسي الديناميكي (EPI MRI) غير المسمّاة عند شدة مجال 0.55 تسلا، مما يتيح التوصيف المتزامن للحركة الدودية للرحم وتغيرات الأكسجة المعتمدة على الزمن لـ T2* لتوف الله رؤى جديدة حول التفاعل بين انقباض الرحم وخصائص الأنسجة.

Smiti Tripathy, Milauni Desai, Jordina Aviles Verdera, Jana Hutter2026-08-05
💻 computer science

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

يُعد TDVR إطار عمل للربط البصري ثلاثي الأبعاد يعتمد على التعلم الصفري ولا يتطلب تدريبًا، حيث يستفيد من إزالة الغموض النصي المدفوع بالنماذج اللغوية الكبيرة واستدلال سلسلة الأفك "chain-of-thought" لاستنتاج زوايا النظر المثلى والتمييز بين الأشياء المتشابهة، محققًا أداءً هو الأفضل في فئته على مجموعة بيانات ScanRefer من خلال التفوق بشكل كبير على الأساليب الحالية في التعامل مع الاستعلامات الغامضة وزوايا النظر الناقصة.

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu2026-08-05
💻 computer science

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

يُعد OmniPack إطار عمل لا يتطلب تدريباً يعمل على تعزيز كفاءة النماذج اللغوية الكبيرة متعددة الوسائط من خلال الجمع بين إزالة الفائض الهيكلي قبل مرحلة النموذج اللغوي الكبير وبين الصقل الدلالي بعد التفاعل، محققاً بذلك توازنات فائقة بين الأداء والكفاءة عبر معايير متعددة مع تقليل التكاليف الحسابية بشكل كبير.

Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang (…)2026-08-05
💻 computer science

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

تقترح هذه الورقة البحثية "UHP Detection"، وهو إطار عمل جديد بنظام الصندوق الأسود (black-box) يعمل على نمذجة الهلوسة كأنماط عدم يقين مهيكلة عبر أربع مجموعات اتساق محددة بنمط الاضطراب والقطبية المنطقية، متفوقاً بشكل ملحوظ على الأساليب الحالية من خلال التقاط سلوكيات هلوسة فريدة وقابلة للتعميم في النماذج اللغوية البصرية الضخمة.

Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi (…)2026-08-05
💻 computer science

FlowForm: Synergizing Fluid Physics with Topological Consistency for Satellite Flood Synthesis

يُعد FlowForm إطار عمل مبتكر لتخليق صور الأقمار الصناعية للفيضانات عالية الجودة، حيث يجمع بين التنظيم الكامن المستوحى من معادلات المياه الضحلة والاشتراط الواعي بالبنية للتغلب على ندرة البيانات وتوليد مشاهد فيضانات منطقية فيزيائياً ومتسقة طوبولوجياً.

Zhang Weihui, Wang Ruizhi, Xu Hongye, Wang Huiqiong, Sun Li, Song Mingli2026-08-05
🤖 machine learning

Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

تقدم هذه الورقة GeoMEB، وهو معيار مرجعي واسع النطاق يضم 45 مهمة تقييم حضرية، وGeo-Embed، وهو نموذج تضمين متعدد الوسائط موحد يتفوق بشكل كبير على النماذج المرجعية الحالية من خلال التعامل بفعالية مع المدخلات الجيومكانية غير المتجانسة مثل الصور، والنصوص، والمناطق، والتغيرات الزمنية.

Jiapeng Li, Yong Li, Junjie Zhou, Fan Zhang, Yu Liu2026-08-05
💻 computer science

MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization

يُعد MuRA إطار عمل جديدًا للتكيف في وقت الاختبار يتغلب على قيود تكوينات الرتب الثابتة في نماذج الرؤية واللغة من خلال الاختيار الديناميكي ودمج وحدات متعددة الرتب بناءً على التعقيد البصري على مستوى الرمز، مما يحقق تعميماً فائقاً مع تقليل العبء الحسابي.

Gengyuan Liu, Nanzhou Wang, Chang Liu, Qinwen Wu, Zhenhao Wang, Jiacong Wang, Bokui Chen, Xiangyang Ji2026-08-05