💻 computer science

Pay Attention to Where You Looked

تتناول هذه الورقة البحثية الأداء دون الأمثل لطرق تخليق المشاهد الجديدة ذات العينات القليلة من خلال تقديم آلية لوزن الكاميرا تعمل على ضبط أهمية المشاهد المصدر ديناميكياً بناءً على صلتها الهندسية أو المتعلمة بالمشهد المستهدف، مما يعزز بشكل كبير دقة التخليق وواقعيته.

Alex Berian, JhihYang Wu, Daniel Brignac, Natnael Daba, Abhijit Mahalanobis2026-02-26
💻 computer science

Rectifying Geometry-Induced Similarity Distortions for Real-World Aerial-Ground Person Re-Identification

تقترح هذه الورقة إطار عمل مبتكر لإعادة تحديد هوية الأشخاص بين الجو والأرض يعالج فشل مقاييس التشابه القياسية في ظل التباينات الشديدة في زوايا الرؤية من خلال تقديم وحدة تحويل "الاستعلام-المفتاح" المستحثة هندسياً (GIQT) خفيفة الوزن لتصحيح التشوهات الهندسية صراحةً في فضاء التشابه، مكمّلة بتوليد مطالبات مشروطة هندسياً لضمان مطابقة قوية عبر الرؤى المختلفة.

Kailash A. Hambarde, Hugo Proença2026-02-26
🤖 AI

TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

تقدم الورقة البحثية TimeBlind، وهو معيار تشخيصي يستخدم نموذج الأزواج الدنيا للكشف عن أن حتى النماذج اللغوية الكبيرة متعددة الوسائط المتطورة تعاني في التفكير المكاني الزماني التركيبي دقيق التفاصيل، وغالباً ما تعتمد على اختصارات بصرية ثابتة بدلاً من المنطق الزماني الحقيقي.

Baiqi Li, Kangyi Zhao, Ce Zhang, Chancharik Mitra, Jean de Dieu Nyandwi, Gedas Bertasius2026-02-26
⚡ electrical engineering

Beyond Calibration: Confounding Pathology Limits Foundation Model Specificity in Abdominal Trauma CT

تكشف هذه الدراسة أنه في حين تحقق النماذج التأسيسية قدرة على التمييز تضاهي النماذج المتخصصة في مهام محددة للكشف عن إصابات الأمعاء الرضحية في الأشعة المقطعية للبطن، إلا أن فائدتها السريرية محدودة بشكل كبير بسبب قابليتها لعجز في النوعية ناتج عن عدم تجانس الفئة السلبية المربكة، لا سيما عند وجود إصابات متزامنة في الأعضاء الصلبة.

Jineel H Raythatha, Shuchang Ye, Jeremy Hsu, Jinman Kim2026-02-26
🤖 machine learning

Extracting and Analyzing Rail Crossing Behavior Signatures from Videos using Tensor Methods

تقترح هذه الورقة إطار عمل لتفكيك الموتر متعدد الرؤى يحلل تضمينات (TimeSformer) لمقاطع فيديو معابر السكك الحديدية لتحديد البصمات السلوكية الكامنة، مما يكشف أن الموقع هو محدد أقوى لأنماط سلوك السائقين من وقت اليوم، ويُمكّن من تدخلات سلامة مستهدفة وقابلة للتوسع.

Dawon Ahn, Het Patel, Aemal Khattak, Jia Chen, Evangelos E. Papalexakis2026-02-26
💻 computer science

Exploiting Label-Independent Regularization from Spatial Dependencies for Whole Slide Image Analysis

تقترح هذه الورقة إطار عمل لتعلم الحالات المتعددة (Multiple Instance Learning) منظماً مكانياً، يستفيد من التبعيات المكانية المتأصلة بين سمات الرقع (patch features) كنوع من التنظيم المستقل عن الملصقات (label-independent regularization) للتغلب على تحديات ندرة التوصيفات وعدم استقرار التحسين في تحليل صور الشرائح الكاملة (Whole Slide Image)، محققاً تحسينات كبيرة في الأداء على مجموعات بيانات عامة متعددة.

Weiyi Wu, Xinwen Xu, Chongyang Gao, Xingjian Diao, Siting Li, Jiang Gui2026-02-26
🤖 AI

Scaling View Synthesis Transformers

تقدم هذه الورقة نموذج توليف الرؤية القابل للتوسع (SVSM)، وهو بنية محول من نوع المشفر-المفكك، تضع قوانين قياس جديدة لتوليف الرؤية الخالي من الهندسة، مما يظهر كفاءة حوسبية فائقة وأداءً هو الأفضل في فئته مقارنة بالنهج السابقة التي تعتمد على فك التشفير فقط.

Evan Kim, Hyunwoo Ryu, Thomas W. Mitchel, Vincent Sitzmann2026-02-26
💻 computer science

Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation

تقدم هذه الورقة إطار عمل لتقسيم الأفعال الزمنية بنظام الصفر المعرفة، مفتوح المفردات، وغير معتمد على التدريب، يستفيد من قدرات نماذج الرؤية واللغة المتنوعة لتقسيم أفعال الفيديو دون إشراف خاص بالمهمة، مما يظهر إمكاناتها القوية للفهم الزمني المهيكل.

Asim Unmesh, Kaki Ramesh, Mayank Patel, Rahul Jain, Karthik Ramani2026-02-26
💻 computer science

WildSVG: Towards Reliable SVG Generation Under Real-Word Conditions

تقدم هذه الورقة البحثية معيار WildSVG، الذي يضم مجموعات بيانات واقعية واصطناعية، لمعالجة نقص موارد التقييم لاستخراج رسومات SVG، وتكشف أنه في حين تعاني النماذج متعددة الوسائط الحالية مع الصور الطبيعية المشوشة، فإن طرق التحسين التكراري تقدم مساراً واعداً نحو أداء موثوق.

Marco Terral, Haotian Zhang, Tianyang Zhang, Meng Lin, Xiaoqing Xie, Haoran Dai, Darsh Kaushik, Pai Peng, Nicklas Scharp (…)2026-02-26
🤖 AI

Causal Decoding for Hallucination-Resistant Multimodal Large Language Models

تقترح هذه الورقة إطار عمل للفك المسبب (causal decoding) يتدخل أثناء عملية التوليد لتخفيف الاعتمادات الزائفة، مما يقلل بفعالية من هلاوس الكائنات في النماذج اللغوية الكبيرة متعددة الوسائط مع الحفاظ على جودة وصفية عالية وتحقيق أعلى مستويات الأمانة (state-of-the-art faithfulness).

Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang2026-02-26