🤖 AI

Adversarially Robust Abductive Fusion of Pre-trained Transformer-based Perception Models

تقترح هذه الورقة إطار عمل للدمج العصبي الرمزي خالٍ من المعرفة بالمجال، يستفيد من مجمعات ناقلات التسمية والاستنباط القائم على الاتساق لدمج كواشف "ViT" سابقة التدريب بشكل قوي، محققاً أداءً فائقاً على نماذج التصويت بالأغلبية المرجعية في ظل كل من التحولات التوزيعية والهجمات العدائية المنسقة.

Mario Leiva, Yue Ma, Qinru Qiu, Gerardo Simari, Paulo Shakarian2026-08-06
💻 computer science

PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images

يُعد PADFormer نهجاً جديداً وفعالاً في حيز الصورة للكشف عن الشذوذ غير المرتبط بالوضعية، حيث يستخدم محول رؤية (Vision Transformer) لإعادة بناء الصور الخالية من الشذوذ من مشاهد متفرقة عبر إعادة البناء المقنع عبر الرؤى والاستدلال التجميعي، محققاً أداءً رائداً دون الحاجة إلى إعادة بناء ثلاثية الأبعاد مكلفة حاسوبياً.

Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang2026-08-06
💻 computer science

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

يُعد OmniVR نموذجاً رائدًا لتوليد الصوت والفيديو بـ 22 مليار معلمة، يقوم بترميم الأفلام التاريخية المتدهورة عبر صياغة المهمة كعملية توليد شرطي ضمن نموذج محول انتشار متعدد الوسائط (DiT) موحد، حيث يعالج في آن واحد التدهور البصري والصوتي مع ضمان الاتساق بين الوسائط والتلوين الطبيعي.

Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha2026-08-06
💬 NLP

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

تقدم هذه الورقة البحثية SIGNPOST-Bench، وهو معيار مرجعي مضاد للواقع ومنضبط يتكون من 25,555 متغيراً صورياً لتقييم كيفية حل النماذج اللغوية الكبيرة متعددة الوسائط للتعارضات بين الإشارات البصرية والنصية، مما يكشف أن التدخلات النصية العدائية تضعف دقة تحديد الموقع الجغرافي بشكل كبير وتكشف عن سلوكيات تحكيم متميزة عبر 20 نموذجاً تم تقييمها.

Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang2026-08-06
💻 computer science

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

تقدم هذه الورقة CLIP-CC-Bench، وهو إطار تقييم مبتكر يتكون من مقاطع أفلام مدتها 90 ثانية مع أوصاف فقرات مكتوبة من قبل خبراء ومنهجية تجميع قوية قائمة على النماذج اللغوية الكبيرة لتقييم وتصنيف قدرات وصف الفيديو طويلة المدى لـ 17 نموذجاً من نماذج اللغة والفيديو المتطورة، مما يعالج الفجوة التي تركتها الاختبارات المرجعية الحالية المقتصرة على المقاطع القصيرة والأسئلة والأجوبة فقط.

Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack2026-08-06
📊 statistics

iStructTab: Structured Feature Sequencing for Multimodal Learning of Image and Tabular Data

تقدم الورقة البحثية iStructTab، وهو إطار عمل للتعلم متعدد الوسائط يستخدم تسلسل الواصفات المعزز بالرسوم البيانية (GEDS) لتحسين ترتيب الميزات عبر الرسوم البيانية للتشابه ويدمج هذا الهيكل في محول مدرك للترتيب، مما يؤدي إلى تقليل تشتت الميزات وتحسين الأداء التنبؤي بشكل كبير في معايير البيانات الصورية والجدولية.

Al Zadid Sultan Bin Habib, Md Younus Ahamed, Prashnna Gyawali, Gianfranco Doretto, Donald A. Adjeroh2026-08-06
💻 computer science

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

يُعد Poly-OPD إطار عمل للتقطير القائم على السياسة متعدد المعلمين غير المتجانس، والذي يدمج نقاط القوة المتكاملة من نماذج تحويل النص إلى صورة غير المتوافقة في نموذج طالب واحد مدمج يعتمد على مطابقة التدفق، وذلك عبر جسر الفضاءات الكامنة بواسطة إعادة الترميز على مستوى البكسل والإشراف باستخدام DINOv2، مع توظيف محولات متوافقة مع التدرج ومنهج تعليمي مدرك للفجوات لتحقيق أداء فائق في كل من اتباع التعليمات التركيبية والمواءمة الجمالية.

Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxua (…)2026-08-06
💻 computer science

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

إن ReGround هو إطار عمل ثنائي المراحل يستعيد التأسيس البصري في نماذج الرؤية واللغة أثناء الاستدلال متعدد الخطوات من خلال تعليمها كيفية التشخيص الذاتي ذاتياً لإخفاقات التأسيس وإعادة فحص الأدلة البصرية بشكل انتقائي، محققاً مكاسب كبيرة في الأداء دون تعديلات هيكلية أو أدوات خارجية.

Lei Peng, Shuai Lv, Wei Hu2026-08-06
💻 computer science

Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

يُعد Faster-WAM نموذجاً فعالاً لنمذجة أفعال العالم (World Action Model) يحل التوازن بين سرعة الاستدلال والمتانة من خلال تقديم إطار عمل للشرط المستقبلي المتناثر، والذي يعيد استخدام التمثيلات المستقبلية المحسوبة مسبقاً بشكل انتقائي لتحقيق أداء رائد وسرعة استدلال أكبر بكثير مقارنة بالطرق الحالية.

Weiheng Zhao, Haoyi Jiang, Xin Shi, Liu Liu, Fan Huang, Zhizhong Su, Wei Sui, Xinggang Wang2026-08-06
💻 computer science

Foreseeing the Invisible: Amodal Reconstruction of Leaf Fossil Images

تقدم هذه الورقة البحثية AmodalDINO، وهو نموذج تنبؤ كثيف متعدد الرؤوس يعيد بناء أحافير الأوراق الكاملة من صور جزئية دون الحاجة إلى أقنعة مرئية مسبقة، محققاً دقة عالية من خلال نموذج DINOv3 المضبط بدقة ورؤوس تعرق مساعدة، مع تمكين النشر العملي دون اتصال بالإنترنت وتقدير مساحة السطح.

Liuxiang Yue, Ailin Zhang, Ziyue Zhao, Yikun Duan2026-08-06