🤖 machine learning

ReDepth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

يُعد Re-Depth Anything إطار عمل للتعلم الذاتي في وقت الاختبار يعمل على تعزيز تقدير العمق أحادي العين من خلال دمج النماذج التأسيسية مع نماذج الانتشار ثنائية الأبعاد واسعة النطاق لإجراء تحسين خالٍ من الملصقات عبر إعادة الإضاءة التوليدية وأخذ عينات تشتت الدرجة، محققاً بذلك نتائج رائدة دون تحسين مباشر لموتر العمق.

Ananta R. Bhattarai, Helge Rhodin2026-03-10
💻 computer science

VOIC: Visible-Occluded Integrated Guidance for 3D Semantic Scene Completion

تقدم هذه الورقة البحثية VOIC، وهو إطار عمل ثنائي فك التشفير مبتكر لإكمال المشهد الدلالي ثلاثي الأبعاد أحادي العدسة، والذي يستخدم استراتيجية استخراج تسمية المنطقة المرئية لفصل إدراك المنطقة المرئية عن استنتاج المنطقة المحجوبة، مما يؤدي إلى تخفيف تخفيف الميزات وتحقيق أداء رائد في المعايير القياسية.

Zaidao Han, Risa Higashita, Jiang Liu2026-03-10
🔬 physics

Efficient Vision Mamba for MRI Super-Resolution via Hybrid Selective Scanning

تقترح هذه الورقة البحثية "Efficient Vision Mamba"، وهو إطار عمل للتعلم العميق خفيف الحوسبة يجمع بين نماذج الحالة الفراغية الانتقائية متعددة الرؤوس والمسح الهجين لتحقيق أداء رائد في دقة تصوير الرنين المغناطيسي الفائقة مع تقليل المعلمات والحوسبة بشكل جذري مقارنة بالطرق الحالية.

Mojtaba Safari, Shansong Wang, Vanessa L Wildman, Mingzhe Hu, Zach Eidex, Chih-Wei Chang, Erik H Middlebrooks, Richard L (…)2026-03-10
💻 computer science

FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving

يُعد FLARE إطار عمل مبتكر يُمكّن القيادة الذاتية من خلال الاستفادة من نماذج الرؤية واللغة سابقة التدريب عبر هدف تنبؤ ميزات مستقبلية ذاتي الإشراف وتحسين السياسة النسبي الجماعي، محققاً أداءً هو الأفضل في فئته على مقيść NAVSIM دون الحاجة إلى تعليقات لغوية كثيفة العمالة.

Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li2026-03-10
💻 computer science

Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging

يقدم البحث إطار العمل R4R^4، وهو إطار عمل وكيل ذاتي التحسين يعزز تحليل الصور الطبية من خلال تفكيك سير العمل إلى مراحل التوجيه، والاسترجاع، والتأمل، والإصلاح لتنقيح كل من التقارير النصية وصناديق الإحاطة المكانية بشكل تكراري، محققاً مكاسب أداء كبيرة مقارنة بالنماذج الأساسية للنماذج اللغوية البصرية (VLM) ذات الممر الواحد دون الحاجة إلى الضبط الدقيق القائم على التدرج.

Md. Faiyaz Abdullah Sayeedi, Rashedur Rahman, Siam Tahsin Bhuiyan, Sefatul Wasi, Ashraful Islam, Saadia Binte Alam, AKM (…)2026-03-10
💻 computer science

The Algorithmic Gaze of Image Quality Assessment: An Audit and Trace Ethnography of the LAION-Aesthetics Predictor

تُدقق هذه الورقة في "متنبئ لايون للجماليات" (LAION-Aesthetics Predictor) لتكشف كيف تعزز نظرته الخوارزمية الانحيازات الغربية والذكورية والإمبريالية من خلال تصفية المحتوى بشكل غير متناسب وإعطاء الأولوية لجماليات ثقافية محددة، داعيةً في نهاية المطاف إلى التحول نحو أساليب تقييم تعددية في تطوير الذكاء الاصطناعي.

Jordan Taylor, William Agnew, Maarten Sap, Sarah E. Fox, Haiyi Zhu2026-03-10
💻 computer science

S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation

تقدم الورقة البحثية S2DiT، وهو نموذج "Streaming Sandwich Diffusion Transformer" مبتكر يستفيد من آليات الانتباه الفعالة، وبنية "الساندوتش" المدركة للميزانية، وإطار عمل تقطير "2 في 1" لتحقيق توليد فيديو عالي الدقة وفي الوقت الفعلي على الأجهزة المحمولة بأداء يضاهي النماذج المخصصة للخوادم.

Lin Zhao, Yushu Wu, Aleksei Lebedev, Dishani Lahiri, Meng Dong, Arpit Sahni, Michael Vasilkovsky, Hao Chen, Ju Hu, Aliak (…)2026-03-10
💻 computer science

Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering

تقترح هذه الورقة البحثية QSTar، وهي طريقة تفاعل مكاني-زماني-ترددي جديدة موجهة بالاستعلام ومعززة بكتلة استدلال سياق الاستعلام، والتي تعمل على تحسين أداء الإجابة على الأسئلة السمعية البصرية بشكل كبير من خلال الدمج العميق بين الأدلة الموجهة بالاستعلام وخصائص التردد الصوتي مع الإدراك البصري، متفوقة بذلك على الأساليب متعددة الوسائط الحالية في العديد من المعايركات.

Kun Li, Michael Ying Yang, Sami Sebastian Brandt2026-03-10
🤖 machine learning

MeanCache: From Instantaneous to Average Velocity for Accelerating Flow Matching Inference

يعد MeanCache إطار عمل لا يتطلب تدريباً يعمل على تسريع استنتاج مطابقة التدفق (Flow Matching) عبر استبدال تخزين السرعة اللحظية بنهج متوسط السرعة باستخدام حاصل ضرب جاكوبي-متجه مخزن واستراتيجية جدولة استقرار المسار، محققاً تسريعاً كبيراً (يصل إلى 4.56 ضعفاً) مع الحفاظ على جودة توليد عالية عبر نماذج مثل FLUX.1 وHunyuanVideo.

Huanlin Gao, Ping Chen, Fuyuan Shi, Ruijia Wu, Li YanTao, Qiang Hui, Yuren You, Ting Lu, Chao Tan, Shaoan Zhao, Zhaoxian (…)2026-03-10
💻 computer science

PhysDrape: Learning Explicit Forces and Collision Constraints for Physically Realistic Garment Draping

يُعد PhysDrape حلاً هجيناً يجمع بين الشبكات العصبية والفيزيائية، حيث يدمج شبكة عصبية رسومية مستوحاة من الفيزياء مع نظام تفاضلي لإسقاط القوة والتصادم على مرحلتين، وذلك لتحقيق ثني ملابس واقعي فيزيائياً مع تداخل ضئيل جداً ودقة فائقة مقارنة بالأساليب الحالية القائمة على التعلم العميق.

Minghai Chen, Mingyuan Liu, Ning Ma, Jianqing Li, Yuxiang Huan2026-03-10