💻 computer science

LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution

تقدم هذه الورقة LinearSR، وهو إطار عمل شامل يتيح رفع دقة الصور الواقعية بشكل مستقر وفعال من خلال التغلب على عدم استقرار التدريب التاريخي للانتباه الخطي ومقايضة الإدراك والتشويه عبر استراتيجيات مبتكرة مثل ESGF وSNR-based MoE وTAG، محققاً جودة رائدة عالمياً مع كفاءة حوسبية استثنائية.

Xiaohui Li, Shaobin Zhuang, Shuo Cao, Yang Yang, Yuandong Pu, Qi Qin, Siqi Luo, Bin Fu, Yihao Liu2026-03-03
💬 NLP

BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models

تقدم هذه الورقة BioCAP، وهو نموذج تأسيسي بيولوجي يستفيد من التعليقات التوضيحية الاصطناعية المخصصة لكل حالة والتي تم إنشاؤها بواسطة نماذج لغوية كبيرة متعددة الوسائط لتعزيز تصنيف الأنواع واسترجاع النصوص والصور من خلال التقاط سمات دلالية غنية تتجاوز مجرد الملصقات البسيطة.

Ziheng Zhang, Xinyue Ma, Arpita Chowdhury, Elizabeth G. Campolongo, Matthew J. Thompson, Net Zhang, Samuel Stevens, Hilm (…)2026-03-03
💻 computer science

Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations

يُعد Concerto إطار عمل للتعلم الذاتي الإشراف المينيمالي الذي يجمع بشكل تآزري بين التضمين المشترك ثنائي الأبعاد وثلاثي الأبعاد والتقطير الذاتي داخل النمط ثلاثي الأبعاد لإنتاج تمثيلات مكانية فائقة، محققاً أداءً هو الأفضل في فئته في إدراك المشاهد ثلاثية الأبعاد وممكناً الإدراك في العالم المفتوح من خلال المحاذاة اللغوية.

Yujia Zhang, Xiaoyang Wu, Yixing Lao, Chengyao Wang, Zhuotao Tian, Naiyan Wang, Hengshuang Zhao2026-03-03
🤖 AI

Near--Real-Time Conflict-Related Fire Detection in Sudan Using Unsupervised Deep Learning

تقدم هذه الدراسة نموذج مشفر تلقائي تبايني (VAE) خفيف الوزن وغير خاضع للإشراف، يستخدم صوراً من مختبرات كوكب الأرض (Planet Labs) بدقة 3 أمتار و4 نطاقات، للكشف عن الحرائق المرتبطة بالنزاعات في السودان خلال 24 إلى 30 ساعة، مما يظهر أداءً متفوقاً في درجات الاستدعاء ومقاييس F1 مقارنة بطرق كشف التغيير التقليدية للمراقبة في الوقت الفعلي للناطق الساخنة.

Kuldip Singh Atwal, Dieter Pfoser, Daniel Rothbart2026-03-03
💻 computer science

Family Matters: A Systematic Study of Spatial vs. Frequency Masking for Continual Test-Time Adaptation

تقدم هذه الورقة دراسة منهجية تعزل تأثير عائلات القناع في التكيف المستمر أثناء وقت الاختبار، كاشفةً أن القناع المكاني يتفوق عموماً على قناع التردد في البنيات القائمة على ترميز الرقع (patch-tokenized)، وذلك من خلال الحفاظ على التماسك الهيكلي، بينما يعتمد الخيار الأمثل في نهاية المطاف على التوافق بين البنية المحددة والمهمة.

Chandler Timm C. Doloriel, Yunbei Zhang, Yeonguk Yu, Taki Hasan Rafi, Muhammad salman siddiqui, Tor Kristian Stevik, Hab (…)2026-03-03
💻 computer science

ββ-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment

تقدم هذه الورقة β\beta-CLIP، وهو إطار عمل للتعلم التبايني المشروط بالنص متعدد الحبيبات يستخدم الانتباه المتقاطع وفقدان محاذاة تبايني سياقي-β\beta مبتكر لتحقيق أفضل النتائج في المحاذاة الكثيفة بين الرؤية واللغة من خلال مطابقة الأوصاف النصية ذات الأطوال المتفاوتة هرميًا مع المناطق المرئية المقابلة لها.

Fatimah Zohra, Chen Zhao, Hani Itani, Bernard Ghanem2026-03-03
💻 computer science

CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives

تُعد CRISP طريقة مبتكرة تستعيد حركة البشر وهندسة المشهد ذات المنطق الفيزيائي والجاهزة للمحاكاة من فيديو أحادي العدسة، وذلك عبر ملاءمة بدائيات مستوية لسحب النقاط، والاستفادة من نمذجة التلامس للمناطق المحجوبة، والتحقق من التفاعلات عبر التعلم المعزز، مما يقلل بشكل كبير من إخفاقات تتبع الحركة ويسرع تطبيقات التحويل من الواقع إلى المحاكاة.

Zihan Wang, Jiashun Wang, Jeff Tan, Yiwen Zhao, Jessica Hodgins, Shubham Tulsiani, Deva Ramanan2026-03-03
🤖 AI

AI-Powered Dermatological Diagnosis: From Interpretable Models to Clinical Implementation A Comprehensive Framework for Accessible and Trustworthy Skin Disease Detection

يقترح هذا البحث إطار عمل شامل وقابل للتفسير للذكاء الاصطنا- متعدد الوسائط يدمج تحليل الصور باستخدام التعلم العميق مع بيانات التاريخ العائلي لتعزيز دقة وتشخيص الأمراض الجلدية وتخصيصه، مع خطط لإجراء تجارب سريرية استباقية للتحقق من تنفيذه في العالم الحقيقي.

Satya Narayana Panda, Vaishnavi Kukkala, Spandana Iyer2026-03-03
🤖 AI

TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models

يُعد TP-Blend إطار عمل خفيف الوزن ولا يتطلب تدريباً، يحقق دمجاً دقيقاً لأسلوب الكائنات في نماذج الانتشار من خلال الجمع بين دمج كائن الانتباه المتقاطع لإعادة تعيين الميزات المدركة مكانياً، ودمج أسلوب الانتباه الذاتي لتعديل التفاصيل الحساسة للقوام، مما يتيح استبدال الكائنات ونقل الأسلوب بدقة عالية في آن واحد.

Xin Jin, Yichuan Zhong, Yapeng Tian2026-03-03