🤖 machine learning

Tempora: Characterising the Time-Contingent Utility of Online Test-Time Adaptation

تقدم الورقة البحثية إطار عمل "Tempora"، الذي يقيم أساليب التكيف في وقت الاختبار تحت قيود زمنية واقعية من خلال قياس المقايضة بين الدقة وزمن الاستجابة، كاشفاً أن التصنيفات التقليدية للأداء غالباً ما تفشل في التنبؤ بالمنفعة في عمليات النشر الحساسة للوقت.

Sudarshan Sreeram, Young D. Kwon, Cecilia Mascolo2026-02-09
💻 computer science

EgoAVU: Egocentric Audio-Visual Understanding

تقدم الورقة البحثية EgoAVU، وهو محرك بيانات قابل للتوسع يقوم تلقائياً بتوليد سرد صوتي-بصري من منظور الشخص الأول عالي الجودة لإنشاء مجموعة بيانات EgoAVU-Instruct وEgoAVU-Bench، مما يثبت أن الضبط الدقيق للنماذج اللغوية الكبيرة متعددة الوسائط على هذه البيانات يحسن بشكل كبير قدرتها على الفهم المشترك للإشارات الصوتية والبصرية في مقاطع الفيديو من منظور الشخص الأول.

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vik (…)2026-02-09
💬 NLP

PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining

تقدم الورقة البحثية PhenoLIP، وهو إطار عمل جديد للتدريب المسبق للرؤية واللغة الطبية يستفيد من رسم بياني معرفي واسع النطاق متمحور حول الأنماط الظاهرية (PhenoKG) واستراتيجية تقطير معرفي موجهة من قبل معلم لتعزيز أداء التعرف على الأنماط الظاهرية والاسترجاع عبر الوسائط بشكل كبير مقارنة بالنماذج الحالية ذات الحالة الفنية المتطورة.

Cheng Liang, Chaoyi Wu, Weike Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie2026-02-09
💻 computer science

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

تقترح الورقة البحثية "التحسين المباشر للتفضيلات منزوع الانحياز" (DeDPO)، وهو إطار عمل شبه مُشرف يدمج تقنيات الاستدلال السببي لتصحيح الانحيازات المنهجية في التغذية الراجعة الاصطناعية للذكاء الاصطناعي، مما يمكّن نماذج الانتشار من تحقيق أداء محاذاة يضاهي أو يتجاوز التدريب المعتمد كلياً على التصنيف البشري مع خفض تكاليف البيانات بشكل كبير.

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih2026-02-09
🤖 AI

Accelerating Vision Transformers on Brain Processing Unit

تقترح هذه الورقة طريقة مبتكرة لتسريع نماذج "Vision Transformers" على وحدات معالجة الدماغ (BPUs) المُحسّنة للشبكات العصبية الالتفافية (CNN)، وذلك عن طريق إعادة هيكلة النموذج لاستبدال الطبقات الخطية بمعاملات التفافية، مما يتيح توريث الأوزان دون الحاجة لإعادة التدريب مع تحقيق تسريع كبير في الاستنتاج مع فقدان ضئيل في الدقة.

Jinchi Tang, Yan Guo2026-02-09
💻 computer science

FlowConsist: Make Your Flow Consistent with Real Trajectory

يُعد FlowConsist إطار تدريب مبتكر يعزز نماذج التدفق السريع عبر استبدال السرعات الشرطية بسرعات هامشية ذاتية التنبؤ وإدخال استراتيجية تقويم المسار للقضاء على الانحراف المنهجي وتراكم الأخطاء، مما يحقق توليد صور بخطوة واحدة وبأداء هو الأفضل حالياً بقيمة FID تبلغ 1.52 على مجموعة بيانات ImageNet 256×256.

Tianyi Zhang, Chengcheng Liu, Jinwei Chen, Chun-Le Guo, Chongyi Li, Ming-Ming Cheng, Bo Li, Peng-Tao Jiang2026-02-09
🤖 AI

Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion

تُعد Trifuse إطار عمل مبتكرًا قائمًا على آلية الانتباه، يعمل على تعزيز عملية تحديد عناصر واجهة المستخدم الرسومية (GUI grounding) دون الحاجة إلى ضبط دقيق خاص بالمهام، وذلك من خلال دمج آليات الانتباه، والنصوص المستخرجة من التعرف الضوئي على الحروف (OCR)، والتعليقات التوضيحية على مستوى الأيقونات عبر استراتيجية دمج "القمة الواحدة بالإجماع" (Consensus-SinglePeak) لتحقيق أداء قوي عبر مختلف الواجهات.

Longhui Ma, Di Zhao, Siwei Wang, Zhao Lv, Miao Wang2026-02-09
💻 computer science

POINTS-GUI-G: GUI-Grounding Journey

تقدم هذه الورقة نموذج POINTS-GUI-G-8B، وهو نموذج متطور لتحديد عناصر واجهة المستخدم الرسومية (GUI grounding) تم تدريبه من نموذج أساسي ذي وعي مكاني ضئيل عبر الاستفادة من هندسة بيانات دقيقة، واستراتيجيات تدريب محسنة، وتعلم تعزيزي بمكافآت قابلة للتحقق لتحقيق أداء فائق عبر معايير قياسية متعددة.

Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou2026-02-09
💻 computer science

Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors

تقدم هذه الورقة SemGeo-AttentionNet، وهي بنية ثنائية المسار تدمج الأولويات الدلالية القائمة على الانتشار والمشروطة هندسياً مع محولات السحابة النقطية لنمذجة الانتباه البصري البشري على الأسطح ثلاثية الأبعاد من خلال الصياغة الصريحة للتفاعل بين المعالجة الهندسية التصاعدية والتعرف الدلالي التنازلي.

Soham Pahari, Sandeep C. Kumain2026-02-09