🤖 machine learning

Revisiting Transformers with Insights from Image Filtering and Boosting

تقترح هذه الورقة إطاراً موحداً لمعالجة الصور لتوفير تفسير ميكانيكي لمكونات الـ Transformer — مثل الانتباه الذاتي، والترميز الموضعي، والاتصالات المتبقية — مع تقديم تعديلات هيكلية جديدة تعمل على تحسين الدقة، والمتانة، وفهم المتواليات الطويلة عبر مهام الرؤية واللغة.

Laziz U. Abdullaev, Maksim Tkachenko, Tan M. Nguyen2026-02-10
🤖 machine learning

Topological Signatures vs. Gradient Histograms: A Comparative Study for Medical Image Classification

تقارن هذه الدراسة بين "مخطط تدرجات الاتجاهات" (HOG) و"تحليل البيانات الطوبولوجية" (TDA) لتصنيف صور قاع العين، حيث وجدت أنه بينما يقدم كلا أسلوبي استخراج الميزات أداءً متشابهاً باستخدام خوارزمية (XGBoost)، إلا أنهما يوفران تمثيلات هيكلية متكاملة للكشف عن اعتلال الشبكية السكري وتصنيفه.

Faisal Ahmed2026-02-10
🤖 machine learning

A-FloPS: Accelerating Diffusion Models via Adaptive Flow Path Sampler

يُعد A-FloPS إطار عمل لا يتطلب تدريباً يعمل على تسريع نماذج الانتشار من خلال إعادة تمثيل مسارات أخذ العينات الخاصة بها في شكل مطابقة للتدفق، وتوظيف تفكيك سرعة تكيفي للحفاظ على جودة عينات عالية حتى مع عدد قليل للغاية من تقييمات الدوال.

Cheng Jin, Zhenyu Xiao, Yuantao Gu2026-02-10
💻 computer science

HyPlaneHead: Rethinking Tri-plane-like Representations in Full-Head Image Synthesis

لمعالجة مشكلات تشابك الميزات، وعدم توازن التعيين، واختراق الميزات الموجودة في تمثيلات المستويات الثلاثية (tri-plane) والمستويات الثلاثية الكروية الحالية، تقترح هذه الورقة HyPlaneHead، وهو إطار عمل مبتكر يستخدم تمثيل مستوٍ هجين، واستراتيجية تحريف ذات مساحة متساوية تقريبًا، وخريطة ميزات موحدة أحادية القناة لتحقيق أداء فائق في توليد الصور لكامل الرأس.

Heyuan Li, Kenkun Liu, Lingteng Qiu, Qi Zuo, Keru Zheng, Zilong Dong, Xiaoguang Han2026-02-10
💻 computer science

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

تقترح الورقة البحثية إطار عمل MARC، وهو إطار تعلم تعزيزي معزز بالذاكرة يحقق دقة تقارب خط الأساس في فهم الفيديو مع تقليل الرموز المرئية بنسبة 95% وذاكرة وحدة معالجة الرسومات بنسبة 72% من خلال استراتيجية مبتكرة تعتمد على "الاسترجاع ثم الضغط" تجمع بين مسترجع الذاكرة المرئية وطريقة تقطير تحسين السياسة النسبي للمجموعات المضغوطة.

Peiran Wu, Zhuorui Yu, Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen2026-02-10
💻 computer science

GL-DT: Multi-UAV Detection and Tracking with Global-Local Integration

يقترح البحث إطار عمل الكشف والتتبع العالمي-المحلي (GL-DT)، الذي يستخدم وحدة دمج الميزات المكانية-الزمانية واستراتيجية كشف تعاونية إلى جانب خوارزمية JPTrack لتعزيز كشف الأهداف الصغيرة واستقرار المسار في سيناريوهات الطائرات بدون طيار المتعددة.

Juanqin Liu, Leonardo Plotegher, Eloy Roura, Shaoming He2026-02-10
💻 computer science

Color3D: Controllable and Consistent 3D Colorization with Personalized Colorizer

يُعد Color3D إطار عمل عالي التكيف يحقق تلوينًا متسقًا وقابلاً للتحكم لكل من المشاهد ثلاثية الأبعاد الثابتة والديناميكية عن طريق تلوين مشهد رئيسي واحد وضبط ملون مخصص لتمرير تلك الألوان عبر الرؤى الجديدة والخطوات الزمنية.

Yecong Wan, Mingwen Shao, Renlong Wu, Wangmeng Zuo2026-02-10
💻 computer science

Vision-Centric 4D Occupancy Forecasting and Planning via Implicit Residual World Models

تقترح الورقة البحثية نموذج العالم المتبقي الضمني (IR-WM)، وهو نموذج عالم متبقي ضمني يعمل على تحسين التنبؤ بالإشغال رباعي الأبعاد وتخطيط القيادة الذاتية من خلال التركيز على التنبؤ بتغيرات المشهد (المتبقيات) بالنسبة لسابقة زمنية بدلاً من إعادة بناء مشاهد مستقبلية كاملة من الصفر.

Jianbiao Mei, Yu Yang, Xuemeng Yang, Licheng Wen, Jiajun Lv, Botian Shi, Yong Liu2026-02-10
🤖 AI

Breaking Scale Anchoring: Frequency Representation Learning for Accurate High-Resolution Inference from Low-Resolution Training

تقدم هذه الورقة مفهوم "تثبيت المقياس" (Scale Anchoring) — حيث تفشل النماذج في تحسين الدقة عند مستويات الدقة الأعلى بسبب القيود الترددية في بيانات التدريب منخفضة الدقة — وتقترح تعلم التمثيل الترددي (Frequency Representation Learning - FRL) لتمكين التنبؤ المكاني الزماني عالي الدقة بشكل أكثر دقة.

Wenshuo Wang, Fan Zhang2026-02-10
💻 computer science

Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation

تقدم هذه الورقة TacThru، وهو مستشعر "رؤية عبر الجلد" قادر على الإدراك البصري واللمسي القوي في آن واحد، وTacThru-UMI، وهو إطار عمل للتعلم بالتقليد يدمج هذه الإشارات متعددة الوسائط عبر سياسة انتشار قائمة على المحولات (Transformer-based Diffusion Policy) لتحسين أداء التلاعب الروبوتي بشكل كبير في المهام المعقدة.

Yuyang Li, Yinghan Chen, Zihang Zhao, Puhao Li, Tengyu Liu, Siyuan Huang, Yixin Zhu2026-02-10