💻 computer science

Spectral Compressive Imaging via Chromaticity-Intensity Decomposition

تقترح هذه الورقة البحثية إطار عمل CIDNet، وهو إطار لتفكيك الكروماتيكية والشدة لأنظمة CASSI ثنائية الكاميرا يعمل على فصل الإشعاع المعتمد على الإضاءة إلى مكونات انعكاسية وشدة ثابتة لتحقيق إعادة بناء طيفي متفوقة من خلال بنية "ترانسفورمر" هجينة وتقدير تكيفي للضجيج.

Xiaodong Wang, Zijun He, Ping Wang, Lishun Wang, Yanan Hu, Xin Yuan2026-02-09
📊 statistics

Learning a distance measure from the information-estimation geometry of data

تقدم هذه الورقة مقياس تقدير المعلومات (IEM)، وهو دالة مسافة مبتكرة مشتقة من العلاقة بين نظريات المعلومات والتقدير، والتي تستفيد من أجهزة إزالة الضجيج المتعلمة للتكيف مع هندسات البيانات المعقدة وتحقيق أداء رائد في التنبؤ بجودة الصور الإدراكية البشرية.

Guy Ohayon, Pierre-Etienne H. Fiquet, Florentin Guth, Jona Ballé, Eero P. Simoncelli2026-02-09
🤖 machine learning

An Evaluation of Hybrid Annotation Workflows on High-Ambiguity Spatiotemporal Video Footage

تُثبت هذه الورقة أن دمج التوصيفات المسبقة للمشفرات المضبوطة في سير عمل يعتمد على العنصر البشري يقلل بشكل كبير من وقت التوصيف اليدوي لمقاطع الفيديو ذات الأبعاد الزمانية والمكانية عالية الغموض بنسبة 35% لمعظم المستخدمين، مع وضع إطار عمل صارم لتقييم المقايضات بين السرعة الخوارزمية وسلامة التحقق البشري.

Juan Gutiérrez, Victor Gutiérrez, Ángel Mora, Silvia Rodriguez, José Luis Blanco2026-02-09
🤖 machine learning

T-REGS: Minimum Spanning Tree Regularization for Self-Supervised Learning

تقدم هذه الورقة T-REGS، وهو إطار عمل للتعلم الخاضع للإشراف الذاتي يستخدم طول شجرة الامتداد الدنيا كحد تنظيم لتقليل الانهيار البعدي نظرياً وتجريبياً مع تعزيز انتظام التوزيع في التمثيلات المتعلمة.

Julie Mordacq, David Loiseaux, Vicky Kalogeiton, Steve Oudot2026-02-09
🤖 machine learning

LL-ViT: Edge Deployable Vision Transformers with Look Up Table Neurons

تقترح هذه الورقة البحثية LL-ViT، وهو نموذج "Vision Transformer" مُحسَّن للأجهزة الطرفية يدمج عصبونات جدول بحث (LUT) قابلة للتعلم داخل مِزاج القنوات (channel mixer) لتقليل أوزان النموذج وعمليات الضرب بشكل كبير، محققاً دقة عالية في المهام البصرية مع تقديم كفاءة طاقة فائقة وزمن استجابة أقل على مصفوفات البوابات المنطقية القابلة للبرمجة (FPGAs) مقارنة بالمسرعات الحالية.

Shashank Nag, Alan T. L. Bacellar, Zachary Susskind, Anshul Jha, Logan Liberty, Aishwarya Sivakumar, Eugene B. John, Kri (…)2026-02-09
💻 computer science

SPIDER: Scalable Physics-Informed Dexterous Retargeting

إنَّ SPIDER هو إطار عمل لإعادة الاستهداف يعتمد على الفيزياء وقابل للتوسع، يقوم بتحويل بيانات الحركة البشرية الحركية فقط إلى مسارات روبوتية قابلة للتنفيذ ديناميكيًا، مما يحسن بشكل كبير من كفاءة تعلم السياسات ومعدلات النجاح عبر مختلف تجسدات الروبوتات البشرية والأيدي الماهرة.

Chaoyi Pan, Changhao Wang, Haozhi Qi, Zixi Liu, Homanga Bharadhwaj, Akash Sharma, Tingfan Wu, Guanya Shi, Jitendra Malik (…)2026-02-09
🤖 machine learning

Inverse problems with diffusion models: MAP estimation via mode-seeking loss

تقدم هذه الورقة "خسارة البحث عن النمط المتغير" (Variational Mode-Seeking Loss - VML)، وهي دالة هدف ذات أساس نظري وقابلة للاشتقاق تحليلياً لتقليل تباعد كولباك - ليبلر (KL divergence)، مما يتيح تقديراً فعالاً وعالي الأداء لتقدير "الحد الأقصى للارجحية البعدية" (Maximum A Posteriori - MAP) لحل المشكلات العكسية التعسفية باستخدام نماذج الانتشار غير المشروطة مسبقة التدريب دون الحاجة إلى تدريب خاص بالمهمة.

Sai Bharath Chandra Gutha, Ricardo Vinuesa, Hossein Azizpour2026-02-09
💻 computer science

SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild

تقترح الورقة البحثية SyncAnyone، وهو إطار عمل مبتكر يتكون من مرحلتين يجمع بين نموذج ملء الفراغات (inpainting) القائم على الانتشار (diffusion) وبين عملية ضبط لاحقة للتصحيح الذاتي خالية من الأقنعة، وذلك لتحقيق مزامنة شفاه عالية الدقة مدفوعة بالصوت مع الحفاظ على هوية الشخص واتساق الخلفية في السيناريوهات الواقعية.

Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang2026-02-09