🤖 machine learning

Training-Free Vector Quantization via Gaussian VAEs

تقدم هذه الورقة البحثية "Gaussian Quant" (GQ)، وهي طريقة لا تتطلب تدريبًا تقوم بتحويل مشفر تلقائي متباين (VAE) غاوسي مقيد إلى مشفر تلقائي كمي (VQ-VAE) عالي الأداء باستخدام ضوضاء غاوسية عشوائية ككتاب رموز، مما يضمن نظريًا انخفاض خطأ التكميم ويتفوق تجريبيًا على أساليب الـ VQ-VAE الحالية.

Tongda Xu, Wendi Zheng, Jiajun He, Jose Miguel Hernandez-Lobato, Yan Wang, Ya-Qin Zhang, Jie Tang2026-05-27
🤖 machine learning

INTERACT-CMIL: Multi-Task Shared Learning and Inter-Task Consistency for Conjunctival Melanocytic Intraepithelial Lesion Grading

يقدم البحث إطار INTERACT-CMIL، وهو إطار عمل للتعلم العميق متعدد المهام يستفيد من تعلم الميزات المشتركة والاتساق بين المهام لتحسين التصنيف الدقيق لآفات الميلانينية الظهارية الملتحمية عبر خمسة محاور نسيجية مرضية بشكل كبير، متفوقاً بذلك على النماذج المرجعية للشبكات العصبية التلافيفية والنماذج التأسيسية على مجموعة بيانات متعددة المراكز.

Mert Ikinci, Luna Toma, Karin U. Loeffler, Leticia Ussem, Daniela Süsskind, Julia M. Weller, Yousef Yeganeh, Martina C. (…)2026-05-27
💻 computer science

LuxRemix: Lighting Decomposition and Remixing for Indoor Scenes

تُعد LuxRemix طريقة مبتكرة تتيح تفكيك وإعادة مزج الإضاءة بشكل تفاعلي وفي الوقت الفعلي في المشاهد الداخلية، وذلك عبر تحليل الإضاءة من لقطة واحدة متعددة المشاهد إلى مصادر ضوء قابلة للتحكم ودمجها في تمثيل "Gaussian splatting" ثلاثي الأبعاد قابل لإعادة الإضاءة مع ضمان التناغم بين المشاهد المتعددة.

Ruofan Liang, Norman Müller, Ethan Weber, Duncan Zauss, Nandita Vijaykumar, Peter Kontschieder, Christian Richardt2026-05-27
💻 computer science

Finding NeMO: A Geometry-Aware Representation of Template Views for Few-Shot Perception

تقدم الورقة البحثية NeMO، وهو تمثيل جديد متمحور حول الكائنات يتيح الكشف والتقطيع وتقدير وضعية الـ 6DoF للأجسام غير المرئية من صور RGB عبر ترميز مناظر نموذجية متفرقة في دالة كثافة موحدة (UDF) متعلمة، محققاً نتائج رائدة في معيار BOP دون الحاجة إلى معاملات الكاميرا أو إعادة التدريب.

Sebastian Jung, Leonard Klüpfel, Rudolph Triebel, Maximilian Durner2026-05-27
💻 computer science

MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation

تقدم هذه الورقة MVISTA-4D، وهو نموذج عالم رباعي الأبعاد متجسد ومبتكر يولد تسلسلات RGBD متسقة هندسيًا ومن أي منظور من ملاحظات أحادية المنظور لتمكين التلاعب الروبوتي القوي من خلال استراتيجية تحسين الإجراء في وقت الاختبار التي تستنتج المسارات المثلى عبر الانتشار العكسي خلال النموذج التوليدي.

Jiaxu Wang, Yicheng Jiang, Tianlun He, Jingkai Sun, Qiang Zhang, Junhao He, Jiahang Cao, Zesen Gan, Mingyuan Sun, Qiming (…)2026-05-27
💻 computer science

DETR-ViP: Detection Transformer with Robust Discriminative Visual Prompts

لمعالجة الأداء دون المستوى لكشف الأشياء المعتمد على التلميحات البصرية الناتج عن نقص التمييز العالمي، يقترح المؤلفون DETR-ViP، وهو إطار عمل قوي يدمج التكامل التلميحي العالمي، وتقطير العلاقة البصرية النصية، والدمج الانتقائي لتحقيق نتائج رائدة عبر معايير متعددة.

Bo Qian, Dahu Shi, Xing Wei2026-05-27
💻 computer science

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

تقدم الورقة البحثية VISTA، وهو معيار شامل مصمم لتقييم الوكلاء القائمين على النماذج اللغوية الكبيرة في توليد تطبيقات الويب من المواصفات المرئية من خلال تحديد ظروف مطالبة متنوعة واستخدام إطار تقييم متعدد الأوجه يجمع بين مطابقة نموذج كائن مستند إلى المستند (DOM)، والاختبار السلوكي، والتشابه البصري للتغلب على قيود الأدوات التقليدية القائمة على البرامج النصية.

JunJia Guo (Joe), Yuhang Yao (Joe), Jiawei (Joe), Zhou, Jingdi Chen2026-05-27
💻 computer science

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

يقدم البحث UniMVU، وهو إطار عمل موحد لفهم الفيديو متعدد الوسائط يستخدم آليات بوابات مدركة للتعليمات على مستويي الوسائط الداخلية والوسائط ككل لموازنة تدفقات المدخلات المتنوعة ديناميكيًا وتقليل التداخل، مما يحقق تحسينات كبيرة في الأداء عبر ستة معايير مقارنة بنماذج الدمج الثابتة.

Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan2026-05-27
💻 computer science

DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation

تقدم هذه الورقة DuoGesture، وهو إطار عمل ثنائي المسار مستوحى من الأنظمة العصبية يعزز توليد إيماءات الكلام من خلال فصل الحركات الدلالية عن حركات الإيقاع، باستخدام بوابة عشوائية للتنسيق، وتكييف دلالي مرتكز على الحركة لتحقيق محاذاة معجمية أفضل، وأولوية قصورية لضمان اتساق إيقاعي منطقي من الناحية الميكانيكية الحيوية.

Ferdinand Paar, Lanmiao Liu, Aslı Özyürek, Serge Thill, Esam Ghaleb2026-05-27
💻 computer science

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

تقدم هذه الورقة LongAV-Compass، وهو معيار مرجعي منهجي صُمم لتوحيد تقييم التوليد السمعي البصري بمقياس الدقيقة عبر وسائط التكييف النصية والصورية والفيديو من خلال توظيف إطار عمل شامل يقيم أكثر من 20 بُعداً دقيقاً للجودة والاتساق والترابط.

Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Don (…)2026-05-27