🤖 machine learning

Vendi Novelty Scores for Out-of-Distribution Detection

تقدم هذه الورقة "درجة فيندي للابتكار" (VNS)، وهي كاشف للبيانات خارج التوزيع، خطي الزمن وغير معلمي، يستفيد من مقاييس التنوع لتحقيق أداء رائد عبر مختلف المعايير المرجعية مع الحفاظ على الفعالية حتى مع الحد الأدنى من بيانات التدريب.

Amey P. Pasarkar, Adji Bousso Dieng2026-05-22
💻 computer science

Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain

تقدم هذه الورقة "كسب المعلومات البصرية" (VIG)، وهو مقياس قائم على الحيرة (perplexity) يحدد كمياً مساهمة المدخلات البصرية في عدم اليقين من التنبؤ، ويستفيد منه لتطوير مخطط تدريب انتقائي يعطي الأولوية للعينات والرموز (tokens) ذات المعلومات البصرية الغنية، مما يقلل بفعالية من الانحياز اللغوي في النماذج اللغوية البصرية الكبيرة مع تقليل الإشراف.

Seulbi Lee, Sangheum Hwang2026-05-22
💻 computer science

Depth Augmented and FE Free 3D/2D Liver Registration for Laparoscopic Liver AR

تقدم هذه الورقة مساراً لعملية تسجيل ثلاثي الأبعاد إلى ثنائي الأبعاد معززاً بالعمق وخالياً من العناصر المحدودة للواقع المعزز لجراحة الكبد بالمنظار، يجمع بين التهيئة الصلبة القائمة على FoundationPose ونمذجة التشوه الإحصائي الخاصة بالمريض لتحقيق محاذاة دقيقة مع تقليل التعقيد الهندسي.

Hanyuan Zhang, Lucas He, Runlong He, Weixi Yi, Abdolrahim Kadkhodamohammadi, Danail Stoyanov, Brian R. Davidson, Evangel (…)2026-05-22
💻 computer science

Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation

تقدم هذه الورقة البحثية "تدفق الحقيقة" (Flow of Truth)، وهو أول إطار عمل استباقي للتحليل الجنائي للصور إلى فيديو، والذي يعيد تعريف توليد الفيديو باعتباره حركة بكسلية عبر الزمن لتمكين التتبع الزمني القوي للآثار المتطورة عبر الإطارات، متجاوزاً بذلك قيود التحليل المكاني التقليدي.

Yuzhuo Chen, Zehua Ma, Han Fang, Hengyi Wang, Guanjie Wang, Weiming Zhang2026-05-22
🤖 machine learning

SplAttN: Bridging 2D and 3D with Gaussian Soft Splatting and Attention for Point Cloud Completion

يعالج SplAttN مشكلة "انهيار الإنتروبيا عبر الوسائط" الناتجة عن عمليات الإسقاط الصلبة القياسية في إكمال السحابة النقطية متعددة الوسائط من خلال إدخال تقنية "Gaussian Splatting" القابلة للتفاضل لإنشاء تمثيلات صورية كثيفة ومستمرة، مما يؤدي إلى تأسيس روابط قوية عبر الوسائط وتحقيق أداء رائد على كل من المعايير الاصطناعية والواقعية.

Zhaoyang Li, Zhichao You, Tianrui Li2026-05-22
💻 computer science

From Spherical to Gaussian: A Comparative Analysis of Point Cloud Cropping Strategies in Large-Scale 3D Environments

تقترح هذه الورقة البحثية وتقيّم استراتيجيات بديلة لقص السحابة النقطية (الأسية، والغاوسية، والخطية) كبدائل متفوقة للقص الكروي التقليدي، مبرهنةً على أن هذه الطرق تحافظ على سياق هندسي أكبر وتعزز بشكل كبير أداء نماذج التعلم العميق ثلاثية الأبعاد في البيئات الداخلية والخارجية واسعة النطاق.

Maximilian Kellner, Dominik Merkle, Michael Brunklaus, Alexander Reiterer2026-05-22
💻 computer science

Ray-Aware Pointer Memory with Adaptive Updates for Streaming 3D Reconstruction

تقترح هذه الورقة إطار عمل لذاكرة مؤشر مدركة للأشعة مع استراتيجية تحديث تكيفية للاحتفاظ أو الاستبدال، والتي تعمل على نمذجة الموقع ثلاثي الأبعاد واتجاه الرؤية بشكل مشترك لتحقيق إعادة بناء ثلاثية الأبعاد تدفقية مستقرة، ومقاومة للانجراف، وفعالة من حيث الذاكرة من تدفقات الصور المستمرة.

Feifei Li, Qi Song, Chi Zhang, Rui Huang2026-05-22
💻 computer science

X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

تقدم هذه الورقة البحثية X-OmniClaw، وهو وكيل متنقل موحد لنظام أندرويد يدمج الإدراك متعدد الوسائط، والذاكرة الشخصية، واستراتيجيات العمل الهجينة لتمكين التنفيذ الفعال والموثوق للمهام المعقدة من خلال تفاعلات بديهية.

Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao (…)2026-05-22
💻 computer science

Don't Collapse Your Features: Why CenterLoss Hurts OOD Detection and Multi-Scale Mahalanobis Wins

تقدم هذه الورقة GOEN، وهو مسار معالجة بسيط وفعال للكشف عن البيانات خارج التوزيع (OOD) يتفوق على النماذج المرجعية المتطورة من خلال الاستفادة من الميزات متعددة المقاييس ومسافة ماهالانوبيس، بينما يوضح أن "CenterLoss"، رغم تحسينه لدقة التصنيف، يؤدي إلى تدهور كبير في الكشف عن البيانات خارج التوزيع عبر تشويه الهندسة الميزية المطلوبة لتقدير اليقين المعرفي الموثوق.

Rahul D Ray2026-05-22
💻 computer science

UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation

يقدم UniVL إطار عمل موحداً لتمثيل الرؤية واللغة يلغي الحاجة إلى مشفرات نصية مستقلة عبر القراءة البصرية للتعليمات المُصوّرة مكانياً لتحقيق توليد صور سياقي عالي الجودة وفعال ومحدد مكانياً.

Jiayun Wang, Yu Wang, Weijie Gan, Zhenting Wang, Wei Wei2026-05-22