🤖 machine learning

TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting

يُعد TrackRef3D مساراً آلياً بالكامل للتجزئة المرجعية في الفضاء ثلاثي الأبعاد ضمن العوالم المفتوحة باستخدام تقنية Gaussian Splatting، حيث يلغي الحاجة إلى التوسيم اليدوي عبر تقديم نموذج "التتبع ثم التوسيم" المتسق عبر المشاهد المتعددة، والذي يتميز بوحدة إجماع دلالي مدركة للمسار واستراتيجية تدريب هجينة لضمان اكتشاف الكائنات وتأصيلها دلالياً بشكل قوي ومتسق عبر مختلف مستويات تحديد الاستعلام.

Yuyang Tan, Renhe Zhang, Hang Zhang, Ao Li, Xin Tan2026-05-27
💻 computer science

O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

تقدم هذه الورقة O-MARC، وهو إطار عمل للتقطير والضغط لا يتطلب تدريباً مقترناً بمعيار UGC-AVQA، والذي يحسن بشكل كبير من كفاءة ودقة الفهم الشامل للفيديو متعدد الأنماط عن طريق تقليل زمن انتقال الاستدلال واستهلاك الذاكرة مع الحفاظ على الارتباطات السمعية البصرية الجوهرية.

Peiran Wu, Yunze Liu, Chi-Hao Wu, Chen Chen, Junxiao Shen2026-05-27
💻 computer science

DelowlightSplat: Feed-Forward Gaussian Splatting for Lowlight 3D Scene Reconstruction

تقترح الورقة البحثية DelowlightSplat، وهو إطار عمل لـ Gaussian splatting يعمل بنظام التغذية الأمامية يدمج محولًا خفيف الوزن للإضاءة المنخفضة واستدلالًا متعدد المناظر يعتمد على حجم التكلفة (cost-volume) لتمكين إعادة بناء ثلاثي الأبعاد للمشاهد بشكل قوي وتخليق مناظر جديدة نظيفة من صور قليلة العدد ومنخفضة الإضاءة.

Fuzhen Jiang, Zengtian Xie, Zhuoran Li2026-05-27
💻 computer science

Adaptation-Free Heterogeneous Collaborative Perception with Unseen Agent Configurations

تقترح هذه الورقة إطار عمل ALF، وهو إطار عمل للإدراك التعاوني غير المعتمد على التكيف يتيح الكشف عن الأجسام ثلاثية الأبعاد بنمط "الصفر محاولة" (zero-shot) مع تكوينات الوكلاء غير المرئية من خلال تحويل الرسائل خفيفة الوزن على مستوى الصندوق إلى سمات كامنة متوافقة مع المركبة الذاتية، مما يحقق مكاسب كبيرة في الأداء مع حد أدنى من عرض النطاق الترددي على مجموعة بيانات V2X-Real.

Hyunchul Bae, Heejin Ahn2026-05-27
💻 computer science

DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

تقترح هذه الورقة البحثية الضبط الدقيق البصري المباشر (DV-SFT)، وهي طريقة تعزز الفهم البصري دقيق التفاصيل في النماذج اللغوية الكبيرة متعددة الوسائط من خلال الإشراف صراحةً على الرموز البصرية باستخدام تسميات نصية مقابلة مستمدة من سيناريوهات التعرف الضوئي على الحروف (OCR)، مما يحقق أداءً فائقاً دون الحاجة إلى تعديلات هيكلية أو مكونات إضافية.

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Bing Wang, Zhixing Tan2026-05-27
🤖 AI

Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models

تقترح هذه الورقة إطار عمل عبر الإنترنت يعتمد على الإشراف الزائف، والذي يتعلم النماذج الأولية للفئات المرئية من بيانات الاختبار غير المصنفة لسد الفجوة الجوهرية بين الأنماط بين التمثيلات النصية والمرئية، مما يحقق أفضل النتائج في الكشف اللاحق عن البيانات الخارجة عن التوزيع دون الحاجة إلى بيانات تدريب ضمن التوزيع.

Yuanwei Hu, Bo Peng, Yadan Luo, Zhen Fang, Ling Chen, Jie Lu2026-05-27
💻 computer science

Memory-Distilled Selection for Noise-Robust Anomaly Detection

تقترح هذه الورقة خوارزمية "الاختيار المقطر للذاكرة" (MeDS)، وهي خوارزمية تدريب قوية تستفيد من أخذ عينات الذاكرة التجميعية وتقطير الدرجات لتصفية البيانات الملوثة بفعالية وتحقيق أداء رائد في اكتشاف الشذوذ تحت نسب ضوضاء عالية دون الحاجة إلى ضبط المعلمات الفائقة الخاصة بالضوضاء.

Sirojbek Safarov, Jaewoo Park, Yoon Gyo Jung, Kuan-Chuan Peng, Wonchul Kim, Seongdeok Bang, Octavia Camps2026-05-27
🤖 AI

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

يُعد DynFrame إطار عمل متعدد الوسائط وتكيفي يقدم كثافة أخذ عينات إطارية مرمزة وقابلة للتعلم واستراتيجية تدريب GRPO مفككة القطع، لتمكين استرجاع أدلة الفيديو متعددة التدرج بكفاءة وتعيين دقيق للمسؤولية، محققاً أداءً هو الأفضل في فئته في فهم الفيديو المعقد.

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Ha (…)2026-05-27
💻 computer science

SteelDS: A High-Resolution Video Dataset of E40 Steel Scrap for Object Detection and Instance Segmentation

تقدم مجموعة بيانات SteelDS مجموعة فيديو عالية الدقة وموسومة لخرداة الفولاذ والنحاس من فئة E40 على حزام ناقل، مصممة لاختبار نماذج تعلم الآلة للكشف التلقائي عن الأشياء وتقسيم المثيل في تطبيقات الفرز الصناعي.

Melanie Neubauer, Christian Rauch, Gerald Koinig, Alexia Tischberger-Aldrian, Roland Pomberger, Elmar Rueckert2026-05-27
💻 computer science

METATR: A Multilingual, Evolving Benchmark for Automatic Text Recognition

تقدم هذه الورقة METATR، وهو معيار متعدد اللغات ومتطور صُمم لتقييم أنظمة التعرف التلقائي على النصوص على مستندات متنوعة وواقعية عبر 29 لغة ومختلف الكتابات، مما يوفر إطاراً معيارياً للمقارنة والاختيار الهادف للنماذج.

Mélodie Boillet, Solène Tarride, Christopher Kermorvant2026-05-27