🤖 AI

Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AI

تقدم هذه الورقة "Egocentric Co-Pilot"، وهو إطار عمل عصبي-رمزي أصيل للويب مخصص للنظارات الذكية، يجمع بين مجموعة أدوات ينسقها نموذج لغوي كبير (LLM) مع استدلال زمني متقدم ورسم خرائط نوايا متعدد الوسائط لتقديم ذكاء اصطناعي مساعد يعمل دائمًا وبأحدث التقنيات للملاحة والمهام اليومية، مما أظهر أداءً فائقًا ورضا مستخدم أعلى مقارنة بالنماذج التجارية الأساسية من خلال تقييمات النشر السحابي والمحلي على حد سواء.

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, Fengyi Fang, You He, Yiqiao Xie, Jiankang Deng, Hang Zhang, Jifei S (…)2026-03-03
💻 computer science

GroundedSurg: A Multi-Procedure Benchmark for Language-Conditioned Surgical Tool Segmentation

تقدم هذه الورقة GroundedSurg، وهو أول معيار متعدد الإجراءات مصمم لتقييم تقسيم أدوات الجراحة على مستوى الحالة والمشروط باللغة، وذلك عبر إقران الصور الجراحية بالأوصاف اللغوية الطبيعية والتعليقات التوضيحية المكانية الدقيقة لمعالجة أوجه القصور في نماذج التقييم الحالية القائمة على الفئات في الذكاء الاصطناًعي السريري.

Tajamul Ashraf, Abrar Ul Riyaz, Wasif Tak, Tavaheed Tariq, Sonia Yadav, Moloud Abdar, Janibul Bashir2026-03-03
💻 computer science

Teacher-Guided Causal Interventions for Image Denoising: Orthogonal Content-Noise Disentanglement in Vision Transformers

تقترح الورقة البحثية شبكة TCD-Net، وهي إطار عمل لإزالة الضجيج من الصور يعتمد على محولات الرؤية (Vision Transformer)، وتستخدم تدخلات سببية موجهة من المعلم، بما في ذلك تعديل الانحياز البيئي وفك الارتباط المتعامد بين المحتوى والضجيج، للقضاء على الارتباطات الزائفة وتحقيق أداء فائق في الدقة وفي الوقت الفعلي.

Kuai Jiang, Zhaoyan Ding, Guijuan Zhang, Dianjie Lu, Zhuoran Zheng2026-03-03
💻 computer science

ArtLLM: Generating Articulated Assets via 3D LLM

يُعد ArtLLM إطار عمل مبتكرًا يستفيد من نموذج لغوي كبير متعدد الوسائط ثلاثي الأبعاد للتنبؤ بالتراكيب الحركية بشكل تلقائي وتوليد أصول ثلاثية الأبعاد مفصلة وعالية الدقة مباشرة من الشبكات الكاملة، مما يتفوق بشكل كبير على الأساليب الحالية في الدقة والتعميم لتطبيقات مثل الروبوتات والمحاكاة.

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu2026-03-03
💻 computer science

ConVibNet: Needle Detection during Continuous Insertion via Frequency-Inspired Features

تقدم هذه الورقة ConVibNet، وهو إطار عمل للتعلم العميق في الوقت الفعلي يعزز الكشف المستمر عن الإبر في التدخلات الموجهة بالموجات فوق الصوتية من خلال الاستفادة من التبعيات الزمنية وفقدان التقاطع والفرق المبتكر لتحقيق دقة فائقة في تحديد موقع الرأس ومتانة مقارنة بالنماذج المرجعية الحالية.

Jiamei Guo, Zhehao Duan, Maria Neiiendam, Dianye Huang, Nassir Navab, Zhongliang Jiang2026-03-03
💻 computer science

D-REX: Differentiable Real-to-Sim-to-Real Engine for Learning Dexterous Grasping

تقدم هذه الورقة D-REX، وهو محرك تفاضلي من الواقع إلى المحاكاة ثم إلى الواقع يعتمد على تقنية "Gaussian Splatting" لتحديد كتلة الأجسام من البيانات المرئية وبيانات التحكم لإنشاء توائم رقمية عالية الدقة، مما يتيح سياسات إمساك ماهرة وقوية ومدركة للقوة تسد فجوة الانتقال من المحاكاة إلى الواقع بفعالية.

Haozhe Lou, Mingtong Zhang, Haoran Geng, Hanyang Zhou, Sicheng He, Zhiyuan Gao, Siheng Zhao, Jiageng Mao, Pieter Abbeel (…)2026-03-03
🤖 machine learning

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

تقدم هذه الورقة TripleSumm، وهي بنية دمج تكيفية ثلاثية الأنماط تعمل على وزن الميزات البصرية والنصية والصوتية ديناميكيًا على مستوى الإطار لتحقيق أداء رائد في تلخيص الفيديو، إلى جانب إصدار MoSu، وهو أول معيار ضخم يوفر الأنماط الثلاثة جميعها.

Sumin Kim, Hyemin Jeong, Mingu Kang, Yejin Kim, Yoori Oh, Joonseok Lee2026-03-03
💻 computer science

RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations

يُعد RnG نموذج "ترانسفورمر" (Transformer) جديداً ذا تغذية أمامية يوحد بين إعادة البناء والتوليد ثلاثي الأبعاد من خلال توظيف آلية انتباه سببية موجهة بإعادة البناء لاستنتاج تمثيلات ثلاثية الأبعاد كاملة وضمنية من ملاحظات ثنائية الأبعاد جزئية، مما يتيح عرضاً فورياً وبأداء متفوق لكل من الهندسة المرئية والهندسة غير المرئية المحتملة.

Mochu Xiang, Zhelun Shen, Xuesong Li, Jiahui Ren, Jing Zhang, Chen Zhao, Shanshan Liu, Haocheng Feng, Jingdong Wang, Yuc (…)2026-03-03
🤖 AI

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

تقدم هذه الورقة البحثية VisNec، وهو إطار عمل مبني على أسس منهجية يقيس الضرورة البصرية لتصفية العينات الزائدة وغير المتوافقة من مجموعات بيانات التعليمات متعددة الوسائط، مما يمكن النماذج من تحقيق أداء فائق باستخدام كمية أقل بكثير من بيانات التدريب.

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu2026-03-03
💻 computer science

CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling

يعالج CoSMo3D هشاشة التجزئة الدلالية ثلاثية الأبعاد في العالم المفتوح من خلال تقديم إطار عمل موجه بنماذج اللغات الكبيرة (LLM) يتعلم إطار مرجعي معياري كامن لمحاذاة أجزاء الأشياء عبر الفئات المختلفة، محققاً بذلك أداءً هو الأفضل في فئته من خلال دلالات أجزاء مستقرة وغير متأثرة بالوضعية.

Li Jin, Weikai Chen, Yujie Wang, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Shengju Qian, Xin Wang, Xueying Qin2026-03-03