🔬 optics

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

يُعد Engram-E2VID إطار عمل مرجعي لإعادة بناء الأحداث إلى فيديو يستفيد من عمود فقري لانتشار الانتشار أحادي الخطوة لتوجيه التنشيط الهيكلي لـ "إنغرامات" المظهر المشفرة من إطار مرجعي، مما يتيح استعادة عالية الدقة لإطارات RGB المستهدفة من تدفقات أحداث متفرقة حتى في ظل الحركة المعقدة والفترات الزمنية الطويلة.

Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan2026-08-07
🤖 AI

Unified Agent: Managing Interactions across Devices

تقدم الورقة البحثية "الوكيل الموحد" (Unified Agent)، وهو نظام ذو حالة (stateful) يدير بفعالية التفاعلات عبر الأجهزة وعبر الزمن من خلال الحفاظ على حالة مدمجة وجاهزة للتنفيذ، مما يظهر أداءً متفوقاً وقوياً مقارنة بتصاميم الوكلاء الحالية من خلال معيار قياس تم إنشاؤه حديثاً.

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen2026-08-07
💻 computer science

LiteKD-Net: Lightweight Knowledge-Distilled Network for Mobile Image Denoising

تقترح الورقة البحثية شبكة LiteKD-Net، وهي شبكة خفيفة الوزن تعتمد على تقنية تقطير المعرفة، تستخدم محاكاة ضوضاء موجهة بالفيزياء ونموذج طالب يعتمد على الالتفافات القابلة للفصل بعمق لتحقيق توازن أمثل بين استعادة الصور عالية الجودة والكفاءة الحسابية لإزالة الضوضاء من الصور على الأجهزة المحمولة.

Zhou Zhiyi2026-08-07
💻 computer science

ConceptADapt: Concept-guided Adaptive Feature Reconstruction with Dynamic Attention for Few-Shot Industrial Anomaly Detection

إن ConceptADapt هو نموذج إعادة بناء ميزات تكيفي موجه بالمفاهيم وخفيف الوزن، يستخدم الانتباه الديناميكي والمشفرات التلقائية المتناثرة للتغلب على تحديات التعميم في الكشف عن الشذوذ الصناعي في ظل ندرة البيانات، وذلك عبر التعلم المسبق للمفاهيم الطبيعية من بيانات محدودة وإعادة معايرة ميزات الاستعلام بفعالية لتحقيق كشف وتحديد دقيقين للعيوب.

Yufei Li, Yicheng Ruan, Long Tian, Dongsheng Wang, Liang Bao2026-08-07
🤖 AI

HyTBE: Hyperbolic Target-Background Expert Model for Cross-Domain Infrared Small Target Detection

لمعالجة تدهور الأداء في كشف الأهداف الصغيرة بالأشعة تحت الحمراء في المجالات غير المرئية والناتج عن تحولات العلاقة بين الهدف والخلفية، يقترح المؤلفون HyTBE، وهو نموذج يستفيد من الهندسة الزائدية ومهايئ خليط من الخبراء لتوسيع أنماط العلاقات القابلة للملاحظة ومعايرة التمثيلات المرئية تكيفياً من أجل تعميم قوي عبر المجالات.

Aohua Li, Jin Kuang, Yubing Lu, Pingping Liu2026-08-07
🤖 machine learning

SR-JEPA: Learning Predictive Latent State in 3D Scenes

تقدم الورقة البحثية SR-JEPA، وهي بنية تنبؤية ذات تضمين مشترك أصلية في النقاط (point-native) تتعلم حالة كامنة تركيبية وقابلة للاستعلام للمشاهد ثلاثية الأبعاد من خلال التنبؤ بتمثيلات الكائنات المفقودة دون الاعتماد على إعادة البناء، أو الملصقات الدلالية، أو الميزات ثنائية الأبعاد، محققةً أداءً قويًا في مهام الهوية الدلالية وكشف الكائنات.

Zihan Zhou, Qifu Wen, Xi Zeng2026-08-07
💻 computer science

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

يُعد Vorch-Director نموذجاً تفاعلياً لقصص العوالم يعمل على تعزيز التوليد السمعي البصري طويل الأمد من خلال إدخال استراتيجية تصحيح متبقي مدركة للضوضاء للتخفيف من تراكم الأخطاء وانحراف الهوية، مع الاستفادة من تضمينات المهام والتدريب المختلط للمهام لدعم التكييف الموحد ومتعدد اللقطات على محول الانتشار LTX-2.

Lisai Zhang, Yidi Wu, Qi Liu, Xin Ma, Yang Ding, Gang Yue, Siqian Yang, Jingyuan Chen, Lin Ma, Yaohui Wang2026-08-07
💻 computer science

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

يُعد EviSelect إطار عمل للاختيار البصري الديناميكي دقيق التفاصيل، يستفيد من أدلة الانتباه الداخلية لنموذج لغوي كبير متعدد الوسائط (MLLM) عبر التعبئة المسبقة المتفرقة لتوجيه سياسة عشوائية محسنة، مما يتيح أخذ عينات مكانية-زمانية تكيفية تقلل بشكل كبير من التكاليف الحسابية وتسرع فهم الفيديو الطويل مع الحفاظ على أداء فائق.

Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei2026-08-07
🤖 machine learning

VSMP-IMU: Video-Grounded Semantic Motion Programs for Sensor-Aware Synthetic IMU Generation

تقدم الورقة البحثية VSMP-IMU، وهو إطار عمل يعتمد على الفيديو لتوليد بيانات مستشعرات القصور الذاتي (IMU) اصطناعية قابلة للتحكم باستخدام برامج الحركة الدلالية المهيكلة للتغلب على ندرة البيانات وتحسين أداء التعرف على الأنشطة البشرية القابلة للارتداء بشكل كبير عبر سيناريوهات نقص الموارد، وعدم التوازن، وتعميم الأشخاص.

Lala Shakti Swarup Ray, Vitor Fortes Rey, Mengxi Liu, Paul Lukowicz, Bo Zhou2026-08-07
🤖 machine learning

KVAE: Family of Tokenizers for Multimodal Generative Models

تقدم هذه الورقة البحثية KVAE، وهي عائلة من أجهزة الترميز (tokenizers) عالية الأداء للصوت والصورة والفيديو، والتي تحقق جودة في إعادة البناء والتوليد تضاهي أو تتفوق على النماذج مفتوحة المصدر الرائدة، مع توفير تفاصيل تدريب شاملة ورموز برمجية لتسهيل استخدامها في النماذج التوليدية متعددة الوسائط المشروطة بالنص.

Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Vale (…)2026-08-07