🤖 AI

SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

تقترح الورقة البحثية SSR3D-LLM، وهو إطار عمل موحد لـ 3D-LLM يعزز تحديد مواقع الأشياء بدقة متناهية عبر استبدال قرارات المؤشر الواحد الهشة بعملية منظمة من خطوات الاستدلال المكاني الكامن ورموز الذاكرة لتنقيح ترتيب المرشحين بشكل تكراري.

Jiawei Li, Ziyi Liu, Weijie Shi, Long Chen, Jiajie Xu, Xiaofang Zhou2026-05-28
💻 computer science

DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing

تُعد DiscoForcing إطار عمل موحداً يعمل في الوقت الفعلي، يستفيد من مشفر موسيقي سببي ونموذج تسلسل يعتمد على الانتشار القسري (diffusion-forcing) مع جدول زمني هجين للزمن، لتحقيق تحكم مستقر وطويل الأمد واستجابي في حركة الشخصية لكامل الجسم تحت قيود زمن انتقال صارمة وظروف صوتية غير مستقرة.

Kaiyang Ji, Bingsheng Qian, Binghuan Wu, Kangyi Chen, Ye Shi, Jingya Wang2026-05-28
💻 computer science

Janus-LoRA: A Balanced Low-Rank Adaptation for Continual Learning

يُعد Janus-LoRA إطار عمل جديد للتعلم المستمر يحقق توازناً فائقاً بين الاستقرار واللدونة من خلال الجمع بين آلية تصحيح التدرج لفرض التعامد على مستوى المعلمات، وفقدان الهامش المنفصل لضمان الفصل على مستوى الميزات، مما يمنع النسيان الكارثي مع الحفاظ على القدرة التعلمية.

Cheng Chen, Pengpeng Zeng, Yuyu Guo, Lianli Gao, Hengtao Shen, Jingkuan Song2026-05-28
💻 computer science

Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation

يُعد DeGO إطار عمل خاضعًا للإشراف الضعيف يعمل على تحسين التنبؤ بالانشغال ثلاثي الأبعاد الديناميكي للقيادة الذاتية من خلال فصل الحركات الصلبة وغير الصلبة عبر بدائيات غاوس القابلة للتشوه، وتعزيز الاتساق الزمني عبر التقطير المُجزأ من نموذج تأسيسي رباعي الأبعاد.

Yang Gao, Wuyang Li, Po-Chien Luan, Alexandre Alahi2026-05-28
⚡ electrical engineering

Deep Learning Strain Estimation: Is Physics-Based Simulation the Solution?

تقترح هذه الورقة استراتيجية محاكاة جديدة قائمة على الفيزياء، معززة بفك الارتباط الحقيقي للبقع (speckle decorrelation) والتحسين التكراري، لتوليد مجموعة بيانات واقعية ضوئياً تمكن نماذج التعلم العميق من تحقيق تقدير فائق للتشوه العضلي القلبي عالمياً وإقليمياً، متجاوزةً بذلك دقة المعيار السريري الحالي.

Thierry Judge, Nicolas Duchateau, Andreas Østvik, Khuram Faraz, Anders Austlid Taskén, Sigve Karlsen, Thor Edvardsen, Ha (…)2026-05-28
💬 NLP

The Abstraction Gap in Vision-Language Causal Reasoning

تقدم هذه الورقة معيار CAGE ومنهجية المسبار المزدوج للكشف عن "فجوة تجريد" كبيرة حيث تولد معظم النماذج الرؤية-اللغوية تفسيرات مقبولة لغوياً ولكنها غير أمينة سببيّاً، مما يثبت أنه بينما توجد القدرة على الاستنتاج الأمين في بنيات معينة، إلا أنها لا تتحقق بشكل موثوق من خلال الضبط الدقيق القياسي.

Chinh Hoang, Mohammad Rashedul Hasan2026-05-28
🤖 machine learning

Bias Leaves a Gradient Trail: Label-Free Bias Identification via Gradient Probes on Concept Decompositions

تقدم هذه الورقة طريقةً لا تعتمد على الملصقات (label-free) وتُطبق بعد التدريب (post-hoc) لتحديد وتخفيف التحيزات الزائفة في النماذج الرؤيوية المجمدة، وذلك عبر تفكيك التنشيطات إلى مفاهيم قابلة للتفسير وترتيبها من خلال التفاعلات المتدرجة مع الأمثلة المصنفة خطأً، مما يؤدي إلى تحسين دقة أسوأ المجموعات دون الحاجة إلى إعادة التدريب أو ملصقات سمات إضافية.

Thomas Vitry, Kieran Edgeworth, Stefan Wermter, Jae Hee Lee2026-05-28
🤖 machine learning

{\Omega}-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling

تقدم الورقة البحثية Ω\Omega-QVLA، وهو إطار عمل للكمّ (quantization) ما بعد الكمّ لا يتطلب تدريباً، يُمكّن من إجراء كمّ منتظم من نوع W4A4 لنماذج الرؤية واللغة والعمل (Vision-Language-Action) بأكملها عبر الجمع بين تدوير SVD-Hadamard المركب وتوسيع تنشيط DiT لكل خطوة، محققاً معدلات نجاح في المهام هي الأفضل حالياً وتقليلاً كبيراً في الذاكرة في كل من الاختبارات المرجعية ومهام المعالجة في العالم الحقيقي.

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu2026-05-28
💬 NLP

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

تقدم هذه الورقة البحثية OmniVerifier-M1، وهو نموذج تحقق ميتا متعدد الوسائط يحقق تحققًا بصريًا قويًا وتصحيحًا ذاتيًا ديناميكيًا من خلال الاستفادة من المبررات الرمزية واستراتيجية التعلم المعزز المنفصلة للتفوق على نهج التحسين المشترك التقليدي.

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling (…)2026-05-28
💬 NLP

Personal Visual Memory from Explicit and Implicit Evidence

تقدم هذه الورقة معياراً للذاكرة البصرية الشخصية يستهدف كلاً من الأدلة الصريحة والضمنية، وتقترح VisualMem، وهي بنية هجينة تتفوق على الأنظمة الحالية التي تركز على النصوص من خلال الاستفيد بفعالية من المعلومات البصرية المهيكلة لتعزيز الذاكرة طويلة المدى لوكلاء الذكاء الاصطناعي المخصصين.

Viet Nguyen, Thao Nguyen, Vishal M. Patel, Yuheng Li2026-05-28