🤖 AI

Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation

تقدم الورقة البحثية Memoir، وهو إطار عمل مبتكر للملاحة القائمة على الرؤية واللغة ذات الذاكرة المستمرة، والذي يستخدم آلية استرجاع موجهة بالخيال للوصول الانتقائي إلى كل من الملاحظات البيئية والأنماط السلوكية، محققاً مكاسب كبيرة في الأداء، وتدريباً أسرع، وتقليلاً في استخدام الذاكرة مقارنة بالنماذج المرجعية الحالية.

Yunzhe Xu, Yiyuan Pan, Zhe Liu2026-03-31
🤖 AI

SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion

تقدم هذه الورقة SceneAdapt، وهو إطار عمل للتكيف يتكون من مرحلتين يستفيد من عملية استكمال الحركة (motion inbetweening) وطبقات معمارية مبتكرة (CaKey وSceneCo) لتمكين توليد حركة بشرية واعية بالمشهد ومتنوعة دلالياً من النصوص دون الحاجة إلى مجموعات بيانات ضخمة ومزدوجة من (النص-المشهد-الحركة).

Jungbin Cho, Minsu Kim, Jisoo Kim, Ce Zheng, Laszlo A. Jeni, Ming-Hsuan Yang, Youngjae Yu, Seonjoo Kim2026-03-31
💻 computer science

DOS: Directional Object Separation in Text Embeddings for Multi-Object Image Generation

تقترح الورقة البحثية طريقة DOS (الفصل الاتجاهي للأجسام)، وهي طريقة تعدل تضمينات نص CLIP للتخفيف بفعالية من إهمال الأجسام واختلاطها في توليد الصور من النصوص متعددة الأجسام، متفوقة بشكل كبير على النهج الحالية عبر العديد من المعايير المرجعية.

Dongnam Byun, Jungwon Park, Jungmin Ko, Changin Choi, Wonjong Rhee2026-03-31
🤖 AI

MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding

إن MMEdge هو إطار عمل مبتكر للاستدلال متعدد الوسائط على الأجهزة، يعمل على تسريع المعالجة في الوقت الفعلي على أجهزة الحافة ذات الموارد المحدودة من خلال توظيف الاستشعار والترميز المتسلسلين، وتحسين التكوين التكيفي، والتخطي التخميني عبر الوسائط لتقليل زمن الانتقال من البداية إلى النهاية بشكل كبير مع الحفاظ على دقة عالية.

Runxi Huang, Mingxuan Yu, Mingyu Tsoi, Xiaomin Ouyang2026-03-31
💻 computer science

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

تتناول هذه الورقة البحثية عقبة التعميم في توليد حركة البشر ثلاثية الأبعاد من خلال تقديم إطار عمل شامل ينقل المعرفة من توليد الفيديو عبر مجموعة بيانات هجينة واسعة النطاق (ViMoGen-228K)، ومحول انتشار مطابقة التدفق الموحد (ViMoGen)، ومعيار تقييم هرمي (MBench).

Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhon (…)2026-03-31
🤖 machine learning

From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training

تقترح هذه الورقة إطار عمل مبتكرًا لتحسين الإنتروبيا على مستوى الرمز (token-level) يتكون من مرحلتين للتعلم التعزيزي مع المكافآت القابلة للتحقق (RLVR) في النماذج اللغوية الكبيرة متعددة الوسائط، والذي ينتقل ديناميكيًا من تعظيم الإنتروبيا إلى تقليلها، مما يمنع بفعالية الإفراط في التخصيص (overfitting) للبيانات المسمومة (noisy labels) ويعزز موثوقية إشارة المكافأة لتحقيق أداء فائق عبر مختلف النماذج والمهام.

Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Se (…)2026-03-31
🤖 AI

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

تقدم هذه الورقة SciEGQA، وهو عبارة عن مجموعة بيانات مبتكرة تتميز بكل من معيار دقيق مشروح بشرياً ومجموعة تدريب واسعة النطاق مؤتمتة ذات مناطق أدلة مبررة دلالياً، مصممة لتعزيز قدرات تحديد موقع الأدلة والاستدلال العلمي لنماذج الرؤية واللغة في مجال الإجابة على الأسئلة المرئية للوثائق.

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang2026-03-31
💻 computer science

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

يُعد SPECTRE نموذجاً تأسيسياً قابلاً للتوسع وقائماً بالكامل على تقنية المحولات (Transformer) للتصوير المقطعي المحوسب الحجمي، حيث يستفيد من التدريب المسبق ذاتي الإشراف والتدريب المسبق القائم على الرؤية واللغة على مجموعات بيانات مفتوحة للتغلب على تحديات التصوير ثلاثي الأبعاد وتحقيق أداء رائد في كل من مهام التصوير الطبي بنمط التعلم الصفري والمهام التي تم ضبطها بدقة.

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen2026-03-31
🤖 machine learning

AVERY: Intent-Driven Adaptive VLM Split Computing via Embodied Self-Awareness for Efficient Disaster Response Systems

إن AVERY هو إطار عمل للحوسبة المنقسمة التكيفية القائم على النوايا، والذي يتيح نشر نماذج الرؤية واللغة بكفاءة على الطائرات بدون طيار ذات الموارد المحدودة للاستجابة للكوارث، وذلك من خلال تقسيم الحوسبة ديناميكياً إلى مسارات "سياق" (Context) و"بصيرة" (Insight) وظيفية بناءً على نية المشغل وظروف الشبكة، مما يحقق دقة عالية واستهلاكاً منخفضاً للطاقة في البيئات غير المستقرة.

Rajat Bhattacharjya, Sing-Yao Wu, Hyunwoo Oh, Chaewon Nam, Suyeon Koo, Mohsen Imani, Elaheh Bozorgzadeh, Nikil Dutt2026-03-31
💻 computer science

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

يقدم InternVideo-Next إطار عمل تدريب مسبق جديد ثنائي المراحل يفكك تصميم المشفر-المفكك إلى بنية (مشفر-متنبئ-مفكك) مع مفكك انتشار شرطي للتغلب على قيود إعادة البناء على مستوى البكسل والتعلم المختصر، مما يحقق أداءً هو الأفضل في حالته في تعلم تمثيل الفيديو العام دون الاعتماد على الإشراف النصي للفيديو المشوب بالضجيج.

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang2026-03-31