💻 computer science

MiniWorld: Democratizing the Training of Video World Models from Scratch

تقدم الورقة البحثية MiniWorld، وهو إطار عمل خفيف الوزن وقابل لإعادة الإنتاج بالكامل يتيح التدريب من البداية لنماذج عالم الفيديو المتدفقة من طرف إلى طرف باستخدام موارد حوسبة متواضعة عبر الاستفادة من محول انتشار فيديو سببي كتلوي مع مطابقة التدفق واستراتيجيات استدلال محسنة.

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen2026-08-04
💻 computer science

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity

تقدم هذه الورقة FeDepth، وهو إطار عمل للتعلم الاتحادي القائم على الوصفات، والذي يستخدم التجميع الناعم لنمذجة الانتقالات النطاقية المستمرة عبر منصات الروبوت غير المتجانسة، مما يحسن بشكل كبير من متانة تقدير العمق مقارنة بطرق التعلم الاتحادي القياسية وطرق التجميع الصلب.

Ganghyeon Lee, Inha Lee, Junhee Lee, Jeongeon Lee, Sung Whan Yoon, Kyungdon Joo2026-08-04
💬 NLP

UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering

يُعد UniHEAR إطار عمل موحداً وخفيف الوزن يتغلب على قيود الاسترجاع أحادي المصدر وإعادة التصنيف غير المعتمد على المصدر في مجال الإجابة على الأسئلة البصرية القائمة على المعرفة، وذلك من خلال توظيف واصف استرجاع خشن، وبوابة نمطية انتباهية موجهة بالاسترجاع، ودمج مصادر مرجح بالإنتروبيا لتحقيق أداء رائد في معايير E-VQA وInfoSeek.

Ganzhong Luo, Yang Ren, Hanyong Wang, Shuyu Zheng, Menglong Yang2026-08-04
💻 computer science

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

تقدم الورقة البحثية InteracVid، وهو أول مجموعة بيانات مفتوحة المصدر واسعة النطاق تضم أكثر من 454,000 ثلاثية (سياق-استعلام-استجابة) مستخرجة من فيديوهات الدردشة المباشرة، والتي توفر الإشراف الهيكلي التفاعلي الحاسم اللازم لتدريب النماذج متعددة الوسائط على توليد استجابات سمعية بصرية طبيعية وسببية للمحفزات الخارجية للمستخدمين.

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu2026-08-04
🤖 AI

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

تُظهر هذه الورقة أنه بينما يبدو أن الاختيار القائم على الاضطراب (Pgs) يتفوق على التصويت بالأغلبية في توسيع نطاق اختبار الرؤية واللغة، فإن مكاسبه الظاهرة هي إلى حد كبير نتاج لتنسيقات فك التشفير غير المنضبطة، حيث يكشف التحكم المتوافق مع التنسيق أن اتساق الاضطراب وحده ليس إشارة اختيار موثوقة بمجرد محاذاة ميزانيات وتنسيقات فك التشفير بشكل صحيح.

Puzhuo Zheng, Hasan Kurban2026-08-04
💻 computer science

From Forest to Future Capital: Tracking Land Cover Change in Ibu Kota Nusantara (IKN) from 2021 to 2026 with PlanetScope Imagery

تكشف هذه الدراسة، باستخدام صور الأقمار الصناعية من "PlanetScope" والمؤشرات الطيفية من عام 2021 إلى 2026، أن تطوير العاصمة الجديدة لإندونيسيا، IKN، قد أدى إلى توسع في المناطق العمرانية بنسبة 672% وانخفاض في الغطاء النباتي بنسبة 18.1%، مما يؤكد على المقايضات البيئية الحرجة لرؤية "مدينة الغابة" مع إثبات أهمية الاستشعار عن بعد كأداة حيوية لمراقبة التحول الحضري واسع النطاق.

Clarissa Rui Min Ong, Elizabeth Tee Inn Loo, Kenneth Woon Hao Soh, William Rachmadi, Qiming Zheng, Hao Li2026-08-04
💻 computer science

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

تقدم هذه الورقة البحثية "أولويات مسار هيرميت" (Hermite trajectory priors) لتمثيل كتل الأفعال (action chunks) كمنحنيات تكعيبية مجزأة وسلسة، مما يثبت أن فرض السلاسة والاستمرارية صراحةً من خلال "تنظيم هيرميت" (Hermite Regularization) يحسن بشكل كبير معدلات النجاح لنماذج "الرؤية واللغة والأفعال" (Vision-Language-Action models) في كل من مهام المحاكاة والروبوتات الحقيقية عبر العمل كتحيز استقرائي فعال للتعلم.

Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng2026-08-04
🤖 AI

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

تقترح الورقة البحثية **ONCE**، وهو إطار عمل إضافي لضغط الرموز المرئية (video tokens) يقوم بنقل عملية الضغط المكلفة إلى مرحلة ما قبل التشغيل (offline) عبر تعلم كتاب رموز عالمي مدرك للتردد لمرة واحدة، مما يتيح ضغطاً فورياً (online) فعالاً ومستقلاً عن النموذج يقلل بشكل كبير من زمن انتقال الاستدلال مع الحفاظ على أداء تنافسي عبر معايير فهم الفيديو.

Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song2026-08-04
💻 computer science

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

يُعد Remember-R1 إطار عمل للتعلم المعزز يعمل على التخفيف من حدة النسيان البصري في سياقات النصوص الطويلة في النماذج اللغوية الكبيرة متعددة الوسائط، وذلك عبر تطبيق الإشراف على مستوى العمليات لتشجيع الاستخدام المستمر للأدلة البصرية طوال مسارات الاستدلال المعقدة.

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia (…)2026-08-04