💻 computer science

DreamWorld: Unified World Modeling in Video Generation

تقدم DreamWorld إطار عمل موحداً يدمج المعرفة العالمية المتكاملة في توليد الفيديو من خلال نموذج نمذجة عالم مشترك، مستخدمةً تقنية التلدين القائم على القيود المتسقة والتوجيه الداخلي متعدد المصادر للتغلب على عدم الاستقرار البصري وتحقيق اتساق زمني ومكاني ودلالي فائق مقارنة بالنماذج الحالية.

Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue Yang, Qi Fan, Yanyong Zhang2026-03-03
🤖 machine learning

Benchmarking Few-shot Transferability of Pre-trained Models with Improved Evaluation Protocols

تقدم هذه الورقة FEWTRANS، وهو معيار شامل وبروتوكول تقييم تجميع المعلمات الفائقة (HPE) لتقييم تعلم النقل قليل العينات بصرامة، كاشفةً أن اختيار النماذج سابقة التدريب والضبط الدقيق لكامل المعلمات غالباً ما يتفوقان على أساليب التكيف المتطورة نظراً لقدرتهما على إجراء تعديلات دقيقة موزعة دون الوقوع في فخ الإفراط في التخصيص.

Xu Luo, Ji Zhang, Lianli Gao, Heng Tao Shen, Jingkuan Song2026-03-03
💻 computer science

U-VLM: Hierarchical Vision Language Modeling for Report Generation

تقدم الورقة البحثية نموذج U-VLM، وهو نموذج رؤية-لغة هرمي يجمع بين التدريب متعدد المراحل التصاعدي وحقن الميزات البصرية متعدد الطبقات لتحقيق أداء رائد في توليد التقارير الإشعاعية على التصوير الطبي ثلاثي الأبعاد، مما يثبت أن التدريب المسبق للمشفر المتخصص يمكن أن يتفوق على النماذج اللغوية الضخمة.

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang2026-03-03
🤖 machine learning

Analyzing Physical Adversarial Example Threats to Machine Learning in Election Systems

تقدم هذه الورقة إطاراً احتمالياً لتحديد عدد الأصوات المعادية المطلوبة لتغيير نتيجة انتخابات أمريكية، وتثبت تجريبياً من خلال 144,000 تجربة طباعة ومسح ضوئي فيزيائية أن الهجمات المعادية الأكثر فعالية في مجال التصويت الفيزيائي تختلف اختلافاً جوهرياً عن تلك الموجودة في المجال الرقمي.

Khaleque Md Aashiq Kamal, Surya Eada, Aayushi Verma, Subek Acharya, Adrian Yemin, Benjamin Fuller, Kaleel Mahmood2026-03-03
💻 computer science

COG: Confidence-aware Optimal Geometric Correspondence for Unsupervised Single-reference Novel Object Pose Estimation

تقدم هذه الورقة البحثية COG، وهو إطار عمل غير خاضع للإشراف لتقدير وضعية الأجسام الجديدة ذات المرجع الواحد، والذي يصيغ التوافق عبر الرؤى كمسألة نقل أمثل واعية بالثقة لتوليد مطابقات ناعمة قوية وتحقيق أداء يضاهي أو يتجاوز الطرق الخاضعة للإشراف.

Yuchen Che, Jingtu Wu, Hao Zheng, Asako Kanezaki2026-03-03
💻 computer science

M2^2: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval

تقترح الورقة البحثية إطار عمل M2^2، وهو إطار عمل ثنائي الذاكرة وخالٍ من التدريب يعزز وكلاء الويب ذوي الأفق الطويل عبر الجمع بين التلخيص الديناميكي للمسار لضغط الحالة الداخلية واسترجاع الرؤى غير المتصلة بالإنترنت للتوجيه الخارجي، محققاً تحسينات كبيرة في معدلات النجاح وكفاءة الرموز (tokens) عبر معايير قياسية متعددة.

Dawei Yan, Haokui Zhang, Guangda Huzhang, Yang Li, Yibo Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Ying Li, Wei Dong, Chu (…)2026-03-03
💻 computer science

Hierarchical Classification for Improved Histopathology Image Analysis

تقترح هذه الورقة إطار عمل HiClass، وهو إطار تصنيف هرمي قائم على تعلم الأمثلة المتعددة (multiple instance learning) يستخدم التكامل الميزاتي ثنائي الاتجاه ودوال فقدان مخصصة لتعزيز التصنيف خشن الحبيبات ودقيق الحبيبات لصور الشرائح الكاملة من خلال التقاط العلاقات الهرمية بين الملصقات النسيجية المرضية بفعالية.

Keunho Byeon, Jinsol Song, Seong Min Hong, Yosep Chong, Jin Tae Kwak2026-03-03
🤖 AI

What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models

تقدم هذه الورقة "EmbedLens" لتكشف أن النماذج اللغوية الكبيرة متعددة الوسائط تظهر تشتتًا وفائضًا كبيرين في الرموز المرئية، مما يثبت أن مجموعة فرعية فقط من الرموز "الحية" تحمل المعلومات الدلالية الجوهرية التي يمكن معالجتها بكفاءة عبر الحقن في الطبقة الوسطى بدلاً من الحوسبة الداخلية الكاملة.

Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen2026-03-03
💻 computer science

Jano: Adaptive Diffusion Generation with Early-stage Convergence Awareness

يعتبر Jano إطار عمل لا يتطلب تدريباً يعمل على تسريع نماذج محولات الانتشار (Diffusion Transformers) من خلال تحديد أنماط التقارب غير المتجانسة في مراحل إزالة الضجيج المبكرة وتطبيق جدولة رموز تكيفية لتحقيق تسريع يصل إلى 2.4 ضعفاً مع الحفاظ على جودة التوليد.

Yuyang Chen, Linqian Zeng, Yijin ZHou, Hengjie Li, Jidong Zhai2026-03-03