💻 computer science

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation

تقدم هذه الورقة البحثية NarrLV، وهو أول معيار شامل لتقييم نماذج توليد الفيديو الطويل من خلال تعريف "ذرات السرد الزمني" لقياس الثراء السردي واستخدام إطار عمل قائم على النماذج اللغوية الكبيرة متعددة الوسائط (MLLM) لتقييم التعبير السردي، مما يكشف عن قدرات النماذج الحالية وحدودها.

X. Feng, H. Yu, M. Wu, S. Hu, J. Chen, C. Zhu, J. Wu, X. Chu, K. Huang2026-03-09
💻 computer science

Tomato Multi-Angle Multi-Pose Dataset for Fine-Grained Phenotyping

تقدم هذه الورقة TomatoMAP، وهي مجموعة بيانات شاملة تضم 64,464 صورة لطماطم من زوايا ووضعيات متعددة مع تعليقات توضيحية مفصلة لسبعة مناطق اهتمام و50 مرحلة نمو، والتي تم التحقق منها لإثبات أن إطار التعلم العميق المتتالي يحقق دقة في التنميط الظاهري الدقيق وسرعة تضاهي الخبراء البشريين.

Yujie Zhang, Sabine Struckmeyer, Andreas Kolb, Sven Reichardt2026-03-09
💻 computer science

Gaussian Set Surface Reconstruction through Per-Gaussian Optimization

تقترح الورقة البحثية إعادة بناء سطح المجموعة الغاوسية (GSSR)، وهي طريقة تعمل على تحسين وضع ومحاذاة كل عنصر غاوسي على حدة لتحقيق إعادة بناء هندسي ثلاثي الأبعاد دقيق وتوزيع سطحي موحد، مما يتغلب على القيود الهندسية لمتغيرات تقنية "الغاوس سبلاتينج" (3D Gaussian Splatting) الحالية مع الحفاظ على جودة رندر عالية.

Zhentao Huang, Di Wu, Zhenbang He, Minglun Gong2026-03-09
🤖 AI

A Multi-Agent System Enables Versatile Information Extraction from the Chemical Literature

تقدم هذه الورقة نظاماً متعدد الوكلاء قائماً على نموذج لغوي كبير متعدد الوسائط يتفوق بشكل كبير على الأساليب الحالية المتطورة في استخراج المعلومات الكيميائية المهيكلة تلقائياً من الرسوم البيانية الأدبية المتنوعة والمعقدة، مما يعزز الأبحاث الكيميائية المدعومة بالذكاء الاصطناعي.

Yufan Chen, Ching Ting Leung, Bowen Yu, Jianwei Sun, Yong Huang, Linyan Li, Hao Chen, Hanyu Gao2026-03-09
🤖 AI

VLMQ: Token Saliency-Driven Post-Training Quantization for Vision-language Models

تقدم هذه الورقة البحثية VLMQ، وهو إطار عمل للكمّنة ما بعد التدريب مصمم لنماذج الرؤية واللغة يستفيد من عامل أهمية مدفوع بالتدرج لمعالجة التمثيل البصري المفرط وفجوات الأنماط، مما يحقق أداءً هو الأفضل في فئته عبر مختلف أحجام النماذج وإعدادات البت المنخفضة.

Yufei Xue, Yushi Huang, Jiawei Shao, Lunjie Zhu, Chi Zhang, Xuelong Li, Jun Zhang2026-03-09
💻 computer science

SSL-SLR: Self-Supervised Representation Learning for Sign Language Recognition

تقترح هذه الورقة البحثية إطار SSL-SLR، وهو إطار تعلم ذاتي التوجيه للتعرف على لغة الإشارة يعالج أوجه القصور في الطرق التباينية القياسية من خلال إدخال أزواج سلبية حرة وتقنية جديدة لتعزيز البيانات للتعامل بشكل أفضل مع تكرار الفيديو والحركات المشتركة، مما يحقق تحسينات كبيرة في الدقة عبر مختلف إعدادات التقييم.

Ariel Basso Madjoukeng, Jérôme Fink, Pierre Poitier, Edith Belise Kenmogne, Benoit Frenay2026-03-09
🤖 machine learning

C^2Prompt: Class-aware Client Knowledge Interaction for Federated Continual Learning

تقترح هذه الورقة البحثية C²Prompt، وهي طريقة تعلم مستمر اتحادية مبتكرة تخفف من النسيان الزماني والمكاني عبر إدخال آلية تعويض لتوزيع الفئات المحلية ومخطط تجميع محفز مدرك للفئات لتعزيز تماسك المعرفة لكل فئة عبر العملاء الموزعين.

Kunlun Xu, Yibo Feng, Jiangmeng Li, Yongsheng Qi, Jiahuan Zhou2026-03-09
🤖 AI

LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference

تقدم الورقة البحثية LikePhys، وهو أسلوب تقييم خالٍ من التدريب يستخدم تفضيلات الاحتمالية لتقييم فهم الفيزياء الحدسية في نماذج انتشار الفيديو، مما يظهر أن النماذج الحالية تظهر قدرات متطورة في الاستدلال الفيزيائي مع توسعها رغم التحديات المتعلقة بالديناميكيات المعقدة.

Jianhao Yuan, Fabio Pizzati, Francesco Pinto, Lars Kunze, Ivan Laptev, Paul Newman, Philip Torr, Daniele De Martini2026-03-09
🤖 AI

CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas

يعزز CanvasMAR التنبؤ بالفيديو عبر التوليد الذاتي التراجعي المقنع من خلال تقديم أولوية "لوحة" (canvas) عالمية ومنهج تعليمي مدرك للحركة لإنتاج فيديوهات عالية الدقة ومتماسكة بعدد أقل من خطوات أخذ العينات، محققاً أداءً يضاهي الأساليب المتقدمة القائمة على الانتشار.

Zian Li, Muhan Zhang2026-03-09
🤖 AI

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

تقدم الورقة البحثية 3DThinker، وهو إطار عمل مبتكر يُمكّن نماذج الرؤية واللغة من إجراء الاستدلال المكاني ثلاثي الأبعاد من خلال مشاهد محدودة عبر محاذاة تمثيلاتها الداخلية مع نموذج أساسي ثلاثي الأبعاد وتحسين عملية الاستدلال من خلال التحسين القائم على النتيجة، وكل ذلك دون الحاجة إلى مدخلات مسبقة صريحة ثلاثية الأبعاد أو بيانات تدريب ثلاثية الأبعاد مصنفة.

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai (…)2026-03-09