💬 NLP

Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation

تقترح الورقة البحثية "القرار التخميني" (Speculative Verdict - SV)، وهو إطار عمل لا يتطلب تدريباً يعزز الاستدلال البصري كثيف المعلومات من خلال الجمع بين عدة خبراء مسودة خفيفين لمرشحي التوطين المتنوعين مع نموذج قرار قوي للتوليف، مما يحقق دقة وكفاءة محسنتين في الاختبارات المعيارية الصعبة دون تدريب إضافي.

Yuhan Liu, Lianhui Qin, Shengjie Wang2026-03-02
💻 computer science

Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues

تقدم هذه الورقة آلية تجميع الميزات الانتباهية (AFA)، وهي آلية تجميع خفيفة الوزن تعزز متانة السياسات البصرية الحركية المدربة باستخدام تمثيلات بصرية مسبقة التدريب من خلال التعلم كيفية الانتباه انتقائياً للإشارات ذات الصله بالمهمة مع تجاهل المشتتات البصرية، مما يؤدي إلى تفوقها على النهج القياسية في البيئات المضطربة دون الحاجة إلى تعزيز بيانات مكلف أو ضبط دقيق للنموذج.

Nikolaos Tsagkas, Andreas Sochopoulos, Duolikun Danier, Sethu Vijayakumar, Alexandros Kouris, Oisin Mac Aodha, Chris Xia (…)2026-03-02
🤖 AI

Score-Regularized Joint Sampling with Importance Weights for Flow Matching

تقترح هذه الورقة إطار عمل لأخذ عينات مشترك منظم بالدرجة مع ترجيح الأهمية، والذي يولد عينات متنوعة وعالية الجودة من نماذج مطابقة التدفق لتمكين التقدير الدقيق للتوقعات في ظل ميزانيات أخذ عينات محدودة.

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Truong Nguyen2026-03-02
🤖 AI

General vs Domain-Specific CNNs: Understanding Pretraining Effects on Brain MRI Tumor Classification

تُظهر هذه الدراسة أنه بالنسبة لتصنيف أورام الدماغ باستخدام بيانات رنين مغناطيسي محدودة، فإن الشبكات العصبية التلافيفية الحديثة عامة الأغراض والمُدربة مسبقاً على مجموعات بيانات ضخمة ومتنوعة (وتحديداً ConvNeXt-Tiny) تتفوق على النماذج المتخصصة في المجال الطبي والمُدربة مسبقاً (RadImageNet DenseNet121)، مما يتحدى الافتراض بأن التدريب المسبق الخاص بنطاق معين يؤدي دائماً إلى نتائج متفوقة في سيناريوهات التصوير الطبي شحيحة البيانات.

Helia Abedini, Saba Rahimi, Reza Vaziri2026-03-02
🤖 AI

SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

يقدم SocialNav نموذجاً تأسيسياً هرمياً للملاحة المتجسدة الواعية اجتماعياً، تم تدريبه على مجموعة بيانات ضخمة تضم 7 ملايين عينة وعلى إطار عمل مبتكر لاستكشاف التدفق الواعي اجتماعياً (Socially-Aware Flow Exploration) باستخدام تعزيز سياسة المجموعات من الدرجة الأولى (GRPO) لتحقيق أداء رائد في كل من نجاح الملاحة والامتثال الاجتماعي.

Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Kuan Yang, Pei Shi (…)2026-03-02
🤖 AI

FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models

تقدم هذه الورقة FRIEDA، وهو معيار صارم لتقييم الاستدلال الكارتوغرافي متعدد الخطوات في النماذج اللغوية البصرية الكبيرة، كاشفةً عن فجوة أداء كبيرة بين الأنظمة الحالية المتطورة والقدرات البشرية في تفسير العلاقات المكانية المعقدة عبر صور الخرائط.

Jiyoon Pyo, Yuankun Jiao, Dongwon Jung, Zekun Li, Leeje Jang, Sofia Kirsanova, Jina Kim, Yijun Lin, Qin Liu, Junyi Xie (…)2026-03-02
🤖 AI

Geometric-Photometric Event-based 3D Gaussian Ray Tracing

تقترح هذه الورقة إطار عمل جديد لتقنية "Gaussian Splatting" ثلاثية الأبعاد القائمة على الأحداث، والذي يفصل بين رندرة الهندسة ورندرة الإشعاع إلى فرعين، أحدهما يعتمد على الحدث تلو الآخر والآخر يعتمد على اللقطات، وذلك لتحقيق إعادة بناء ثلاثية الأبعاد رائدة وخالية من المسبقات ذات دقة زمنية عالية وتفاصيل حواف حادة.

Kai Kohyama, Yoshimitsu Aoki, Guillermo Gallego, Shintaro Shiba2026-03-02
💻 computer science

Inference-time Physics Alignment of Video Generative Models with Latent World Models

تقدم هذه الورقة البحثية WMReward، وهو أسلوب محاذاة أثناء الاستدلال يستفيد من نموذج عالم كامن (VJEPA-2) كإشارة مكافأة لتوجيه مسارات توليد الفيديو، مما يحسن بشكل كبير من واقعية الفيزياء عبر مختلف إعدادات التكييف ويحصد المركز الأول في تحدي PhysicsIQ Perception Test في مؤتمر ICCV 2025.

Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich, Nicolas Beltran-Velez, Melissa Hall, Reyhane Askari-Hemmat, Xiaochuang Ha (…)2026-03-02
💻 computer science

CPiRi: Channel Permutation-Invariant Relational Interaction for Multivariate Time Series Forecasting

تُعد CPiRi إطار عمل مبتكر للتنبؤ بالسلاسل الزمنية متعددة المتغيرات يجمع بين بنية فك الارتباط المكاني والزماني والتنظيم غير المعتمد على الترتيب لتجاوز قيود النماذج الحالية المعتمدة والمستقلة على القنوات، محققةً أداءً رائدًا، ومتانةً تجاه إعادة ترتيب القنوات، وتعميمًا استقرائيًا قويًا على القنوات غير المرئية.

Jiyuan Xu, Wenyu Zhang, Xin Jing, Shuai Chen, Shuai Zhang, Jiahao Nie2026-03-02
💻 computer science

PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion

يُعد PixelRush إطار عمل مبتكرًا لا يتطلب تدريبًا، ويحقق توليد صور فائق السرعة وعالي الدقة من خلال تمكين إزالة الضجيج القائم على الرقع بكفاءة في خطوة واحدة، مما يقلل وقت إنشاء صور بدقة 4K من دقائق إلى حوالي 20 ثانية مع الحفاظ على جودة بصرية متفوقة.

Hong-Phuc Lai, Phong Nguyen, Anh Tran2026-03-02