💬 NLP

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

تُعد ReGATE إطار عمل قائم على نموذج المعلم والطالب يعمل على تسريع تدريب النماذج اللغوية الكبيرة متعددة الوسائط من خلال تقليم الرموز الزائدة بشكل تكيفي باستخدام خسائر التوجيه وتقديرات الصعوبة، مما يحقق تقارباً أسرع وأداءً فائقاً مع تقليل إجمالي استهلاك الرموز بشكل كبير.

Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli2026-04-30
💻 computer science

Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection

تقترح هذه الورقة إطار عمل جديداً للكشف عن الشذوذ في الفيديو بنمط "التعلم الصفري" (zero-shot)، والذي يستفيد من النمطية الدلالية الموجهة لغوياً وتحليل تفرد السياق في وقت الاختبار على بيانات الهيكل العظمي لتحقيق أفضل قدر من التعميم عبر مشاهد مراقبة متنوعة دون الحاجة إلى عينات تدريب من المجال المستهدف.

Canhui Tang, Sanping Zhou, Haoyue Shi, Le Wang2026-04-30
💻 computer science

Towards Redundancy Reduction in Diffusion Models for Efficient Video Super-Resolution

تقترح الورقة البحثية نموذج OASIS، وهو نموذج انتشار أحادي الخطوة فعال لرفع دقة الفيديو في العالم الحقيقي، يستخدم توجيه تخصص الانتباه واستراتيجية تدريب تدريجية لتقليل التكرار، والحفاظ على المعرفة المسبقة، وتحقيق أداء رائد مع تسريع بمقدار 6.2 ضعفاً مقارنة بالنماذج المرجعية الحالية.

Jinpei Guo, Yifei Ji, Shengwei Wang, Zheng Chen, Yufei Wang, Sizhuo Ma, Yong Guo, Baiang Li, Jusheng Zhang, Yulun Zhang (…)2026-04-30
💻 computer science

SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design

يُعد SkyReels-Text إطار عمل مبتكرًا لا يتطلب تدريبًا، يتيح تحريرًا دقيقًا للنصوص في تصميمات الملصقات مع التحكم في الخط، وذلك من خلال السماح للمستخدمين بتحديد طباعة مخصصة عبر رقع الخطوط (glyph patches)، مما يحقق أداءً رائدًا في كل من دقة النص والواقعية البصرية دون الحاجة إلى تسميات الخطوط أو الضبط الدقيق.

Yunjie Yu, Jingchen Wu, Junchen Zhu, Chunze Lin, Guibin Chen2026-04-30
🤖 AI

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

إن إنفيريكس (Inferix) هو محرك استدلال من الجيل التالي مصمم لتمكين محاكاة العوالم الغامرة عبر الاستفåدة من نموذج الانتشار الكتلي شبه التلقائي الذي يدمج تخزين الـ KV المؤقت بأسلوب النماذج اللغوية الكبيرة (LLM) لتوليد فيديو طويل المدى عالي الجودة وتفاعلي وفعال، مما يميز نفسه عن الأنظمة الحالية ذات التزامن العالي ونماذج الانتشار التقليدية.

Inferix Team, Tianyu Feng, Yizeng Han, Jiahao He, Yuanyu He, Xi Lin, Teng Liu, Hanfeng Lu, Jiasheng Tang, Wei Wang, Zhiy (…)2026-04-30
💻 computer science

Contrastive Heliophysical Image Pretraining for Solar Dynamics Observatory Records

تقدم الورقة البحثية SolarCHIP، وهي عائلة من النماذج الخلفية البصرية المدربة بالتعلم التبايني والمصممة خصيصاً لبيانات مرصد ديناميات الشمس متعددة الأدوات، والتي تعالج تحديات التصوير الشمسي الفريدة من خلال هدف متعدد المستويات، محققةً أداءً هو الأفضل في فئته في الترجمة عبر الوسائط وتصنيف التوهجات مع تحسين كفاءة الملصقات بشكل كبير.

Shiyu Shen, Zhe Gao, Taifeng Chai, Yang Huang, Bin Pan2026-04-30
🤖 AI

Value-Guided Iterative Refinement and the DIQ-H Benchmark for Evaluating VLM Robustness

تقدم هذه الورقة المعيار المرجعي DIQ-H، وهو الأول من نوعه لتقييم نماذج الرؤية واللغة تحت ظروف بصرية معادية مستمرة لتقييم انتشار الخطأ وعدم توافق القيم، إلى جانب إطار عمل التكرار التكراري الموجه بالقيم (VIR) الذي يعمل على أتمتة توليد الحقيقة الأرضية المتوافقة أخلاقياً لتحسين دقة التوسيم بشكل كبير للتطبيقات الحرجة للسلامة.

Hanwen Wan, Zexin Lin, Yixuan Deng, Xiaoqiang Ji2026-04-30
🤖 AI

Consist-Retinex: One-Step Noise-Emphasized Consistency Training Accelerates High-Quality Retinex Enhancement

تقترح الورقة البحثية Consist-Retinex، وهو إطار عمل توليدي من خطوة واحدة يعمل على تسريع تعزيز الصور منخفضة الإضاءة القائم على نموذج Retinex بجودة عالية عبر تفكيك الصور إلى مكونات الانعكاس والإضاءة وتدريب نماذج اتساق شرطية باستخدام هدف مزدوج مبتكر واستراتيجية أخذ عينات معززة بالضجيج لضمان استقرار وكفاءة الاستدلال العالية تحت قيود زمن الاستجابة الصارمة.

Jian Xu, Wei Chen, Shigui Li, Delu Zeng, John Paisley, Qibin Zhao2026-04-30
💻 computer science

Perception Test 2025: Challenge Summary and a Unified VQA Extension

تلخص هذه الورقة نتائج تحدي "اختبار الإدراك 2025" (Perception Test 2025)، الذي قيّم نماذج الفيديو متعددة الوسائط المتطورة بناءً على معيار مرجعي موحد يضم مسارات مدمجة مثل الإجابة الموحدة عن الأسئلة المرئية وتتبع الفيديو، وذلك لتسليط الضوء على الصعوبات الكبيرة التي تواجهها النماذج الحالية عند معالجة مهام الإدراك المتنوعة من خلال واجهة واحدة.

Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Vioric (…)2026-04-30
🤖 AI

Bridging Visual and Wireless Sensing via a Unified Radiation Field for 3D Radio Map Construction

يقدم هذا المقال URF-GS، وهو إطار عمل موحد يستفيد من تقنية الـ 3D Gaussian Splatting والتحويل العكسي (inverse rendering) لدمج البيانات المرئية واللاسلكية من أجل إنشاء خرائط راديو ثلاثية الأبعاد عالية الدقة، والتي تحسن دقة الطيف المكاني وكفاءة أخذ العينات بشكل كبير مقارنة بالطرق الحالية القائمة على NeRF.

Chaozheng Wen, Jingwen Tong, Zehong Lin, Chenghong Bian, Jun Zhang2026-04-30