💻 computer science

FineVision: Open Data Is All You Need

تقدم FineVision أكبر مجموعة بيانات مفتوحة مكونة من 24 مليون عينة من الرؤية واللغة منسقة بدقة، والتي تم إنشاؤها من خلال مسار شبه مؤتمت صارم يوحد أكثر من 200 مصدر مع إشراف بشري للقضاء على التلوث والتكرار، مما يمكن النماذج المدربة على هذه المجموعة من التفوق بشكل كبير على البدائل المفتوحة الحالية.

Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, And (…)2026-05-21
💻 computer science

Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization

تقدم هذه الورقة البحثية "تحسين سياسة تقسيم المجموعات" (GCPO)، وهو نهج جديد للتعلم المعزز على مستوى المجموعات (chunk-level) يعمل على التخفيف من عدم دقة إسناد الميزة في مطابقة التدفق عبر تجميع الخطوات المتتالية، مما يحقق مكاسب في الأداء تصل إلى 43% نسبيًا مقارنة بأسلوب "تحسين السياسة النسبية للمجموعات" (GRPO) القياسي في مهام توليد النصوص إلى صور.

Yifu Luo, Haoyuan Sun, Xinhao Hu, Penghui Du, Keyu Fan, Bo Li, Sinan Du, Xu Wan, Zhiyu Chen, Bo Xia, Tiantian Zhang, Yon (…)2026-05-21
💻 computer science

THEval. Evaluation Framework for Talking Head Video Generation

لمعالجة نقص مقاييس التقييم الكافية لتوليد فيديوهات الرؤوس المتحدثة، تقترح هذه الورقة إطار عمل جديدًا يتكون من ثمانية مقاييس فعالة عبر أبعاد الجودة، والطبيعية، والمزامنة، تم التحقق من صحتها على مجموعة بيانات جديدة و85,000 فيديو من 17 نموذجًا من أحدث النماذج المتطورة للكشف عن القيود الحالية في التعبير وتقليل العيوب الاصطناعية.

Nabyl Quignon, Baptiste Chopin, Yaohui Wang, Antitza Dantcheva2026-05-21
💻 computer science

Query-Calibrated Segmental Admission for Descriptor-Agnostic LiDAR Loop Closure in Repetitive Environments

تقدم هذه الورقة سياسة "القبول القطعي المعاير بالاستعلام" (QCSA)، وهي سياسة لإغلاق الحلقة غير مرتبطة بالواصفات تعمل على تعزيز استقرار مخطط الرسم البياسي للوضعية في البيئات المتكررة من خلال قبول عوامل إغلاق الحلقة عالية الثقة والمحققة هندسياً بشكل انتقائي، مما يقلل بشكل كبير من الإيجابيات الكاذبة وأخطاء المسار في أسوأ الحالات مع الحفاظ على الدقة الإجمالية.

Jaehyun Kim, Seungwon Choi, Wonseok Kang, Tae-Wan Kim2026-05-21
🤖 machine learning

Self-Refining Video Sampling

تقدم هذه الورقة البحثية "أخذ عينات الفيديو ذاتي التحسين" (Self-Refining Video Sampling)، وهي طريقة استدلال لا تتطلب تدريباً تستفيد من مولد فيديو مُدرب مسبقاً كمرشح لإزالة الضجيج (denoising autoencoder) خاص به مع استراتيجية واعية بعدم اليقين لتحسين المخرجات بشكل تكراري، مما يحسن بشكل كبير من تماسك الحركة والواقعية الفيزيائية دون الحاجة إلى مُحققات خارجية أو تدريب إضافي.

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Saining Xie, Jaehong Yoon, Sung Ju Hwang2026-05-21
💻 computer science

Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution

تقدم هذه الورقة Q-DiT4SR، وهو أول إطار عمل للكمّ ما بعد التدريب مصمم خصيصاً لترقية دقة الصور في العالم الحقيقي القائمة على نماذج DiT، والذي يستخدم تحليل القيم المفردة (SVD) الهرمي والدقة المختلطة المكانية-الزمانية المدركة للتباين لتحقيق أداء رائد مع تقليل حجم النموذج والتكلفة الحسابية بشكل كبير.

Xun Zhang, Kaicheng Yang, Hongliang Lu, Haotong Qin, Yong Guo, Yulun Zhang2026-05-21
💻 computer science

Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing

تقدم الورقة البحثية ParaX، وهي طريقة لضبط النماذج الرؤيوية بكفاءة في المعلمات، تستخدم آلية توجيه ديناميكية للمعلمات لتوليد مصفوفات أوزان منخفضة الرتبة تعتمد على المدخلات من مراكز خبراء مشتركة، مما يعزز تنوع الميزات والأداء عبر مهام التنبؤ الكثيف المعقدة.

Meng Lou, Stanley Yu, Yizhou Yu2026-05-21
💻 computer science

Zero-Shot Satellite Image Retrieval through Joint Embeddings: Application to Crisis Response

تقدم الورقة البحثية GeoQuery، وهو نظام لاسترجاع صور الأقمار الصناعية بنمط "التعلم الصفري" (zero-shot)، يعمل على الربط بين الاستعلامات باللغة الطبيعية وبيانات مراقبة الأرض من خلال محاذاة التضمينات النصية لمجموعة بيانات وسيطة مع التضمينات البصرية المجمدة من نموذج CLAY، مما يتيح بحثاً فعالاً للاستجابة للأزمات دون الحاجة إلى بيانات تدريب مقترنة واسعة النطاق.

James Walsh, William Fawcett, Grace Colverd, Raúl Ramos-Pollán2026-05-21
💻 computer science

ProDG: Prototypes for Data-Free Generative Post-Hoc Explainability

تقدم هذه الورقة ProDG، وهو إطار عمل جديد خالٍ من البيانات يستفيد من النماذج التوليدية لتخليق نماذج أولية بصرية عالية الدقة مباشرة من أوزان النماذج المجمدة، مما يتيح قابلية تفسير قوية لما بعد الحدوث للمجالات الحساسة للخصوصية دون الحاجة إلى الوصول إلى أي بيانات خارجية.

Piotr Borycki, Magdalena Trędowicz, Jacek Tabor, Łukasz Struski, Przemysław Spurek2026-05-21
💻 computer science

DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos

إن DeformMaster هو نموذج عالم فيزيائي-عصبي تفاعلي يتعلم من فيديوهات العالم الحقيقي لمحاكاة الأجسام القابلة للتشوه عبر توحيد الديناميكيات الفيزيائية والمظهر عالي الدقة، مما يتيح التنبؤ المستقبلي الدقيق، وتوليد استجابات حركية جديدة، وتخليق مشاهد ديناميكية من زوايا رؤية مختلفة.

Can Li, Zhoujian Li, Ren Li, Jie Gu, Lei Lei, Jingmin Chen, Lei Sun2026-05-21