💬 NLP

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

تقترح الورقة البحثية VCap، وهي آلية مكافأة جديدة تعتمد على نظام "الشاهد-المُحكّم" تستفيد من دقة بمستوى التوزيع الهيبرجيومتري للتحقق من الاتساق الواقعي بين التعليقات المرجعية والمولدة، مما يتيح تعميماً من الضعيف إلى القوي في التعلم المعزز يسمح لنموذج بحجم 8 مليار بارامتر بالتفوق على أنظمة التعليق البصري الرائدة.

Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Ti (…)2026-05-28
💻 computer science

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

يُعد CogPortrait إطار عمل يتكون من مرحلتين يستفيد من وكلاء النماذج اللغوية الكبيرة متعددة الوسائط الهرمية لترجمة الملصقات عالية المستوى إلى نقاط مفتاحية دقيقة للوجه، مما يتيح تحكماً دقيقاً في ديناميكيات منطقة العين وحالات ما وراء العاطفة في رسوم صور البورتريه المتحركة مع الحفاظ على جودة بصرية عالية واتساق الهوية.

He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su2026-05-28
💻 computer science

Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models

تقدم هذه الورقة مقارنة منهجية بين نماذج الرؤية واللغة (VLMs) ونماذج توليد الفيديو (VGMs) فيما يتعلق بالذكاء المكاني، مما يكشف عن نقاط قوتهما المتكاملة في الفهم الدلالي مقابل الاستدلال الهندسي، ويُظهر أن دمج سماتهما يخلق عموداً فقرياً متفوقاً للمهام المكانية.

Haozhan Shen, Tiancheng Zhao, Kangjia Zhao, Jianwei Yin2026-05-28
💻 computer science

SAM-Enhanced Segmentation on Road Datasets: Balancing Critical Classes in Autonomous Driving

تقدم هذه الورقة خط أنابيب تعليق توضيحي يعتمد على نموذج SAM لتوليد تسميات كثيفة على مستوى البكسل من مجموعة بيانات Zenseact المفتوحة التي تقتصر على صناديق الإحاطة فقط، مما يتيح تقييم نماذج التجزئة التي تحقق ما يصل إلى 48.1% mIoU على مجموعة البيانات و77.5% mIoU على منصة Iseauto مع معالجة الاختلالات الحرجة في فئات توزيع البيانات في القيادة الذاتية.

Toomas Tahves, Mauro Bellone, Junyi Gu, Raivo Sell2026-05-28
🤖 machine learning

No Safe Dose: How Training Data Drives Unsafe Image Generation

تُظهر هذه الورقة أن نسبة الصور غير الآمنة في بيانات التدريب، وليس عددها المطلق، هي التي تقود بشكل مباشر وتزايدي المخرجات غير الآمنة في نماذج تحويل النص إلى صورة، مع بيان أن تصفية السلامة تُحسن سلامة النموذج دون تقليل جودة الصور، وأن المشفر النصي يساهم أيضاً بشكل كبير في المخاطر المتبقية.

Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting2026-05-28
💻 computer science

Intra-YOLO: A Small Object Detection Model for Caries and Molar-Incisor Hypomineralization in Intraoral Photography Based on Transfer Learning with Reinforcement Learning

تقدم هذه الدراسة نظام Intra-YOLO، وهو نظام تشخيص مبتكر بمساعدة الكمبيوتر يستفيد من التعلم بنقل الخبرة والتعلم المعزز للكشف بدقة عن تسوس الأسنان ونقص تمعدن الأنياب والقواطع الصغيرة والمتشابهة بصرياً في الصور داخل الفم.

Po-Lun Chwang, Po-Yu Chang, Wen-Liang Lin, Tung-Sheng Wu, Min-Ching Wang, Yun-Chien Cheng2026-05-28
💻 computer science

DebFilter: Eradicating Biases Stashed in Value

يُعد DebFilter إطار عمل خفيف الوزن ولا يتطلب تدريباً، يعمل على التخفيف من التحيزات الاجتماعية في نماذج الانتشار من النص إلى الصورة عن طريق تطبيق إزاحة ثابتة على مكونات قيم الانتباه المتقاطع أثناء الاستدلال، مما يوجه عملية التوليد نحو مخرجات غير متحيزة دون الحاجة إلى إعادة تدريب النموذج أو بيانات إضافية.

Seung Hyuk Lee, Songkuk Kim2026-05-28
🤖 AI

VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

يُعد VidPrism إطار عمل مبتكر لخليط الخبراء غير المتجانس يتغلب على تجانس الخبراء في التعلم بنقل الصور إلى الفيديو عبر نشر خبراء متخصصين وظيفياً يتم تغذيتهم بتدفقات متعددة المعدلات، ديناميكية ومدركة للمحتوى، ويتم دمجها عبر آلية ثنائية الاتجاه لتحقيق أداء رائد في التعرف على الفيديو.

Rui Lin, Chuanming Wang, Huadong Ma2026-05-28
💻 computer science

Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation

Proprio هو إطار عمل لا يتطلب تدريباً يعمل على تعزيز الواقعية الفيزيائية لمولدات الفيديو المجمدة من خلال الاستفادة من بقايا التدفق الداخلي لديها تحت تأثير الاضطرابات الكامنة كإشارة تقييم ذاتي للتحسين والاختيار أثناء وقت الاستنتاج.

Mariam Hassan, Kaouther Messaoud, Wuyang Li, Alexandre Alahi2026-05-28
💻 computer science

Learning to Label: A Reinforced Self-Evolving Framework for Semi-supervised Referring Expression Segmentation

تقترح هذه الورقة البحثية إطار عمل "التعلم من أجل التسمية" (L2L)، وهو إطار عمل معزز ذاتي التطور يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط للحصول على أولويات دلالية-مكانية، ويصيغ اختيار التسميات المستعارة كعملية اتخاذ قرار تكيفية لتحسين تقسيم التعبيرات المرجعية شبه الموجهة في ظل محدودية التوسيم.

Runlong Cao, Ying Zang, Chuanwei Zhou, Tianrun Chen, Tong Zhang, Zhen Cui, Chunyan Xu2026-05-28