💻 computer science

Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models

تقترح هذه الورقة إطار عمل HFRU، وهو إطار لنسيان التعزيز يعمل على مشفر الرؤية باستخدام تحسين قائم على GRPO ومكافأة تجريد لتحقيق نسيان دلالي عميق للمعرفة الحساسة في نماذج الرؤية واللغة مع منع هلوسة الأشياء بفعالية.

Kaidi Jia, Yujie Lin, Chengyi Yang, Jiayao Ma, Jinsong Su2026-05-12
💻 computer science

MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation

يُعد MoCoTalk إطار عمل جديد لانتشار الفيديو متعدد الشروط يحقق أداءً فائقاً في توليد الرؤوس المتحدثة القابلة للتحكم من خلال توحيد ملامح الهوية، والوضعية، والتعبيرات، وإشارات الصوت عبر موجه متعدد الشروط تكيفي وشبكة تظليل معززة للفم متخصصة لحل التداخل وتعزيز المحاذاة السمعية البصرية.

Xinyan Ye, Jiankang Deng, Abbas Edalat2026-05-12
🤖 AI

Benchmarking ResNet Backbones in RT-DETR: Impact of Depth and Regularization under environmental conditions

تُقارن هذه الدراسة أداء نموذج RT-DETR مع مختلف هياكل ResNet الخلفية في ظل ظروف بيئية روبوتية تنافسية، كاشفةً أن النماذج ذات العمق المتوسط مثل ResNet50 وResNet34 توفر التوازن الأمثل بين الدقة والثقة وزمن الاستجابة اعتماداً على ما إذا كان التحدي الرئيسي يكمن في تباين الإضاءة أو تباين الخلفية.

Pamela Barboza, Víctor Castelli, Belén Pereira, Ricardo Grando, Bruna de Vargas, Augusto Calfani2026-05-12
🤖 machine learning

Reasoning emerges from constrained inference manifolds in large language models

تقترح هذه الورقة أن الاستدلال في النماذج اللغوية الكبيرة هو عملية ديناميكية جوهرية تحكمها قيود هندسية ومعلوماتية، حيث لا ينبثق الأداء الفعال إلا عندما تنظم ديناميكيات الاستدلال الداخلي نفسها ذاتياً في متشعبات منخفضة الأبعاد تحافظ على حجم معلوماتي غير متحلل، مما يتيح إطاراً تشخيصياً جديداً خالياً من التسميات.

Yanbiao Ma, Fei Luo, Linfeng Zhang, Chuangxin Zhao, Mingxuan Wang, Yinan Wu, Zhe Qian, Yang Lu, Long Chen, Zhao Cao, Xia (…)2026-05-12
🤖 machine learning

NoiseRater: Meta-Learned Noise Valuation for Diffusion Model Training

يُعد NoiseRater إطار عمل للتعلم الميتافيزيقي يعمل على تحسين كفاءة تدريب نماذج الانتشار وجودة التوليد من خلال تقديم مُقيّم ضجيج بارامتري لتعيين درجات أهمية على مستوى العينة لتمثيلات الضجيج، مما يتيح إعادة الوزن التكيفي وإعطاء الأولوية لعينات الضجيج المعلوماتية.

Fang Wu, Haokai Zhao, Da Xing, Hanqun Cao, Tinson Xu, Yanchao Li, Xiangru Tang, Zehong Wang, Aaron Tu, Kuan Pang, Hanche (…)2026-05-12
🤖 AI

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

تقترح هذه الورقة إطار عمل للتعليق التلقائي يتضمن بوابة تفاعل متعددة الوسائط لتحويل المعلومات الفريدة لكل نمط إلى معلومات مشتركة زائدة، مما يقلل بشكل كبير من الهلوسة ويعزز متانة النماذج اللغوية البصرية ضد المدخلات الفاسدة.

Yuriel Ryan, Hei Man Ip, Adriel Kuek, Paul Pu Liang, Roy Ka-Wei Lee2026-05-12
🤖 AI

LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment

يُعد LAGO إطار عمل قويًا للمحاذاة البصرية النصية بنمط "التعلم الصفري" (zero-shot)، حيث يعمل على تحسين التعرف الدقيق من خلال إنشاء تهيئة مستقرة متمحورة حول الكائنات أولاً، ثم تطبيق صقل موجه لغويًا يتسم بالتكيف والتحكم في الثقة لتجنب حلقات التنبؤ التي تضخم الأخطاء، مع تجميع الأدلة متعددة المستويات بكفاءة باستخدام عدد أقل من المناطق المرشحة.

Junyi Hu, Qiji Zhou, Lei Zhang, Yue Zhang2026-05-12
🤖 AI

WATCH: Wide-Area Archaeological Site Tracking for Change Detection

تقدم الورقة البحثية WATCH، وهو إطار عمل قابل للتوسع يستفيد من صور الأقمار الصناعية وتضمينات النماذج التأسيسية لتحديد الاضطرابات على مستوى الأشهر بفعالية عبر آلاف المواقع الأثرية، مما يثبت أن الطرق الزمنية غير الخاضعة للإشراف تتفوق على النهج ضعيفة الإشراف في اكتشاف تهديدات التراث الدقيقة.

Girmaw Abebe Tadesse, Titien Bartette, Andrew Hassanali, Allen Kim, Jonathan Chemla, Andrew Zolli, Yves Ubelmann, Caleb (…)2026-05-12
💻 computer science

Advanced Tumor Segmentation in PET/CT Imaging: A Training Strategy Study with nnU-Net for AutoPET III

تقدم هذه الورقة حلاً للمركز الثالث في تحدي AutoPET III، والذي يستفيد من إطار عمل nnU-Net مع مشفر ResNet واستراتيجيات تدريب محسنة، بما في ذلك تعزيز CraveMix وفقدان dice للدفعة (batch dice loss)، لتحقيق تقسيم قوي للأورام في كامل الجسم في تصوير PET/CT بدرجة dice تبلغ 0.80.

Hussain Alasmawi2026-05-12
🤖 AI

MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing

تقدم الورقة البحثية MULTITEXTEDIT، وهو معيار مرجعي منضبط يمتد عبر 12 لغة ومقياساً جديداً لدقة اللغة، لتوضيح أن أنظمة تحرير النصوص داخل الصور الحالية تعاني من تدهور كبير في دقة اللغات عبر اللغات، لا سيما في دقة الخطوط للغات غير اللاتينية، على الرغم من الحفاظ على البنية البصرية العالمية.

Liwei Cheng, Zirui Song, Shibo Feng, Lunjie Zhou, Yixuan Guan, Dayan Guan2026-05-12