💻 computer science

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

تقدم هذه الورقة نموذج MRT، وهو نموذج انتشار مناطق مقنع (masked region diffusion model) بـ 20 مليار معلمة تم تدريبه على 10 ملايين عينة ليوحد مهام تحويل النص إلى طبقات، والصورة إلى طبقات، والطبقات إلى طبقات، لتحقيق توليد وتحرير صور شفافة متعددة الطبقات في الوقت الفعلي وبأفضل حالة ممكنة، بجودة وكفاءة متفوقتين مقارنة بالأنظمة التجارية والمتزامنة الحالية.

Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan2026-05-27
💻 computer science

A Dynamic Programming Framework for Discovering Count and Values of Multilevel Image Thresholding

تقدم هذه الورقة MET-DP، وهو إطار عمل جديد للبرمجة الديناميكية يحدد تلقائياً العدد الأمثل للعتبات لتقسيم الصور متعدد المستويات باستخدام معيار "الحد الأدنى من خطأ العتبة" المعدل، مما يظهر كفاءة حوسبية فائقة وقدرات اكتشاف تلقائي للعتبات مقارنة بالطرق التقليدية، وإن كان ذلك مع مقاييس جودة صور (SSIM وPSNR) أقل قليلاً من النهج المحدد من قبل المستخدم.

Eslam Hegazy, Mohamed Gabr2026-05-27
💻 computer science

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

تقدم الورقة البحثية نموذج Gemini Embedding 2، وهو نموذج تضمين متعدد الوسائط أصيل يوحد الفيديو والصوت والصورة والنص في فضاء تمثيل واحد، محققاً أداءً هو الأفضل في فئته عبر مهام الاسترجاع المتنوعة أحادية الوسائط، ومتعددة الوسائط، وعبر الوسائط، مع إظهار قدرات قوية في التعلم الصفري ضمن المجالات المتخصصة.

Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam G (…)2026-05-27
💻 computer science

PlayClass: Automated Play Behaviour Classification in Poultry

تقدم الورقة البحثية PlayClass، وهو مسار آلي يجمع بين التتبع طويل الأمد وتضمينات النماذج التأسيسية لتصنيف سلوكيات اللعب الإيجابية في الدواجن من فيديو علوي، محققاً درجة 77.0 في متوسط F1 الكلي رغم التحديات مثل الانسداد والتشابهات الحركية بين أفعال اللعب وغير اللعب.

Prince Ravi Leow (Section for Health Data Science & AI, University of Copenhagen), Neil Scheidwasser (Section for Health (…)2026-05-27
💻 computer science

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

تقترح هذه الورقة البحثية "إسقاط الرؤية" (View Dropout)، وهو تدخل تدريبي يجبر النماذج متعددة الوسائط الموحدة على استخدام صور التفكير الوسيطة من أجل التفكير المكاني عبر الرؤى، مما يثبت أن التفكير البصري البانورامي المقترن بهذه الطريقة يحقق تعميماً فائقاً خارج النطاق من خلال موازنة القابلية للتعلم مع القدرة المعلوماتية.

Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal2026-05-27
💬 NLP

Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

تقدم هذه الورقة "Chartographer"، وهو إطار عمل يقوم بتوليد مخططات مضادة للواقع عبر هندستها عكسياً إلى كود قابل للتنفيذ لتقييم قدرات الاستدلال البصري لنماذج اللغة والرؤية بدقة، مما يكشف أن العديد من النماذج تفشل في التعميم عندما يتم تغيير بيانات المخطط الأساسية رغم إجابتها على الأسئلة الأصلية بشكل صحيح.

Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell, Freda Shi2026-05-27
🤖 machine learning

Towards Controllable Image Generation through Representation-Conditioned Diffusion Models

تقترح هذه الورقة إطار عمل لتوليد الصور القابل للتحكم يستفيد من التمثيلات المستمدة من نماذج التعلم الذاتي مسبقة التدريب لتهيئة عمليات الانتشار، مما يعزز جودة التوليد غير المشروط مع تمكين التحكم السلس والمتمايز في التباينات الناتجة دون الحاجة إلى مجموعات بيانات موسومة واسعة النطاق.

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen2026-05-27
🤖 AI

When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection

تقدم هذه الورقة البحثية "اتساق النظرة الاجتماعية" كإشارة دلالية عالية المستوى جديدة للكشف عن الصور المولدة بواسطة الذكاء الاصطناعي، وذلك من خلال تحليل التماسك المتبادل بين نظرات العين، ومحاذاة الرأس والعين، وموضع بؤبؤ العين بين الأفراد المتفاعلين، مما يثبت من خلال مجموعات بيانات محكومة والتحقق عبر البنى الهيكلية المختلفة أن هذا النهج يتغلب بفعالية على قيود طرق الكشف الحالية القائمة على العيوب منخفضة المستوى.

Kim Jihyeon, Sohee Kim, Soosan Lee, Souhwan Jung, James Matthew Rehg, Hyesong Choi2026-05-27
🤖 machine learning

Forgettable Federated Linear Learning with Certified Data Unlearning

تقدم هذه الورقة "التعلم الخطي الاتحادي القابل للنسيان" (Forgettable Federated Linear Learning)، وهو إطار عمل يقرب الشبكات العصبية العميقة باستخدام نماذج خطية لتمكين عملية نسيان اتحادي معتمدة وفعالة وآمنة دون الحاجة إلى اتصالات إضافية من العملاء أو تخزين النماذج التاريخية.

Ruinan Jin, Minghui Chen, Qiong Zhang, Xiaoxiao Li2026-05-26
⚡ electrical engineering

Train-Free Segmentation in MRI with Cubical Persistent Homology

تقدم هذه الورقة إطار عمل لتقسيم صور الرنين المغناطيسي لا يتطلب تدريباً، وذلك باستخدام تحليل البيانات الطوبولوجية والهمولوجيا المستمرة المكعبة لتقسيم البنى التشريحية تلقائياً دون الحاجة إلى مجموعات بيانات ضخمة موسومة، مما يوفر خطاً مرجعياً قابلاً للتفسير ومناسباً لإعدادات البيانات الشحيحة وصقل الخبراء.

Anton François, Raphaël Tinarrage2026-05-26