💻 computer science

Spatial Blindness in Whole-Slide Multiple Instance Learning

تحدد الورقة البحثية مشكلة "العمى المكاني" في نماذج تعلم الحالات المتعددة للشرائح الكاملة، حيث تعتمد التنبؤات على إحصائيات المظهر التركيبية بدلاً من البنية النسيجية بسبب ديناميكيات التحسين، وتقترح ResTopoMIL —وهي بنية بسيطة تفصل بين تعلم المظهر غير المتغير بالتبديل وبين التعلم المكاني المعتمد على الإحداثيات— لاستعادة الحساسية المكانية وتحسين الأداء عبر تسعة معايير مرجعية.

Xiangyu Li, Ran Su2026-05-19
💻 computer science

GCE-MIL: Faithful and Recoverable Evidence for Multiple Instance Learning in Whole-Slide Imaging

يُعد GCE-MIL إطار عمل غير مرتبط بهيكل محدد، يعمل على تعزيز التعلم متعدد الأمثلة لصور الشرائح الكاملة من خلال التحسين الصريح لمعايير الكفاية والضرورة والقابلية للاسترداد (S/N/R) لتوليد أدلة وفية وقابلة للاسترداد، مما يؤدي إلى تحسين أداء التصنيف وتقليص الفجوة بين درجات الانتباه المستمرة واختيارات الرقع المستمرة.

Xiangyu Li, Ran Su2026-05-19
💻 computer science

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

يُعد Omni-Customizer إطار عمل متكامل (end-to-end) يتيح توليداً دقيقاً مشتركاً للصوت والفيديو مع هويات بصرية ونبرات صوتية متسقة عبر موضوعات متعددة من خلال تقديم وحدات مبتكرة مثل Omni-Context Fusion وMasked TTS Cross-Attention وSemantic-Anchored Multimodal RoPE لحل تحديات مثل تسرب الكلام وتحقيق أحدث المستويات التقنية في التخصيص متعدد الوسائط.

Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang2026-05-19
💻 computer science

A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle

تقترح هذه الورقة رؤية توزيعية للتفسير الآلي البصري تصيغ المهمة كمسألة تحسين لتقليل تباعد كولباك - ليبلر (KL) لمعالجة الانحيازات الإحصائية في النماذج القائمة، مقدمةً مبدأ القيد الناعم لتقليل تباعد كولباك - ليبلر الذي يتم تحقيقه من خلال أخذ عينات خلفية للانتشار موجهة بالطاقة لتحقيق توازن نظري بين القابلية للتفسير والأمانة.

Guancheng Zhou, Yisi Luo, Zhengfu He, Zhenyu Jin, Xuyang Ge, Wentao Shu, Deyu Meng, Xipeng Qiu2026-05-19
🤖 machine learning

PFlow-T: A Persistence-Driven Forward Process for Topology-Controlled Generation

يُعد PFlow-T نموذجاً توليدياً مبتكراً يستبدل فساد الضجيج الغاوسي التقليدي بعملية أمامية مدفوعة بالاستمرارية تعتمد على التماثل المستمر، مما يتيح توليداً محكوماً طوبولوجياً في خطوة واحدة يتفوق بشكل كبير على النماذج المرجعية في إنشاء أعداد بيتي محددة والتعامل مع مهام خارج نطاق التوزيع.

Snigdha Chandan Khilar2026-05-19
💻 computer science

Real-Time Neural Hair Denoising

تقدم هذه الورقة طريقة عصبية خفيفة الوزن وفي الوقت الفعلي، تعيد بناء مخازن بيانات الرسومات (G-Buffers) عالية الجودة للشعر القائم على الخصلات من مدخلات ناقصة العينات بشدة، وذلك عبر الجمع بين استعادة التغطية المكانية-الزمانية وإعادة بناء الموضع الموجه بالمماس، متفوقة بذلك على أجهزة إزالة الضجيج الخاصة بالشعر والحلول العامة لرفع الدقة مثل DLSS وFSR عبر مختلف تسريحات الشعر والسيناريوهات الديناميكية.

Chenghao Wu, Yuefan Shen, Tao Huang, Kai Yan, Zahra Montazeri, Kui Wu2026-05-19
💻 computer science

Deepfake Detection in Social Media: A Temporal Artifact Analysis Using 3D Convolutional Neural Networks

تقترح هذه الورقة البحثية كاشفاً يعتمد على الشبكات العصبية التلافيفية ثلاثية الأبعاد يستفيد من الآثار الزمنية ومنظم اتساق لتعريف التزييف العميق عالي الجودة على وسائل التواصل الاجتماعي بفعالية، محققاً دقة بلغت 92.8% على مجموعة بيانات DeepfakeTIMIT ومظهراً قدرة فائقة على التعميم عبر مجموعات البيانات مقارنة بالطرق التي تعتمد على الجوانب المكانية فقط.

Mohammadreza Rashidi, Raja Hashim Ali, Sami Ur Rahman2026-05-19
💻 computer science

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech

يُعد AgentSteerTTS إطار عمل متعدد الوكلاء ذو حلقة مغلقة يحقق تحكماً دقيقاً ومخلصاً للنوايا في التعليمات المركبة لتحويل النص إلى كلام، وذلك عبر توظيف فك الارتباط التنافسي، والترسيخ ثنائي المسار مع مكتبة النماذج الأولية، وآليات التغذية الراجعة السريعة والبطيئة للتغلب على عدم التطابق الهيكلي بين النوايا النصية والتحققات الصوتية.

Bin Kang, Shaoguo Wen, Yang Fan, Shunlong Wu, Junjie Wang, Yulin Li, Junzhi Zhao, Junle Wang, Zhuotao Tian2026-05-19
💻 computer science

MSIQ: Moment-based Scale-Invariant Quality Measure for Single Image Super-Resolution

تقدم هذه الورقة البحثية مقياس MSIQ، وهو مقياس جودة جديد، غير معتمد على نموذج، وغير مرتبط بالمقياس لعمليات تحسين دقة الصور المفردة، يستخدم العزوم الهندسية المركزية الموحدة لتمكين المقارنة المباشرة المستقلة عن الدقة والتمييز بفعالية بين التشوهات الهندسية والعيوب غير الهندسية، مما يعالج القيود الحرجة لمقاييس المرجعية الكاملة التقليدية.

Leonid Bedratyuk2026-05-19
💻 computer science

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

يُعد AutoRubric-T2I إطار عمل مبتكرًا يقوم تلقائيًا بتوليد واختيار معايیاں (rubrics) صريحة وقابلة للتفسير لتوجيه نماذج الرؤية واللغة الحاكمة، مما يحقق أفضل النتائج في محاذاة النص إلى الصورة مع قابلية تفسير عالية واعتماد أدنى على بيانات التفضيل البشري واسعة النطاق.

Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban, Cho-Jui Hsieh2026-05-19