💻 computer science

Center-Aware Detection with Swin-based Co-DETR Framework for Cervical Cytology

تقدم هذه الورقة حلاً فائزاً لتحدي RIVA لخلية عنق الرحم يجمع بين هيكل Swin-Large وإطار عمل Co-DINO، ويقدم التنبؤ بنقطة المركز، وتعزيز البيانات المتخصص، وتحسين الصندوق الهندسي لمعالجة تحديات التوزيع الكثيف للخلايا والتعليقات التوضيحية ذات الحجم الثابت في صور خلوات عنق الرحم.

Yan Kong, Yuan Yin, Hongan Chen, Yuqi Fang, Caifeng Shan2026-04-03
💻 computer science

Beyond the Fold: Quantifying Split-Level Noise and the Case for Leave-One-Dataset-Out AU Evaluation

تُثبت هذه الورقة أن التحقق المتقاطع الحصري للموضوعات في الكشف عن وحدات الحركة الوجهية يُدخل تباينًا عشوائيًا كبيرًا يمكن أن يحجب التحسينات الحقيقية للنموذج، مما يدعو إلى اعتماد تقييم "ترك مجموعة بيانات واحدة خارجًا" للكشف عن مقاييس أداء أكثر استقرارًا وقابلية للتفسير.

Saurabh Hinduja, Gurmeet Kaur, Maneesh Bilalpur, Jeffrey Cohn, Shaun Canavan2026-04-03
💻 computer science

Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models

تقترح هذه الورقة إطار عمل معياريًا للاستدلال في وقت التشغيل لا يتطلب تدريبًا، يستفيد من التغذية الراجعة للتدرج من النماذج التأسيسية للرؤية واللغة المجمدة كإشارات إشرافية قائمة على الطاقة لتوجيه توليد الصور من النص نحو الأمان دون المساس بجودة الصورة أو قابلية توسع النموذج.

Yaoteng Tan, Zikui Cai, M. Salman Asif2026-04-03
💻 computer science

Novel Memory Forgetting Techniques for Autonomous AI Agents: Balancing Relevance and Efficiency

تقدم هذه الورقة إطار عمل للنسيان الميزاني التكيفي يوازن بين الصلة والكفاءة في وكلاء الذكاء الاصطناعي المستقلين من خلال تنظيم الذاكرة عبر الحداثة، والتكرار، والمحاذاة الدلالية، مما يمنع التراكم غير المنضبط وانتشار الذاكرة الزائفة مع تحسين أداء الاستدلال طويل الأمد.

Payal Fofadiya, Sunil Tiwari2026-04-03
💻 computer science

VOID: Video Object and Interaction Deletion

تقدم الورقة البحثية VOID، وهو إطار عمل لإزالة الكائنات من الفيديو يستفيد من نموذج رؤية-لغة لتحديد وتوجيه نموذج انتشار فيديو في توليد نتائج مضادة للواقع وواقعية فيزيائياً للتفاعلات المعقدة بين الكائنات، معالجةً بذلك أوجه القصور في الأساليب الحالية في التعامل مع الديناميكيات السببية مثل الاصطدامات.

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng2026-04-03
💻 computer science

Steerable Visual Representations

تقدم هذه الورقة البحثية "التمثيلات البصرية القابلة للتوجيه"، وهي نهج مبتكر يقوم بحقن مطالبات اللغة الطبيعية مباشرة في طبقات نماذج "Vision Transformer" سابقة التدريب عبر الدمج المبكر، مما يتيح توجيه الميزات البصرية نحو مفاهيم محددة مع الحفاظ على أداء عالٍ في المهام البصرية العامة وتحقيق تعميم صفري القدرات.

Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano2026-04-03
💻 computer science

Generative World Renderer

تقدم هذه الورقة مجموعة بيانات ديناميكية واسعة النطاق مكونة من 4 ملايين إطار من ألعاب AAA، تتميز ببيانات RGB وG-buffer متزامنة تم التقاطها عبر طريقة مبتكرة ثنائية الشاشة، لسد الفجوة في مجال التوليد الرندري (generative rendering) وتمكين الرندرة العكسية القوية، وتوليد الفيديو عالي الدقة، وتحرير الأنماط الموجه بالنص، والتي تم تقييمها جميعها من خلال بروتوكول اتساق جديد قائم على نماذج الرؤية واللغة الكبيرة (VLM).

Zheng-Hui Huang, Zhixiang Wang, Jiaming Tan, Ruihan Yu, Yidan Zhang, Bo Zheng, Yu-Lun Liu, Yung-Yu Chuang, Kaipeng Zhang2026-04-03
💻 computer science

VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection

تقترح هذه الورقة البحثية إطار عمل VMAD، وهو إطار عمل للنماذج اللغوية الكبيرة متعددة الوسائط المعززة بصرياً، والذي يعالج أوجه القصور في طرق اكتشاف الشذوذ الحالية بنمط الصفر (zero-shot) من خلال تقديم مخطط تعلم هيكلي حساس للعيوب وضغط الرموز المعزز محلياً لتحقيق التعرف على الشذوذ والتحليل الدقيق والمفتوح، مدعوماً بمجموعة بيانات اكتشاف الشذوذ الصناعي الحقيقي (RIAD) المستحدثة.

Huilin Deng, Hongchen Luo, Wei Zhai, Yang Cao, Yu Kang2026-04-02
🤖 AI

Zero-TIG: Temporal Consistency-Aware Zero-Shot Illumination-Guided Low-light Video Enhancement

تقدم هذه الورقة البحثية Zero-TIG، وهو إطار عمل جديد للتعلم من دون عينات (zero-shot learning) يستفيد من نظرية Retinex والتغذية الراجعة الزمنية القائمة على التدفق البصري لتعزيز مقاطع الفيديو ذات الإضاءة المنخفضة وتحت الماء بجودة بصرية محسنة، واتساق زمني، ودقة ألوان، دون الحاجة إلى بيانات حقيقية مقترنة.

Yini Li, Nantheera Anantrasirichai2026-04-02
⚡ electrical engineering

Bronchovascular Tree-Guided Weakly Supervised Learning Method for Pulmonary Segment Segmentation

تقترح هذه الورقة البحثية "التعلم الخاضع للإشراف القائم على التسلسل الهرمي للتشريح" (AHSL)، وهو أسلوب تعلم خاضع للإشراف الضعيف يستفيد من الأولويات المسبقة للشجرة القصيبية الوعائية واستراتيجية مكونة من مرحلتين مع دوال فقدان هرمية لتحقيق تقسيم دقيق للفصوص الرئوية دون الحاجة إلى تعليقات توضيحية دقيقة لكل بكسل.

Ruijie Zhao, Zuopeng Tan, Xiao Xue, Longfei Zhao, Bing Li, Zicheng Liao, Ying Ming, Jiaru Wang, Ran Xiao, Sirong Piao, R (…)2026-04-02