🤖 machine learning

Post-Hoc Guidance for Consistency Models by Joint Flow Distribution Learning

تقترح هذه الورقة البحثية تعلم توزيع التدفق المشترك (JFDL)، وهو أسلوب محاذاة لاحق خفيف الوزن يُمكّن نماذج الاتساق المدربة مسبقاً من إجراء توجيه فعال خالٍ من المصنف دون الحاجة إلى تقطير المعرفة من نموذج انتشار معلم منفصل، مما يحسن جودة التوليد بشكل كبير ويسد فجوة رئيسية في أساليب نماذج الاتساق الحالية.

Chia-Hong Hsu, Randall Balestriero2026-04-13
💻 computer science

CatalogStitch: Dimension-Aware and Occlusion-Preserving Object Compositing for Catalog Image Generation

يقدم CatalogStitch مجموعة من التقنيات غير المرتبطة بنموذج محدد والتي تعمل على أتمتة حساب الأقنعة المدركة للأبعاد واستعادة العناصر مع الحفاظ على الحجب، مما يحول دمج الكائنات التوليدي إلى أداة عملية وسهلة الاستخدام لإنتاج صور الكتالوج عبر التخلص من التعديلات اليدوية المرهقة.

Sanyam Jain, Pragya Kandari, Manit Singhal, He Zhang, Soo Ye Kim2026-04-13
🤖 machine learning

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

تقدم هذه الورقة البحثية "التحكم في المفاهيم المحاذي للقواميس" (DACO)، وهو إطار عمل يستفيد من مجموعة بيانات منسقة تضم 15,000 مفهوم متعدد الوسائط ومشفّر تلقائي متناثر (Sparse Autoencoder) لتوفير توجيه دقيق عند الاستنتاج للنماذج اللغوية الكبيرة متعددة الوسائط المجمدة، مما يعزز بشكل كبير سلامتها ضد الاستعلامات الخبيثة مع الحفاظ على قدراتها العامة.

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal2026-04-13
⚡ electrical engineering

MedFormer-UR: Uncertainty-Routed Transformer for Medical Image Classification

يُعد MedFormer-UR نموذجاً مطوراً لـ "محول الرؤية الطبية" (Medical Vision Transformer) يدمج التعلم القائم على النماذج الأولية مع توجيه عدم اليقين الموجه بتوزيع ديريكليه لتحسين معايرة النموذج، وتحديد مواضع الغموض، وضمان اتخاذ قرارات سريرية موثوقة عبر مختلف أنماط التصوير الطبي.

Mohammed Maaz Sibhai, Abedalrhman Alkhateeb, Saad B. Ahmed2026-04-13
🤖 AI

Adaptive Dual Residual U-Net with Attention Gate and Multiscale Spatial Attention Mechanisms (ADRUwAMS)

تقدم هذه الورقة نموذج "الشبكة العصبية التلافيفية من نوع U-Net ذات المتبقي المزدوج المتكيف مع بوابة الانتباه وآليات الانتباه المكاني متعدد المقاييس" (ADRUwAMS)، وهو نموذج للتعلم العميق يجمع بين الشبكات المتبقية المزدوجة، وبوابات الانتباه، والانتباه المكاني متعدد المقاييس لتحقيق تقسيم عالي الدقة للأورام الدبقية في مجموعتي بيانات BraTS 2019 و2020، محققاً درجات "دايس" (Dice scores) بلغت 0.9229، و0.8432، و0.8004 لمناطق الورم الكامل، ولنواة الورم، وللمناطق المعززة على التوالي.

Mohsen Yaghoubi Suraki2026-04-13
🤖 AI

Large-Scale Universal Defect Generation: Foundation Models and Datasets

تقدم هذه الورقة البحثية UDG، وهي مجموعة بيانات ضخمة تتكون من 300 ألف رباعية (طبيعي-غير طبيعي-قناع-وصف)، وUniDG، وهو نموذج تأسيسي شامل يستفيد من هذه البيانات واستراتيجية تدريب ثنائية المراحل لتوليد عيوب متنوعة وعالية الجودة عبر مجالات مختلفة دون الحاجة إلى ضبط دقيق لكل فئة، مما يؤدي إلى تحسين أداء كشف الشذوذ بشكل كبير.

Yuanting Fan, Jun Liu, Bin-Bin Gao, Xiaochen Chen, Yuhuan Lin, Zhewei Dai, Jiawei Zhan, Chengjie Wang2026-04-13
💻 computer science

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction

يُعد TAIHRI نموذجاً جديداً للرؤية واللغة مصمماً للتفاعل القريب بين الإنسان والروبوت، حيث يستفيد من التنبؤ بالرمز التالي لتحديد مواقع النقاط المفتاحية ثلاثية الأبعاد البشرية ذات الصلة بالمهمة بدقة، وذلك عبر فهم أوامر الحركة وتكميم الإحداثيات المكانية، مما يجعله يتفوق على الطرق التقليدية في دقة المساحة المترية للتفاعل المجسد.

Ao Li, Yonggen Ling, Yiyang Lin, Yuji Wang, Yong Deng, Yansong Tang2026-04-13
💻 computer science

M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model

تقترح الورقة البحثية نموذج M-IDoL، وهو نموذج طبي أساسي ذاتي الإشراف يستخدم تفكيك المعلومات عبر "خليط من الخبراء" (Mixture-of-Experts) لتعظيم الإنتروبيا بين الأنماط وتقليل عدم اليقين داخل النمط الواحد، مما يحقق تمثيلات متفوقة خاصة بكل نمط ومتنوعة تتفوق على النماذج الحالية عبر 21 مهمة سريرية تابعة.

Yihang Liu, Ying Wen, Jiaxiong Yang, Longzhen Yang, Lianghua He, Heng Tao Shen2026-04-13
🤖 machine learning

Low-Data Supervised Adaptation Outperforms Prompting for Cloud Segmentation Under Domain Shift

تُثبت هذه الورقة أنه بالنسبة لتجزئة السحب في صور الأقمار الاصطيلة، فإن الضبط الدقيق الخاضع للإشراف ببيانات منخفضة يتفوق بشكل كبير على جميع استراتيجيات التلقين لتكييف نماذج الرؤية واللغة، مما يثبت أن حتى الحد الأدنى من البيانات المصنفة يعد حلاً أكثر فعالية من الهندسة اللغوية لسد الفجوة بين الصور الطبيعية وصور الاستشعار عن بعد.

Harshith Kethavath, Weiming Hu2026-04-13
💻 computer science

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

تقدم هذه الورقة دراسة تجريبية منضبطة تثبت أنه من بين ثلاثة نماذج سائدة لمخرجات التوطين الزمني للفيديو، يوفر فك التشفير الزمني المستمر أفضل توازن بين الكفاءة والدقة، مما يوفر إرشادات موضوعية لتصميم نماذج اللغات الكبيرة للفيديو الجاهزة للنشر.

Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen2026-04-13