🤖 machine learning

Deep Image Segmentation via Discriminant Feature Learning

تقدم هذه الورقة البحثية "التحليل التمييزي العميق" (Deep Discriminant Analysis - DDA)، وهو دالة فقدان قابلة للتفاضل ومستقلة عن البنية، تعمل على تعزيز دقة تقسيم الصور وحدة الحدود من خلال تعظيم التباين بين الفئات صراحةً مع تقليل التباين داخل الفئة، وهو ما تم التحقق منه عبر تحسن الأداء في معيار DIS5K.

Adam Dawid Sztamborski, Raül Pérez-Gonzalo, Antonio Agudo2026-05-15
💬 NLP

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

تُعد SIRA إطار عمل لفك التشفير التبايني الداخلي لا يتطلب تدريباً، حيث تعمل على الحد من الهلوسة في النماذج اللغوية البصرية الكبيرة عبر توليد مرجع مضاد يهيمن عليه الأولوية اللغوية ضمن نفس المحول من خلال الانتباه المقنع في الطبقات المتأخرة، مما يقلل من الاعتماد على الأدوات الخارجية وعمليات التمرير الأمامي الإضافية مع الحفاظ على التغطية الوصفية.

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen2026-05-15
🤖 machine learning

Action-Inspired Generative Models

تقدم هذه الورقة نماذج توليدية مستوحاة من الأفعال (AGMs)، وهي إطار عمل ثنائي الشبكة، خفيف الوزن، وقابل للتشغيل المباشر، يعمل على تعزيز طرق مطابقة الجسور باستخدام جهد قياسي قابل للتعلم لوزن الانتقالات العشوائية ديناميكيًا أثناء التدريب، مما يؤدي إلى تحسين جودة التوليد دون إضافة عبء حسابي أثناء الاستدلال.

Eshwar R. A., Debnath Pal2026-05-15
💻 computer science

TERRA-CD: Multi-Temporal Framework for Multi-class and Semantic Change Detection

تقدم هذه الورقة TERRA-CD، وهو عبارة عن مجموعة بيانات مرجعية شاملة تضم 5,221 زوجًا من صور Sentinel-2 من 232 مدينة عبر الولايات المتحدة وأوروبا، مصممة لتعزيز مراقبة الغطاء النباتي الحضري وكشف التغير الدلالي من خلال تعليقات توضيحية متعددة الفئات وتقييمات واسعة للتعلم العميق.

Omkar Oak, Rukmini Nazre, Rujuta Budke, Suraj Sawant2026-05-15
💻 computer science

MiVE: Multiscale Vision-language features for reference-guided video Editing

يقدم MiVE إطار عمل لتحرير الفيديو بتوجيه مرجعي يستفيد من الميزات الهرمية متعددة المقاييس من Qwen3-VL ضمن محول انتشار ذاتي الانتباه موحد للتغلب على فجوات الأنماط وفقدان التفاصيل المكانية، محققاً أداءً هو الأفضل في مجاله في الحفاظ على الحركة وتنفيذ التعديلات الدقيقة.

Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu2026-05-15
💻 computer science

SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

تقدم هذه الورقة البحثية SceneFunRI، وهو معيار جديد يضم 855 حالة لتقييم قدرة نماذج الرؤية واللغة على الاستنتاج حول مواقع الأشياء الوظيفية غير المرئية أو المحجوبة باستخدام تعليمات المهام والمعرفة القائمة على المنطق العام، مما يكشف أن النماذج الحالية المتطورة تعاني بشكل كبير من هذا العجز.

Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu2026-05-15
💻 computer science

StyleTextGen: Style-Conditioned Multilingual Scene Text Generation

تقدم الورقة البحثية StyleTextGen، وهو إطار عمل مبتكر يحقق أداءً فائقاً في توليد نصوص المشاهد متعددة اللغات من خلال توظيف مشفر نمط ثنائي الفرع، وفقدان اتساق نمط النص، واستراتيجية استدلال موجهة بالقناع لضمان محاكاة دقيقة للنمط عبر الخلفيات المعقدة وأنظمة الكتابة المتنوعة.

Zeyu Chen, Fangmin Zhao, Yan Shu, Yichao Liu, Liu Yu, Yu Zhou2026-05-15
🤖 machine learning

AnchorRoute: Human Motion Synthesis with Interval-Routed Sparse Contro

يُعد AnchorRoute إطار عمل لتخليق الحركة البشرية يستفيد من المرتكزات المتفرقة (sparse anchors) كدعامة موحدة لتهيئة نموذج انتشار مسبق مجمد (frozen diffusion prior) من أجل توليد عالي الجودة، ومن ثم يقوم بتنقيح المخرجات عبر RouteSolver الذي يسقط التصحيحات على قواعد فترية محددة بالمرتكزات، مما يحقق التزاماً فائقاً بالقيود المكانية المحددة من قبل المستخدم مع الحفاظ على دقة العلاقة بين النص والحركة.

Pengcheng Fang, Tengjiao Sun, Dongjie Fu, Xiaoyu Zhan, Yanwen Guo, Hansung Kim, Xiaohao Cai2026-05-15
💻 computer science

Towards Label-Free Single-Cell Phenotyping Using Multi-Task Learning

تقدم هذه الورقة إطار عمل موحد للتعلم العميق يجمع بين بنيات التلافيف (convolutional) والمحولات (transformer) مع نموذج لغوي كبير لتمكين التصنيف الدقيق والخالي من الملصقات لخلايا الدم البيضاء، وتوقع تعبير البروتين من صور تباين الطور التفاضلي، مما يوفر بديلاً منخفض التكلفة لقياس التدفق القائم على الفلورة.

Saqib Nazir, Ardhendu Behera2026-05-15
💻 computer science

CHASM: Cross-frequency Harmonized Axis-Separable Mixing for Spectral Token Operators

تقدم الورقة البحثية CHASM، وهو مِزج طيفي للرموز (spectral token mixer) يعمل على تحسين نمذجة التفاعل العالمي في خرائط السمات المرئية من خلال تعلم أساس ذاتي للقنوات (shared channel eigenbasis) عبر جميع الترددات مع الحفاظ على مكاسب طيفية محددة لكل تردد، مما يحقق مكاسب أداء متسقة مقارنة بالنماذج المرجعية الحالية في مهام مثل إعادة بناء التصوير بالرنين المغناطيسي ومعالجة الصور الطبيعية.

Pengcheng Fang, Hongli Chen, Yuxia Chen, Tengjiao Sun, Jiaxin Liu, Xiaohao Cai2026-05-15