🤖 machine learning

FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval

يُعد FIRE-CIR نموذجاً مبتكراً لاسترجاع الصور المكونة من أزياء دقيقة التفاصيل، حيث يعزز الدقة والقابلية للتفسير عبر استبدال تشابه التضمين البسيط بعملية استدلال بصري صريحة مدفوعة بالأسئلة، تتحقق من التعديلات على مستوى السمات بين الصور المرجعية والمرشحة.

François Gardères, Camille-Sovanneary Gauthier, Jean Ponce, Shizhe Chen2026-04-13
💻 computer science

FaceLiVTv2: An Improved Hybrid Architecture for Efficient Mobile Face Recognition

يقدم FaceLiVTv2 بنية هجينة محسنة تتميز بوحدة تفاعل رموز عالمية خفيفة الوزن وكتلة RepMix موحدة لتعزيز المقايضة بين الدقة والكفاءة بشكل كبير للتعرف على الوجوه عبر الأجهزة المحمولة، محققاً سرعة استدلال تزيد بنسبة تصل إلى 30.8% عن الطرق الخفيفة الرائدة مع الحفاظ على دقة فائقة.

Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu, Wen-Kai Kuo, Jun-Wei Hsieh2026-04-13
🤖 machine learning

MixFlow: Mixed Source Distributions Improve Rectified Flows

تقدم الورقة البحثية MixFlow، وهي استراتيجية تدريب تدمج توزيعاً غير مشروط ثابتاً مع توزيع مصدر محاذٍ للإشارة لتقليل انحناء المسار التوليدي، مما يؤدي إلى تحسين كفاءة أخذ العينات، وجودة التوليد، وتقارب التدريب بشكل كبير في نماذج التدفق المصحح (rectified flow models).

Nazir Nayal, Christopher Wewer, Jan Eric Lenssen2026-04-13
🤖 AI

Vision Transformers for Preoperative CT-Based Prediction of Histopathologic Chemotherapy Response Score in High-Grade Serous Ovarian Carcinoma

تقترح هذه الدراسة إطار عمل للتعلم العميق متعدد الوسائط ثنائي ونصف الأبعاد (2.5D) يدمج تصوير الأشعة المقطعية قبل الجراحة والبيانات السريرية للتنبؤ بدرجة استجابة العلاج الكيميائي النسيجية في سرطان المبيض ذي الخلايا المصلية عالية الدرجة، حيث أظهرت دقة عالية على مجموعة داخلية رغم انخفاض أدائها في مجموعة تحقق خارجية.

Francesca Fati, Felipe Coutinho, Marika Reinius, Marina Rosanu, Gabriel Funingana, Luigi De Vitis, Gabriella Schivardi (…)2026-04-13
💻 computer science

Globally Optimal Pose from Orthographic Silhouettes

تقدم هذه الورقة أول طريقة مثالية عالمياً لتقدير الوضعية ثلاثية الأبعاد للأشكال التعسفية من الظلال المتعامدة غير المحجوبة، وذلك عبر الاستفادة من استمرارية مساحة الظل ونسب الأبعاد البيضاوية للبحث بكفاءة في فضاء الدوران دون الحاجة إلى وجود توافقات بين النقاط.

Agniva Sengupta, Dilara Kuş, Jianning Li, Stefan Zachow2026-04-13
💻 computer science

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

تقدم الورقة البحثية CT-1، وهو نموذج رؤية-لغة-كاميرا مبتكر يستفيد من مسار بيانات متخصص وتنظيم قائم على المويجات لنقل معرفة الاستدلال المكاني إلى توليد فيديو قابل للتحكم عبر الكاميرا، محققاً تحسناً كبيراً في دقة المسار وتوليد حركة منطقية فيزيائياً.

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui L (…)2026-04-13
💻 computer science

Adding Another Dimension to Image-based Animal Detection

تعالج هذه الورقة نقص البيانات ثلاثية الأبعاد المصنفة للكشف عن الحيوانات من خلال اقتراح مسار عمل يستخدم نماذج الحيوانات المتعددة الخطية ذات الجلد (Skinned Multi-Animal Linear models) وتحسين وضعية الكاميرا لتوليد صناديق محيطة ثلاثية الأبعاد دقيقة ومقاييس رؤية من صور RGB أحادية العدسة، مما يتيح تطوير واختبار خوارزميات الكشف عن الحيوانات ثلاثية الأبعاد في المستقبل.

Vandita Shukla, Fabio Remondino, Benjamin Risse2026-04-13
💻 computer science

SHIFT: Steering Hidden Intermediates in Flow Transformers

تقدم الورقة البحثية إطار عمل SHIFT، وهو إطار عمل خفيف الوزن ولا يتطلب تدريباً، يقوم بتوجيه نماذج الانتشار القائمة على بنية DiT من خلال التلاعب الديناميكي بالتنشيطات البينية أثناء الاستدلال لكبح المفاهيم غير المرغوب فيها، أو نقل نطاقات الأنماط، أو تعديل الكائنات مع الحفاظ على جودة الصورة الإجمالية والالتزام بالمطالبة النصية.

Nina Konovalova, Andrey Kuznetsov, Aibek Alanov2026-04-13
💻 computer science

2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness

تقترح هذه الورقة إطار عمل لتقليم الرموز ثلاثي المراحل لنماذج الرؤية واللغة والعمل (VLA) متعددة الوسائط البصرية، والتي تلتقط ديناميكيًا فروق بروز الوسائط ثنائية وثلاثية الأبعاد لتحقيق تسريع في الاستدلال يصل إلى 2.55 ضعفًا مع حد أدنى من فقدان الدقة.

Zihao Zheng, Sicheng Tian, Zhihao Mao, Lingyue Zhang, Chenyue Li, Ziyun Zhang, Hong Gao, Yuchen Huang, Yutong Xu, Guojie (…)2026-04-13
🤖 machine learning

Beyond Segmentation: Structurally Informed Facade Parsing from Imperfect Images

تقترح هذه الورقة طريقة لتحليل واجهات المباني مستندة إلى البنية، تعمل على تعزيز نموذج YOLOv8 باستخدام فقد محاذاة مخصص لفرض ترتيبات صناديق الإحاطة المتسقة مع الشبكة، مما يؤدي إلى تحسين التماسك الهيكلي لإعادة البناء الإجرائي مع الحفاظ على دقة الكشف في الصور غير المثالية.

Maciej Janicki, Aleksander Plocharski, Przemyslaw Musialski2026-04-13