💻 computer science

LookBench: A Live and Holistic Open Benchmark for Fashion Image Retrieval

تقدم هذه الورقة البحثية LookBench، وهو معيار مرجعي مفتوح وحي وشامل لاسترجاع صور الأزياء، يتميز بصور من الواقع ومن إنتاج الذكاء الاصطناعي مختومة زمنياً، وتصنيف سمات دقيق، وتحديثات دورية لتوفير تقييم مستدام وواعٍ بالتلوث لنماذج الاسترجاع في بيئات التجارة الإلكترونية الحقيقية.

Gensmo. ai, Chao Gao, Siqiao Xue, Yimin Peng, Jiwen Fu, Tingyi Gu, Shanshan Li, Fan Zhou2026-02-24
💻 computer science

RepSFNet : A Single Fusion Network with Structural Reparameterization for Crowd Counting

تُعد RepSFNet بنية خفيفة الوزن وآنية لعد الحشود، تستخدم عمود فقري من نوع RepLK-ViT مع إعادة تمثيل هيكلية ووحدة دمج متخصصة لتحقيق دقة عالية وزمن استجابة منخفض عبر التخلص من آليات الانتباه المعقدة مع معالجة تباينات الحجم والانسدادات بشكل فعال.

Mas Nurul Achmadiah, Chi-Chia Sun, Wen-Kai Kuo, Jun-Wei Hsieh2026-02-24
⚡ electrical engineering

Zero-shot Multi-Contrast Brain MRI Registration by Intensity Randomizing T1-weighted MRI (LUMIR25)

تقدم هذه الورقة البحثية LUMIR25، وهي طريقة لتسجيل صور الرنين المغناطيسي للدماغ متعددة التباين بنمط "التعلم الصفري" (zero-shot)، والتي حققت المركز الأول في مسابقة Learn2Reg 2025 من خلال الجمع بين الانحيازات الاستقرائية الخاصة بالتسجيل وبين العشوائية في شدة الإضاءة والتحسين الخفيف الخاص بالنماذج (instance-specific optimization) للتعميم من بيانات التدريب ذات الوزن الأول (T1-weighted) إلى تباينات متنوعة دون الحاجة إلى توليد صور صريح.

Hengjie Liu, Yimeng Dou, Di Xu, Xinyi Fu, Dan Ruan, Ke Sheng2026-02-24
💻 computer science

Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling

تقدم الورقة البحثية "Agent Banana"، وهو إطار عمل وكيل هرمي يتميز بخاصيتي "طي السياق" (Context Folding) و"تفكيك طبقات الصور" (Image Layer Decomposition) لتمكين تحرير صور متعدد الدورات وعالي الدقة بدقة أصلية تبلغ 4K، وهو ما تم التحقق منه عبر معيار "HDD-Bench" الجديد.

Ruijie Ye, Jiayi Zhang, Zhuoxin Liu, Zihao Zhu, Siyuan Yang, Li Li, Tianfu Fu, Franck Dernoncourt, Yue Zhao, Jiacheng Zh (…)2026-02-24
💻 computer science

Energy-Efficient Fast Object Detection on Edge Devices for IoT Systems

تقترح هذه الورقة إطار عمل لكشف الأشياء يتميز بكفاءة الطاقة وخفة الوزن لأجهزة حافة إنترنت الأشياء، والذي يستفيد من طريقة فرق الإطارات مع MobileNet لتحقيق دقة أعلى بكثير، وزمن انتقال أقل، وكفاءة أفضل في استهلاك الطاقة مقارنة بالطرق التقليدية من طرف إلى طرف، لا سيما للكشف عن الأجسام سريعة الحركة مثل القطارات والطائرات.

Mas Nurul Achmadiah, Afaroj Ahamad, Chi-Chia Sun, Wen-Kai Kuo2026-02-24
💻 computer science

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

تُعد Tele-Omni إطار عمل موحداً متعدد الوسائط يستفيد من النماذج اللغوية الكبيرة سابقة التدريب لتحليل تعليمات متنوعة للنصوص والصور والفيديو من أجل نموذج واحد قائم على الانتشار، مما يتيح توليد وتحرير الفيديو بمرونة وجودة عالية عبر مهام متعددة ضمن نظام متماسك.

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui H (…)2026-02-24
💻 computer science

SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

إن SAGE هو إطار عمل وكيل (agentic framework) يقوم تلقائياً بتوليد بيئات ثلاثية الأبعاد قابلة للتوسع، وواقعية، وصالحة فيزيائياً، ومصممة خصيصاً لمهام تجسدية محددة من خلال الاستنتاج التكراري والتقييم متعدد النقاد، مما يتيح تدريب السياسات التي تعمم بفعالية على سيناريوهات غير مرئية.

Hongchi Xia, Xuan Li, Zhaoshuo Li, Qianli Ma, Jiashu Xu, Ming-Yu Liu, Yin Cui, Tsung-Yi Lin, Wei-Chiu Ma, Shenlong Wang (…)2026-02-24
💻 computer science

A Novel Public Dataset for Strawberry (Fragaria x ananassa) Ripeness Detection and Comparative Evaluation of YOLO-Based Models

تقدم هذه الدراسة مجموعة بيانات عامة جديدة مكونة من 566 صورة للفراولة تم التقاطها في ظروف متغيرة في تركيا لمعالجة ندرة البيانات، وتقيم نماذج YOLOv8 وYOLOv9 وYOLO11 للكشف عن النضج، حيث وجدت أن نموذج YOLOv8s يحقق أفضل أداء إجمالي لـ mAP@50 بنسبة 86.09% مع إظهار كفاءة النماذج الصغيرة والمتوسطة لتطبيقات الزراعة الذكية.

Mustafa Yurdakul, Zeynep Sena Bastug, Ali Emre Gok, Sakir Taşdemir2026-02-24
🤖 machine learning

Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families

تُثبت هذه الورقة أن نماذج الرؤية واللغة تمتلك قصوراً جوهرياً في الاستدلال المكاني، حيث تنهار قدرتها على تحديد مواقع الخلايا المملوءة في الشبكات الثنائية دون وجود أدلة نصية، مما يكشف عن اعتماد كبير على مسارات التعرف النصي بدلاً من المعالجة البصرية الأصلية.

Yuval Levental2026-02-24
🤖 machine learning

Replication Study: Federated Text-Driven Prompt Generation for Vision-Language Models

تقدم هذه الورقة إعادة إنتاج ناجحة لمنهجية FedTPG، مما يثبت أن شبكة توليد المطالبات القائمة على النصوص الخاصة بها تحقق أداءً مطابقاً تقريباً للدراسة الأصلية، وتحسن بشكل كبير من القدرة على التعميم في الفئات غير المرئية في سيناريوهات التعلم الاتحادي عبر ست مجموعات بيانات رؤية متنوعة.

Suraj Prasad, Anubha Pant2026-02-24