💻 computer science

SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

إن SAGE هو إطار عمل وكيل (agentic framework) يقوم تلقائياً بتوليد بيئات ثلاثية الأبعاد قابلة للتوسع، وواقعية، وصالحة فيزيائياً، ومصممة خصيصاً لمهام تجسدية محددة من خلال الاستنتاج التكراري والتقييم متعدد النقاد، مما يتيح تدريب السياسات التي تعمم بفعالية على سيناريوهات غير مرئية.

Hongchi Xia, Xuan Li, Zhaoshuo Li, Qianli Ma, Jiashu Xu, Ming-Yu Liu, Yin Cui, Tsung-Yi Lin, Wei-Chiu Ma, Shenlong Wang (…)2026-02-24
💻 computer science

A Novel Public Dataset for Strawberry (Fragaria x ananassa) Ripeness Detection and Comparative Evaluation of YOLO-Based Models

تقدم هذه الدراسة مجموعة بيانات عامة جديدة مكونة من 566 صورة للفراولة تم التقاطها في ظروف متغيرة في تركيا لمعالجة ندرة البيانات، وتقيم نماذج YOLOv8 وYOLOv9 وYOLO11 للكشف عن النضج، حيث وجدت أن نموذج YOLOv8s يحقق أفضل أداء إجمالي لـ mAP@50 بنسبة 86.09% مع إظهار كفاءة النماذج الصغيرة والمتوسطة لتطبيقات الزراعة الذكية.

Mustafa Yurdakul, Zeynep Sena Bastug, Ali Emre Gok, Sakir Taşdemir2026-02-24
🤖 machine learning

Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families

تُثبت هذه الورقة أن نماذج الرؤية واللغة تمتلك قصوراً جوهرياً في الاستدلال المكاني، حيث تنهار قدرتها على تحديد مواقع الخلايا المملوءة في الشبكات الثنائية دون وجود أدلة نصية، مما يكشف عن اعتماد كبير على مسارات التعرف النصي بدلاً من المعالجة البصرية الأصلية.

Yuval Levental2026-02-24
🤖 machine learning

Replication Study: Federated Text-Driven Prompt Generation for Vision-Language Models

تقدم هذه الورقة إعادة إنتاج ناجحة لمنهجية FedTPG، مما يثبت أن شبكة توليد المطالبات القائمة على النصوص الخاصة بها تحقق أداءً مطابقاً تقريباً للدراسة الأصلية، وتحسن بشكل كبير من القدرة على التعميم في الفئات غير المرئية في سيناريوهات التعلم الاتحادي عبر ست مجموعات بيانات رؤية متنوعة.

Suraj Prasad, Anubha Pant2026-02-24
🤖 AI

A Computer Vision Framework for Multi-Class Detection and Tracking in Soccer Broadcast Footage

تقدم هذه الورقة إطار عمل للرؤية الحاسوبية من كاميرا واحدة ومنخفض التكلفة باستخدام YOLO وByteTrack لاستخراج بيانات تتبع اللاعبين والحكام من لقطات البث القياسية لكرة القدم، مما يساهم في إتاحة التحليلات المتقدمة للفرق ذات الميزانيات المنخفضة رغم التحديات المستمرة في اكتشاف الكرة.

Daniel Tshiani2026-02-24
🤖 machine learning

Wide Open Gazes: Quantifying Visual Exploratory Behavior in Soccer with Pose Enhanced Positional Data

تقدم هذه الورقة طريقة جديدة، مستمرة وغير مرتبطة بالموقع، لقياس سلوك الاستكشاف البصري في كرة القدم من خلال الجمع بين تتبع الوضعية المعزز والنماذج الاحتمالية للرؤية والتحكم في الملعب، مما يثبت أن هذه المقاييس البصرية المجمعة تتنبأ بالنجاح قصير المدى عند الاستحواذ على الكرة في كوبا أمريكا 2024.

Joris Bekkers2026-02-24
🤖 AI

Sketch2Feedback: Grammar-in-the-Loop Framework for Rubric-Aligned Feedback on Student STEM Diagrams

يقدم Sketch2Feedback إطار عمل يعتمد على القواعد ضمن الحلقة، يقوم بتفكيك تحليل الرسوم التخطيطية لمجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) إلى إدراك هجين، وبناء رسوم بيانية رمزية، وفحص القيود، وذلك لتقليل الهلوسة بشكل كبير وتحسين قابلية تنفيذ التغذية الراجعة المتوافقة مع معايير التقييم مقارنة بالنماذج اللغوية متعددة الوسائط كاملة المسار.

Aayam Bansal2026-02-24
🤖 machine learning

Do Generative Metrics Predict YOLO Performance? An Evaluation Across Models, Augmentation Ratios, and Dataset Complexity

تقيم هذه الورقة ما إذا كانت المقاييس التوليدية القياسية يمكنها التنبؤ بأداء YOLOv11 عبر مستويات متفاوتة من تعقيد البيانات ونسب التعزيز، حيث وجدت أنه بينما يعزز التعزيز الاصطناعي دقة الكشف بشكل كبير في الأنظمة الصعبة، فإن الارتباط بين مقاييس مجموعة بيانات ما قبل التدريب ومتوسط الدقة المتوسط (mAP) اللاحق يعتمد بشدة على النظام ويضعف غالباً عند التحكم في كمية التعزيز.

Vasile Marian, Yong-Bin Kang, Alexander Buddery2026-02-24
💻 computer science

Image-Based Classification of Olive Varieties Native to Turkiye Using Multiple Deep Learning Architectures: Analysis of Performance, Complexity, and Generalization

تقيم هذه الدراسة عشر بنيات للتعلم العميق لتصنيف خمسة أنواع من زيتون المائدة الأسود التركي الأصلي باستخدام مجموعة بيانات مكونة من 2,500 صورة، حيث وجدت أن نموذج EfficientNetV2-S حقق أعلى دقة (95.8%) بينما قدم نموذج EfficientNetB0 التوازن الأمثل بين الأداء والكفاءة الحسابية، مما أثبت في النهاية أن الكفاءة البارامترية أكثر أهمية من عمق النموذج في ظل ظروف البيانات المحدودة.

Hatice Karatas, Irfan Atabas2026-02-24
💻 computer science

Morphological Addressing of Identity Basins in Text-to-Image Diffusion Models

تُثبت هذه الورقة أن البنى المورفولوجية، التي تتراوح من واصفات السمات الوصفية إلى الأنماط الصوتية-الرمزية تحت-اللفظية في المطالبات، تُنشئ تدرجات قابلة للملاحة داخل نماذج الانتشار من النص إلى الصورة، مما يسمح بالتوليد المنهجي لأحواض هوية محددة ومفاهيم بصرية متماسكة دون الحاجة إلى أسماء مستهدفة أو صور تدريبية.

Andrew Fraser2026-02-24