💻 computer science

AmalthAI: An Open-Source Computer Vision Platform for Cultural Heritage

تُعد AmalthAI منصة مفتوحة المصدر وقابلة للاستضافة الذاتية للرؤية الحاسوبية، صُممت لتمكين خبراء التراث الثقافي غير التقنيين من تدريب نماذج تعلم الآلة والتحقق من صحتها وتفسيرها بشكل مستقل لتحليل القطع الأثرية، مع ضمان بقاء البيانات الحساسة ضمن حوزة المؤسسات.

Christos Chatzisavvas, Stelios Alvanos, Efstratios Politis, Panagiotis Rigas, Thomas Pappas, Ioannis Giannoukos, Nikolao (…)2026-08-14
💻 computer science

Sign Language Video Synthesis via Loss-Guided Multi-Expert GANs

يقدم هذا التقرير التقني إطار عمل لشبكة خصومية توليدية (GAN) متعددة الخبراء وموجهة بالخسارة، تستخدم مميزات تمييز متخصصة، وآلية إجماع "الخسارة الموحدة" (United Loss)، وبنية مسار مزدوج تعتمد على التلافيف والمحولات (convolutional-transformer) لتخليق فيديوهات للغة الإشارة عالية الجودة بكفاءة على الأجهزة الاستهلاكية.

Dingzhan Nong, Zhihao Ren, Ziqi Li, Tim Lo2026-08-14
💻 computer science

ContactGuard: Pre-Contact Execution Monitoring with Action-Conditioned Latent World Models

يُعد ContactGuard نظاماً لمراقبة التنفيذ ما قبل التلامس، يستخدم نموذج عالم كامن مشروط بالأفعال تم تدريبه على بيانات غير مصنفة للتنبؤ بالتبعات البصرية قصيرة المدى للأفعال المخطط لها، مما يتيح الكشف في الوقت الفعلي عن الفشل وإشارات الإلغاء لمهام المناولة الغنية بالتلامس دون تعديل السياسة الأساسية.

Gehan Zheng, Matthew Johnson-Roberson, Weiming Zhi2026-08-14
💻 computer science

Evaluation of Clinically Steerable Retinal Image Generation from Foundation Model Latent Spaces

تقيم هذه الورقة قدرة النماذج التأسيسية لشبكية العين على توليد صور قابلة للتحكم تحافظ على الأنماط الظاهرية السريرية، حيث وجدت أنها تتفوق على الطرق التقليدية ضمن أطر عملها الخاصة، لكنها تظهر فجوة تمثيلية كبيرة بين الصور الاصطناعية والحقيقية عند تقييمها مقابل مصنفات الصور الحقيقية.

Zuzanna A. Wakefield-Skórniewska, Bartłomiej W. PapieĊ2026-08-14
💻 computer science

A Unifying Perspective on Causal World Models: From Observations to Representations to Structure

تقترح هذه الورقة إطاراً رسمياً لنماذج العالم السببية يوحد مستويات متعددة من التجريد —من الملاحظات إلى التمثيلات الهيكلية— لتمكين الوكلاء من استيعاب خصائص الكيانات وتفاعلاتها من أجل التنبؤ والتخطيط واتخاذ القرار القوي خارج نطاق توزيع التدريب الخاص بهم.

Avinash Kori, Fabrizio Russo2026-08-14
💻 computer science

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

تقترح الورقة البحثية إطار عمل SNM-VFI، وهو إطار عمل لا يتطلب تدريباً يعمل على تعزيز استكمال إطارات الفيديو من خلال توجيه نماذج انتشار الفيديو مسبقة التدريب باستخدام مسبقات كامنة مشتقة من حركة غير خطية متماثلة وخرائط ثقة لتحقيق نتائج عالية الجودة ومتسقة حركياً دون الحاجة إلى تدريب إضافي.

Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli2026-08-14
🤖 machine learning

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

تقدم الورقة البحثية ARMDIL، وهو إطار عمل تجميعي تكيفي يستفيد من نموذج لغوي كبير متعدد الوسائط لتوجيه الصور ديناميكيًا إلى العمود الفقري الرؤيوي غير المتجانس الأكثر ملاءمة، مما يحقق تصنيفًا قويًا عبر مجموعات البيانات، وتعزيزًا للقدرة على التكيف من خلال هندسة الأوامر، وتحسينًا لقابلية التفسير عبر الاستدلال باللغة الطبيعية.

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck2026-08-14
🤖 machine learning

TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

يُعد TRAVel إطار عمل للضبط الدقيق المدرك للحركة يعزز استرجاع فيديوهات القيادة من خلال الاستفادة من تشابه مسار المركبة (ego-trajectory) كمكافأة ضمن عملية تحسين السياسة النسبية للمجموعات (Group Relative Policy Optimization)، مما يمكّن النماذج متعددة الوسائط للأغراض العامة من التمييز بفعالية بين الأحداث المتمحورة حول الحركة دون الاعتماد على بيانات إدراكية مساعدة أو قواعد خبيرة.

Yi-Chung Chen, Philip Jacobson, Tom Lampo, Yiren Lu, Jin Yao, David I. Inouye, Jing Gao, Danhua Guo, Burhan Yaman2026-08-14
💻 computer science

GS2^{2}CI: Robust Gaussian Splatting For Snapshot Compressive Imaging via Large Vision Model Priors

تقترح هذه الورقة البحثية إطار عمل GS2^{2}CI، وهو إطار عمل مبتكر يستفيد من تقنية التشتت الغاوسي ثلاثي الأبعاد (3D Gaussian Splatting) ومسبقات النماذج الرؤية الأساسية الضخمة، جنباً إلى جنب مع استراتيجية تكثيف متخصصة موجهة بالعتامة، لتحقيق إعادة بناء مشهد ثلاثي الأبعاد قوي وعالي الجودة من قياس واحد للتصوير الضغطي اللحظي.

Yanming Yang, Chenxi Song, Ping Wang, Xin Yuan, Chi Zhang2026-08-14
🤖 machine learning

Intern-S2-Preview: Scientific Agentic Foundation Model

تقدم الورقة البحثية Intern-S2-Preview، وهي سلسلة من النماذج التأسيسية الوكيلية العلمية التي تم تدريبها من خلال مسار تدريب مسبق متعدد الوسائط متخصص ومسار تدريب لاحق موحد يتميز بالتعلم التعزيزي المتقدم والبنى المعززة بالذاكرة لتحقيق أداء رائد في الاستدلال العلمي، والتفاعل مع الأدوات، والمهام طويلة الأمد.

Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangh (…)2026-08-14