💻 computer science

ReART: Reference-Guided Retrieval and Refinement for Emotion-Aware Art Generation

يُعدُّ deART إطار عمل للاسترجاع والتحسين الموجه بالمرجع، يعمل على تعزيز توليد الفن المدرك للعواطف من خلال تفكيك التسميات التوضيحية إلى مجالات بصرية مهيكلة لاسترجاع مراجع مستهدفة، وتوظيف حلقة مدفوعة بنظام (AAS) لتشخيص وإصلاح حالات فشل المحاذاة، محققاً أداءً رفيع المستوى في تحدي AffectiveArt 2026 Grand Challenge.

Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu2026-08-25
🤖 AI

TransHands: Repurposing Human Pose Encoders as Hand Pose Encoders

تقدم الورقة البحثية TransHands، وهو إطار عمل لنقل التعلم غير مرتبط بهيكل محدد (backbone-agnostic) يعيد توظيف مشفرات حركة جسم الإنسان مسبقة التدريب لتقدير وضعيات اليد ثلاثية الأبعاد بفعالية من مدخلات ثنائية الأبعاد، مما يتغلب على ندرة مجموعات البيانات الضخمة ثلاثية الأبعاد لليد ويثبت تحقيق مكاسب أداء متسقة عبر بنيات متنوعة وسيناريوهات تصوير ذاتي (egocentric) صعبة.

Milo Piccioli, Gianluca Amprimo, Claudia Ferraris, Gabriella Olmo2026-08-25
🤖 AI

Multimodal examination answer data with expert-designed Outcome-Based Education rubrics for criterion-level assessment

تقدم هذه الورقة مجموعة بيانات متعددة الوسائط تضم 485 إجابة امتحانية ممسوحة ضوئيًا من 415 طالبًا عبر أربع مؤسسات، مقترنة بمعايير تقييم مصممة من قبل خبراء وفق منهج التعليم القائم على المخرجات ومع بيانات وصفية شاملة لدعم الأبحاث في التقييم الآلي، وفهم المستندات متعددة الوسائط، والتقييم المراعي للخصوصية.

Jahangir Alam SM, Md Khalid Syfullah, Saad Ahmed, Munira Akter Mou, A K Z Rasel Rahman, A. K. M. Masudur Rahman, Mohamme (…)2026-08-25
💻 computer science

MotionDLO: Hybrid Event- and Frame-Based Tracking of Deformable Linear Objects

يُعد MotionDLO إطار عمل هجينًا لتتبع الأحداث والإطارات في الوقت الفعلي، يستفيد من الدقة الزمنية العالية لكاميرات الأحداث والدقة المكانية لتجزئة الإطارات بالاقتران مع خوارزمية انزياح النقاط المتماسك (Coherent Point Drift) لتحقيق تتبع قوي ومتسق زمنياً وعالي الدقة للأجسام الخطية القابلة للتشوه من أجل المناولة الروبوتية.

Annalena Hartmann, Priyamvada Ajithkumar, Patrick Bründl, Jörg Franke2026-08-25
💻 computer science

M3^3ISR: A Multi-Modal Multi-View Benchmark for 3D/4D Gaussian Splatting and Feedforward Compression

تقدم الورقة البحثية M3^3ISR، وهو معيار مرجعي اصطناعي منضبط يضم ٢٥ مشهداً مع تعليقات توضيحية دقيقة للحقائق الأرضية وخمسة مسارات متخصصة مصممة لتقييم ومقارنة أداء إعادة البناء والضغط والبث لتقنيات Gaussian Splatting ثلاثية ورباعية الأبعاد بشكل منهجي من أجل فيديو عالي الدقة بلمحة نظر حرة.

Xinhui Liu, Lei Liu, Zhenghao Chen, Lebin Zhou, Wei Wang, Wei Jiang2026-08-25
💬 NLP

TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding

تقدم هذه الورقة VES-Bench، وهو معيار مرجعي جديد لتدقيق ما إذا كانت أساليب فهم الفيديوهات الطويلة تقوم بفك تشفير الإطارات التي تغطي جميع الأدلة الضرورية، وتقترح TRACE، وهو وكيل لا يتطلب تدريباً يقوم ببناء حزم أدلة بشكل تكراري لتحقيق دقة إجابة فائقة بتكاليف إطارات أقل بكثير مقارنة بفك التشفير الموحد.

Pengyiang Liu, Junbo Niu, Xiaoyang Hu, Zhongyue Shi, Zitian Wang, Linjiang Huang, Si Liu2026-08-25
💻 computer science

VISTA: Test-Time Compositional Alignment for Visual Autoregressive Generation

تُعد VISTA أول إطار عمل للمحاذاة عند وقت الاختبار قائم على التدرج للنماذج التوليدية البصرية ذاتية الانحدار، حيث يتدخل في عملية التوليد لتحسين التمثيلات الوسيطة، مما يحسن الدقة التركيبية والعلاقات المكانية بشكل كبير دون تعديل معاملات النموذج أو الحاجة إلى تدريب إضافي.

Hossein Shahabadi, Niki Sepasian, Mahdieh Soleymani Baghshah2026-08-25
💻 computer science

RS3^3-Prune: Read-Sparse, Store-Sparse Token Pruning for Video Object Segmentation

تُعد RS3^3-Prune طريقة لتقليم الرموز (token pruning) لا تتطلب تدريباً وتُستخدم لتجزئة الأجسام في الفيديو، حيث تعمل على تقليل زمن الاستجابة عند الاستنتاج وذروة استخدام الذاكرة من خلال التقييد الانتقائي لاستعلامات الانتباه عبر الإطارات ومدخلات بنك الذاكرة للرموز ذات الصلة هندسياً، مما يتيح معالجة فعالة لمقاطع الفيديو طويلة المدى على الأجهزة ذات الذاكرة المحدودة دون التضحية بالدقة.

Avilasha Mandal, Sarvesh Shashikumar2026-08-25
🤖 AI

AI-based worker guidance in assembly and disassembly operations using multimodal ego/exo-centric data capture and structured task knowledge

تقدم هذه الورقة نهجاً متمحوراً حول البيانات يستفيد من مقاطع الفيديو متعددة الأنماط (من منظور الشخص الأول ومن منظور خارجي) والسرد الصوتي لاستخراج معرفة هيكلية بالمهام من عروض الخبراء، مما يتيح توثيقاً إجرائياً فعالاً وتوجيهاً مدركاً للسياق لعمليات التجميع والتفكيك.

Vivek Chavan, Jörg Krüger2026-08-25
💻 computer science

MorphoCLIP: Text-Supervised Contrastive Learning for Perturbation Matching in Cell Painting Images

يقدم البحث نموذج MorphoCLIP، وهو نموذج تعلم تبايني خاضع للإشراف النصي يربط بكفاءة بين صور مجهرية من نوع "Cell Painting" وأوصاف اضطراباتها الكيميائية أو الجينية، مما يظهر تحسناً في أداء الاسترجاع ثنائي الاتجاه مع تسليط الضوء على أن المطابقة الموثوقة بين المركبات والاضطرابات الجينية لا تزال تشكل تحدياً غير محلول.

Sukhrobbek Ilyosbekov (Northeastern University), Shubham Gajjar (Northeastern University), Rongfei Jin (Northeastern Uni (…)2026-08-25