🤖 AI

Hierarchical and Multimodal Data for Daily Activity Understanding

تقدم هذه الورقة DARai، وهي مجموعة بيانات متعددة الوسائط شاملة تضم أكثر من 200 ساعة من التسجيلات المستمرة لـ 50 مشاركاً عبر 10 بيئات باستخدام 20 مستشعراً متنوعاً، والمصممة بشكل فريد بنظام تعليق توضيحي هرمي ثلاثي المستويات للنهوض بفهم الأنشطة البشرية من خلال مهام التعرف والتحديد والاستباق.

Ghazal Kaviani, Yavuz Yarici, Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegib, Mashhour Solh, Ameya Patil2026-03-30
💻 computer science

CheXGenBench: A Unified Benchmark For Fidelity, Privacy and Utility of Synthetic Chest Radiographs

تقدم الورقة البحثية CheXGenBench، وهو إطار عمل مرجعي موحد يقيم دقة وخصوصية والمنفعة السريرية لصور الأشعة السينية الاصطناعية للصدر عبر 11 نموذجاً من نماذج تحويل النص إلى صورة باستخدام أكثر من 20 مقياساً معيارياً، مع إطلاق مجموعة بيانات صور اصطناعية تبلغ 75 ألف صورة (SynthCheX-75K) لدفع أبحاث الذكاء الاصطناعي الطبي.

Raman Dutt, Pedro Sanchez, Yongchen Yao, Steven McDonagh, Sotirios A. Tsaftaris, Timothy Hospedales2026-03-30
🤖 machine learning

FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation

تُعد FastCache إطار عمل يعمل على تسريع استنتاج نماذج "Diffusion Transformer" من خلال الجمع بين اختيار الرموز المدرك للمكان، والتخزين المؤقت للكمونات على مستوى المحول، ودمج الرموز القائم على البحث عن أقرب جار (k-NN) لتقليل الفائض الحسابي مع الحفاظ على جودة التوليد عبر التقريب الخطي القابل للتعلم.

Dong Liu, Yanxuan Yu, Jiayi Zhang, Yifan Li, Ben Lengerich, Ying Nian Wu2026-03-30
💻 computer science

IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout

تقدم الورقة البحثية IMAGHarmony، وهو إطار عمل فعال من حيث المعلمات يتيح تحرير الصور بشكل قابل للتحكم مع الحفاظ على اتساق عدد الأجسام وتخطيطها، وذلك عبر استخدام وحدة واعية بالتناغم واختيار ضوضاء موجه بالتفضيلات، وقد تم التحقق من صحته من خلال تجارب مكثفة ومن خلال معيار HarmonyBench الجديد.

Fei Shen, Yutong Gao, Jian Yu, Xiaoyu Du, Jinhui Tang2026-03-30
💻 computer science

Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring

تقدم هذه الورقة Score2Instruct، وهو مسار مؤتمت يعمل على توليد مجموعة بيانات ضخمة مكونة من 320 ألف زوج من التعليمات والاستجابات المتمحورة حول جودة الفيديو عبر ربط درجات الأبعاد المؤتمتة بمستويات نصية باستخدام استدلال تسلسلي (Chain-of-Thought) هرمي، مما يمكّن النماذج اللغوية الكبيرة متعددة الوسائط للفيديو من تحسين قدراتها في تقييم الجودة والتبرير بشكل كبير دون الاعتماد على التوضيحات البشرية أو الأنظمة المملوكة لجهات أخرى.

Qizhi Xie, Kun Yuan, Yunpeng Qu, Jiachao Gong, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu2026-03-30
💻 computer science

TimeSenCLIP: A Time Series Vision-Language Model for Remote Sensing

يُعد TimeSenCLIP نموذجاً خفيف الوزن للرؤية واللغة يعمل على محاذاة السلاسل الزمنية متعددة الأطياف لصور سنتينل-2 مع الصور الأرضية ذات الإحداثيات الجغرافية باستخدام إطار تبايني زمني عبر الرؤى، مما يتيح تحليلاً فعالاً للاستشعار عن بعد دون الحاجة إلى تعليقات نصية من خلال إعطاء الأولوية للإشارات الزمنية والطيفية على السياق المكاني.

Pallavi Jain, Diego Marcos, Dino Ienco, Roberto Interdonato, Tristan Berchoux2026-03-30
💻 computer science

A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering

تقترح الورقة البحثية إطار عمل A.I.R.، وهو إطار عمل تكيفي وتكراري ولا يتطلب تدريباً، يستفيد من نموذج رؤية ولغة قوي للتحليل الدلالي العميق للاستعلام من أجل اختيار أكثر إطارات الفيديو صلة بكفاءة، مما يتغلب على المقايضة بين الدقة والكفاءة في مجال الإجابة على الأسئلة المتعلقة بالفيديو.

Yuanhao Zou, Shengji Jin, Andong Deng, Youpeng Zhao, Jun Wang, Chen Chen2026-03-30
💻 computer science

SSeg: Active Sparse Point-Label Augmentation for Semantic Segmentation

تقدم الورقة البحثية SSeg، وهو إطار عمل مبتكر يجمع بين أخذ العينات النشط للحصول على تسميات النقاط بكفاءة واستراتيجية انتشار هجينة تستفيد من SAM2 والـ superpixels للتغلب على التكلفة العالية للتعليق الكثيف في التجزئة الدلالية للاستشعار عن بعد.

Cesar Borja, Carlos Plou, Ruben Martinez-Cantin, Ana C. Murillo2026-03-30
💻 computer science

IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

تقدم هذه الورقة IVEBench، وهي مجموعة اختبار حديثة صُممت لمعالجة أوجه القصور في طرق التقييم الحالية من خلال توفير مجموعة بيانات متنوعة تضم 600 فيديو عالي الجودة، و8 فئات لمهام التحرير، وبروتوكول شامل ثلاثي الأبعاد لتقييم تحرير الفيديو الموجه بالتعليمات.

Yinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng, Zhucun Xue, Qingdong He, Chengjie Wang, Yong Liu, Xiaobin Hu, Shuich (…)2026-03-30
💻 computer science

Learning Neural Parametric 3D Breast Shape Models for Metrical Surface Reconstruction From Monocular RGB Videos

تقدم هذه الورقة liRBSM، وهو مسار عمل منخفض التكلفة ومفتوح المصدر يستفيد من نموذج بارامتري عصبي ضمني محلي لإعادة بناء هندسة ثلاثية الأبعاد دقيقة وصحيحة مترياً للثدي من مقاطع فيديو RGB أحادية العدسة بهوامش خطأ تقل عن 2 مم.

Maximilian Weiherer, Antonia von Riedheim, Vanessa Brébant, Bernhard Egger, Christoph Palm2026-03-30