💻 computer science

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

تقدم هذه الورقة البحثية كشف التزييف العميق للاستماع (LDD) كتوجه بحثي جديد يتجاوز تحليل التزييف التقليدي المرتكز على التحدث، حيث تقدم مجموعة بيانات ListenForge ونموذج MANet لتحديد عدم الاتساق الدقيق في حركات الاستجابة أثناء الاستماع المصنعة والموجهة بواسطة صوت المتحدث بفعالية.

Miao Liu, Fangda Wei, Jing Wang, Xinyuan Qian2026-04-15
💻 computer science

Hypergraph-State Collaborative Reasoning for Multi-Object Tracking

تقترح هذه الورقة البحثية HyperSSM، وهو إطار عمل مبتكر يدمج حسابات المخططات الفائقة (hypergraph) مع نماذج فضاء الحالة (State Space Models) لتمكين الاستدلال التعاوني بين الكائنات المترابطة، مما يحقق أداءً قوياً ورائداً في تتبع الأجسام المتعددة من خلال تثبيت المسارات المشوشة والحفاظ على الاستمرارية أثناء حالات الحجب.

Zikai Song, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang, Xinchao Wang2026-04-15
🤖 AI

ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search

تقدم الورقة البحثية ARGOS، وهو معيار وإطار عمل مبتكر يعيد صياغة عملية البحث عن الأشخاص عبر كاميرات متعددة كمهام استدلال وكيل تفاعلية، حيث يتعين على الوكيل تخطيط الاستعلامات واستخدام أدوات مكانية-زمانية لتحديد هوية الأفراد بناءً على إفادات شهود غامضة عبر 2,691 سيناريو من واقع الحياة.

Myungchul Kim, Kwanyong Park, Junmo Kim, In So Kweon2026-04-15
🤖 machine learning

Generative Anonymization in Event Streams

تقدم هذه الورقة أول إطار عمل توليدي لإخفاء الهوية لتدفقات الأحداث العصبية، والذي يعالج المقايضة بين المنفعة والخصوصية من خلال تخليق هويات واقعية ولكن غير موجودة لمنع تحديد الهوية البشرية مع الحفاظ على السلامة الهيكلية المطلوبة لمهام الرؤية اللاحقة، مصحوباً بمجموعة بيانات حقيقية متزامنة جديدة للتقييم الصارم.

Adam T. Müller, Mihai Kocsis, Nicolaj C. Stache2026-04-15
🤖 AI

Detecting and refurbishing ground truth errors during training of deep learning-based echocardiography segmentation models

تُظهر هذه الدراسة أن طريقة تباين التدرجات (Variance of Gradients) فعالة في اكتشاف الأخطاء في تسميات الحقيقة الأرضية لتجزئة صور صدى القلب، وأن تصحيح هذه الأخطاء أثناء عملية التدريب يحسن أداء النموذج بشكل كبير، لا سيما عند مستويات الخطأ العالية.

Iman Islam, Bram Ruijsink, Andrew J. Reader, Andrew P. King2026-04-15
🤖 machine learning

VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

يقدم VideoFlexTok طريقة لترميز الفيديو من الخشن إلى الناعم وذات طول مرن، تستبدل تمثيلات الشبكة ثلاثية الأبعاد الثابتة بتسلسلات رموز متغيرة الطول، مما يتيح تدريباً أكثر كفاءة وتوليد فيديوهات طويلة عبر إعطاء الأولوية للدلالات المجردة والحركة قبل التفاصيل الدقيقة.

Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, R Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehg (…)2026-04-15
🤖 machine learning

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

تقدم هذه الورقة برامج الإدراك (P2^2)، وهي طريقة لا تتطلب تدريباً تعمل على تحويل مخرجات أدوات الرؤية الكثيفة ذات مستوى البكسل إلى ملخصات موجزة ذات طبيعة لغوية، مما يمكّن النماذج اللغوية متعددة الوسائط من تحقيق مكاسب كبيرة في الأداء في مهام الاستدلال البصري دون الحاجة إلى إعادة تدريب النموذج أو إجراء تعديلات عليه.

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi2026-04-15
🤖 AI

Distorted or Fabricated? A Survey on Hallucination in Video LLMs

تقدم هذه الدراسة المسحية تحليلاً شاملاً للهلوسة في النماذج اللغوية الكبيرة للفيديو من خلال تقديم تصنيف منهجي يميز بين التشويه الديناميكي وتزييف المحتوى، ومراجعة استراتيجيات التقييم والتخفيف الحالية، وتحديد الاتجاهات البحثية المستقبلية لبناء أنظمة فيديو-لغة أكثر متانة.

Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu2026-04-15
🤖 machine learning

Adaptive Data Dropout: Towards Self-Regulated Learning in Deep Neural Networks

تقترح هذه الورقة البحثية "التسرب التكيفي للبيانات" (Adaptive Data Dropout)، وهو إطار عمل للتعلم ذاتي التنظيم يقوم بتعديل مجموعة فرعية من بيانات التدريب ديناميكيًا بناءً على تغذية راجعة للأداء لتحسين الكفاءة والتعميم في الشبكات العصبية العميقة.

Amar Gahir, Varshil Patel, Shreyank N Gowda2026-04-15
💻 computer science

Boosting Visual Instruction Tuning with Self-Supervised Guidance

تقترح هذه الورقة V-GIFT، وهي طريقة خفيفة الوزن تعزز قدرات الاستدلال البصري للنماذج اللغوية الكبيرة متعددة الوسائط من خلال دمج جزء صغير من مهام التمهيد ذاتية الإشراف المعاد صياغتها كتعليمات لغوية طبيعية في بيانات التدريب، مما يجبر النماذج على الاعتماد على الأدلة البصرية بدلاً من الأولويات اللغوية.

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris2026-04-15