💻 computer science

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

تقترح هذه الورقة نموذج الانتشار التكراري الذاتي الانحدار (RAD)، وهو إطار عمل مبتكر يدمج طبقات تكرارية قائمة على الذاكرة الطويلة قصيرة المدى (LSTM) في نماذج محولات الانتشار لتمكين الاحتفاظ الفعال بالذاكرة العالمية والحفاظ على التفاصيل المحلية من أجل توليد فيديوهات فائقة الطول وعالية الجودة دون فجوات بين التدريب والاستنتاج.

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin2026-07-28
🤖 machine learning

Operator learning for models of tear film breakup

تقترح هذه الورقة إطار عمل لتعلم العمليات قابل للتوسع يستبدل الحلول العكسية المكلفة حاسوبياً بالمؤثرات العصبية المدربة على ديناميكيات الغشاء الدمعي المحاكية لتمكين التقدير السريع القائم على البيانات لسمك الغشاء الدمعي والأسمولية من خلال التصوير الفلوري.

Qinying Chen, Arnab Roy, Tobin A. Driscoll2026-07-28
💬 NLP

A Mechanistic Perspective and Circuit-Guided Difficulty Metric for Unlearning

تقدم هذه الورقة البحثية مقياس "صعوبة النسيان الموجه بالدوائر" (CUD)، وهو مقياس لما قبل عملية النسيان يعتمد على دوائر النموذج لتقدير تحديات نسيان العينات النوعية من خلال الكشف عن أن العينات التي يصعب نسيانها تعتمد على مسارات حوسبة أعمق وأطول مقارنة بالعينات الأسهل.

Jiali Cheng, Ziheng Chen, Chirag Agarwal, Hadi Amiri2026-07-28
💻 computer science

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

تقترح هذه الورقة نموذج UniSkip-Mamba، وهو نموذج حالة فضاء (State Space Model) مدرك للتردد يعزز تحديد تزييف المحتوى السمعي البصري الزمني من خلال التركيز انتقائياً على الأنماط التمييزية ذات التردد المنخفض إلى المتوسط مع تصفية الضوضاء عالية التردد، مما يحقق دقة هي الأفضل في فئتها وسرعة استنتاج أكبر بكثير.

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang2026-07-28
💻 computer science

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

يقدم البحث EmoAgent-R1، وهو إطار عمل مبتكر يستفيد من التخصص الديناميكي للوكلاء القائم على التعلم التعزيزي وخوارزمية تحسين السياسة النسبية للمجموعة التقدمية (P-GRPO) لتعزيز التعرف على العواطف متعدد الوسائط من خلال تمكين النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) من تكييف استراتيجيات الاستدلال الخاصة بها ديناميكيًا مع مصادر العواطف المعقدة والمتغيرة.

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin2026-07-28
🤖 AI

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

تقترح الورقة البحثية إطار عمل MM-R2، وهو إطار عمل وكيل متعدد الوسائط يعمل على تحسين التوليد المعزز بالاسترجاع من خلال التفكير الصريح في أهداف الاسترجاع وهيكلة فضاء البحث عبر خريطة معرفية (KnowledgeMap)، مدعوماً بمجموعة بيانات مسار جديدة واستراتيجية تدريب لاحق على مرحلتين لتحقيق دقة وقابلية تفسير فائقتين في مجموعات البيانات المرجعية.

Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang2026-07-28
🤖 machine learning

DocHRL: A Hierarchical Reinforcement Learning Framework for Cost-Optimised Document Classification

يُعد DocHRL إطار عمل للتعلم التعزيزي الهرمي يقوم باختيار سياسة التصنيف الأكثر فعالية من حيث التكلفة لكل مستند ديناميكيًا عبر الموازنة بين تكاليف الاستدلال، والتصنيف الخاطئ، والمراجعة البشرية، محققًا أداءً فائقًا وكفاءة تشغيلية على معيار RVL-CDIP مقارنة بمسارات العمل الثابتة.

Mohammed Yousif, Prabhjot Singh, Arjun Pankajakshan, Madhu Reddiboina2026-07-28
🤖 AI

MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion

يُمكِّن MegaSlide-DiT التكيف بجميع المعلمات لنماذج الانتشار المرئي الضخمة بسعة 105 مليار بارامتر على وحدة معالجة رسوميات واحدة لمحطة عمل عبر ترحيل حالات النموذج المستمرة إلى ذاكرة المضيف واستبدال الانتباه العالمي التربيعي بآلية انتباه انزلاقي ثلاثي الأبعاد مشوه، ذات تعقيد خطي ومتكيف مع الحركة.

Jiacheng Liu, Jason Liu2026-07-28
🤖 machine learning

Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning

تقدم هذه الورقة البحثية TTCov، وهي طريقة لتنقية البيانات مشروطة بالاختبار تقوم ببناء أطلس معرفي من عينات النشر لاختيار بيانات التدريب بتغطية محسنة ومطابقة للتوزيع، مما يعزز أداء القيادة الذاتية دون الحاجة إلى تحديث النموذج في وقت الاستدلال.

Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose (…)2026-07-28
💻 computer science

FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog

تقدم هذه الورقة FogDrive، وهي مجموعة بيانات اصطناعية متعددة الوسائط ومعايرة بدقة، تتميز ببيانات متزامنة من الكاميرا والليدار والرادار عبر أربعة مستويات من الرؤية ودورات ليلية ونهارية، صُممت لسد الفجوات في المعايير المرجعية الحالية وتمكين التقييم القوي لأنظمة الإدراك تحت ظروف ضباب متدرجة.

Vansh Panwar2026-07-28