🤖 AI

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

تقدم الورقة البحثية إطار عمل DIRECT، وهو إطار عمل هرمي متعدد الوكلاء يعالج التحدي المعقد المتمثل في إنشاء عمليات دمج مقاطع الفيديو (video mashup) آلياً من خلال تفكيك العملية إلى مراحل كتابة السيناريو، والإخراج، والتحرير لضمان التماسك الدلالي والبصري والسمعي بمستوى احترافي، وهو ما تم التحقق منه عبر معيار Mashup-Bench الجديد.

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen2026-04-07
🤖 AI

FileGram: Grounding Agent Personalization in File-System Behavioral Traces

لمعالجة أوجه القصور الناجمة عن قيود البيانات والنهج المتمحور حول التفاعل في تخصيص وكلاء الذكاء الاصطناعي للعمل المشترك، تقترح الورقة البحثية "FileGram"، وهو إطار عمل شامل يتميز بمحرك بيانات قابل للتوسع، ومعيار تشخيصي، وبنية ذاكرة من أسفل إلى أعلى ترتكز في تخصيص الوكيل على آثار سلوكية دقيقة لنظام الملفات.

Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang Yang, Chen Change Loy, Ziwei Liu2026-04-07
💬 NLP

Vero: An Open RL Recipe for General Visual Reasoning

تُعد "فيرو" (Vero) عائلة مفتوحة بالكامل من نماذج الرؤية واللغة التي تحقق أداءً رائدًا في مجال الاستدلال البصري العام من خلال توسيع نطاق التعلم التعزيزي عبر 600 ألف عينة متنوعة ومكافآت موجهة للمهام، مما يثبت أن التغطية الواسعة للبيانات هي المحرك الأساسي للنجاح دون الاعتماد على بيانات أو أنماط تفكير مملوكة لجهات خاصة.

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu2026-04-07
🤖 AI

Your Pre-trained Diffusion Model Secretly Knows Restoration

تكشف هذه الورقة أن نماذج الانتشار المدربة مسبقاً تمتلك بطبيعتها قدرات ترميم يمكن إطلاقها من خلال تدريب تضمينات النصوص (prompt embeddings) ضمن صياغة جسر الانتشار (diffusion bridge) لمواءمة ديناميكيات التدريب والاستدلال، مما يحقق ترميماً عالي الأداء وشاملاً (all-in-one) دون الحاجة إلى ضبط دقيق أو وحدات تحكم متخصصة.

Sudarshan Rajagopalan, Vishal M. Patel2026-04-07
🤖 machine learning

Swish-T : Enhancing Swish Activation with Tanh Bias for Improved Neural Network Performance

تقدم هذه الورقة عائلة دوال التنشيط Swish-T، التي تعزز دالة Swish الأصلية من خلال دمج انحياز التان هانت (Tanh) لإنشاء منحنيات أكثر سلاسة وغير رتيبة تُحسن تجريبيًا أداء الشبكات العصبية عبر مختلف النماذج ومجموعات البيانات المرجعية.

Youngmin Seo, Jinha Kim, Unsang Park2026-04-06
🤖 AI

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

تقدم هذه الورقة البحثية ForgeryGPT، وهو إطار عمل جديد للنماذج اللغوية الكبيرة متعددة الوسائط يعزز كشف تزييف الصور وتحديد مواقعه من خلال دمج مستخرج تزييف مدرك للقناع (Mask-Aware Forgery Extractor) لالتقاط الارتباطات الجنائية عالية الرتبة وتمكين التحليل القابل للتفسير على مستوى البكسل عبر استراتيجية تدريب متخصصة مكونة من ثلاث مراحل.

Jiawei Liu, Fanrui Zhang, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha2026-04-06
⚡ electrical engineering

Clinical utility of foundation models in musculoskeletal MRI for biomarker fidelity and predictive outcomes

تُظهر هذه الدراسة أن النماذج التأسيسية التي تم ضبطها بدقة يمكنها تحويل صور الرنين المغناطيسي الروتينية للجهاز العضلي الهيكلي إلى مؤشرات حيوية كمية معيارية وموثوقة، تعمل في الوقت ذاته على تحسين سير العمل السريري من خلال الفرز التلقائي وتتيح التنبؤ الدقيق طويل الأمد بمخاطر استبدال الركبة وفصال العظام.

Gabrielle Hoyer, Michelle W Tong, Rupsa Bhattacharjee, Valentina Pedoia, Sharmila Majumdar2026-04-06
🤖 machine learning

gen2seg: Generative Models Enable Generalizable Instance Segmentation

تقترح الورقة البحثية "gen2seg"، وهي طريقة تعيد توظيف النماذج التوليدية مسبقة التدريب مثل Stable Diffusion وMAE من أجل تقسيم مثالي مستقل عن الفئة عبر ضبطها بدقة باستخدام فقد تلوين المثيل على مجموعة بيانات ضيقة، محققةً تعميماً قوياً لصفر من المعرفة (zero-shot) يضاهي أو يتفوق على النماذج الخاضعة للإشراف المكثف مثل SAM في أنواع الكائنات غير المرئية والحدود الغامضة.

Om Khangaonkar, Hamed Pirsiavash2026-04-06
🤖 AI

Differential-UMamba: Rethinking Tumor Segmentation Under Limited Data Scenarios

تقدم الورقة البحثية Diff-UMamba، وهي بنية مبتكرة تجمع بين UNet وMamba مع وحدة لتقليل الضوضاء تعتمد على تفاضل الإشارة لتعزيز دقة ومتانة تقسيم الأورام في سيناريوهات التصوير الطبي شحيحة البيانات.

Dhruv Jain, Romain Modzelewski, Romain Herault, Clement Chatelain, Eva Torfeh, Sebastien Thureau2026-04-06
🤖 AI

SmartCLIP: Modular Vision-language Alignment with Identification Guarantees

تقدم هذه الورقة SmartCLIP، وهو إطار عمل معياري مبتكر قائم على ضمانات نظرية يعمل بفعالية على فك تشابك التمثيلات المرئية ومواءمتها مع المفاهيم النصية بمستويات متفاوتة من الدقة للتغلب على مشكلات عدم توافق المعلومات وتشابكها المتأصلة في نماذج CLIP القياسية.

Shaoan Xie, Lingjing Kong, Yujia Zheng, Yu Yao, Zeyu Tang, Eric P. Xing, Guangyi Chen, Kun Zhang2026-04-06