💻 computer science

PRIMA: Pre-Training with Risk-Integrated Image--Metadata Alignment for Medical Diagnosis with LLM-Based Feature Aggregation

يُعد PRIMA إطار عمل مبتكر للتشخيص الطبي يدمج المعرفة السريرية المرتبطة بالمخاطر عبر ترميز نصي مُحسَّن بتقنية التوليد المعزز بالاسترجاع (RAG) والتدريب المسبق ثنائي المُشفِّر مع خسائر محاذاة متعددة المستويات لدمج الميزات البصرية والميتا-بيانات بفعالية، محققاً أداءً هو الأفضل في فئته على مجموعات البيانات المرجعية دون الحاجة إلى موارد حوسبية ضخمة.

Yiqing Wang, Chunming He, Ziyun Yang, Maria Woodward, Ming-Chen Lu, Mercy Pawar, Leslie Niziol, Sina Farsiu2026-07-29
💻 computer science

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

تقترح هذه الورقة إطار عمل لانتشار الفيديو من طرف إلى طرف يحقق تركيباً سينمائياً عالي الجودة من خلال النمذجة المشتركة للتفاعلات الفيزيائية بين الشخصية والبيئة وتناغم الإضاءة بين البيئة والشخصية عبر بنية موجهة بثلاثة أقنعة، وإزالة ضجيج مشتركة لبيانات RGB-D، وآلية مشروطة بمرجع.

Tianyi Xiang, Mingming He, Li Ma, Jing Liao2026-07-29
💻 computer science

DINOv3-MIL: Per-Kidney Multi-Label Tumour and Cyst Detection from Foundation-Model Patch Tokens on KiTS23

تُثبت هذه الورقة أن تعلم المجموعات المتعددة القائم على الانتباه المسقوف (gated attention MIL) المطبق على رموز رقع (patch tokens) نموذج DINOv3 المجمدة، يتفوق على نماذج الاختبار الخطي لرمز CLS ونماذج الرؤوس النموذجية (prototype heads) في الكشف عن أورام وكيسات الكلى في مجموعة بيانات KiTS23، محققاً دقة فائقة مع توفير قدرة معززة على التفسير من خلال إثراء الانتباه ضمن الآفات المشروحة.

Vishalakshi M, Sahil Sharma, Pramod Kumar P2026-07-29
💻 computer science

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

يُعد OmniMate إطار عمل موحداً يتيح توليد صور رمزية (أفاتار) صوتية ومرئية عالية الجودة ومنخفضة زمن الاستجابة وبشكل مفتوح في الوقت الفعلي، وذلك من خلال تقديم وحدة تحكم في تقدم التوليد (Generation Progress Controller) للاستجابة التكيفية، ووحدة تكييف متعددة المراجع (Multi-Reference Conditioning Module) لضمان اتساق الهوية عبر الوسائط على المدى الطويل.

Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo2026-07-29
💻 computer science

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

يُعد DocAnnot إطار عمل مدعومًا بالذكاء الاصطناعي التوليدي يعمل على تسريع إنشاء مجموعات بيانات استخراج المعلومات الرئيسية من خلال الجمع بين نماذج اللغات الرؤية الكبيرة، والتعرف الضوئي على الحروف (OCR)، وخوارزمية مطابقة سياقية معلوماتية مكانية مبتكرة لتوليد تسميات تلقائية عالية الجودة تقلل بشكل كبير من الجهد اليدوي مع تمكين التدريب الفعال للنماذج في المراحل اللاحقة.

Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina2026-07-29
💻 computer science

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

تقدم هذه الورقة AVE-Compass، وهو معيار شامل مصمم لتقييم قدرات تحرير الصوت والفيديو بشكل شمولي من خلال مقاييس قائمة على قوائم مراجعة دقيقة، وتقترح AVE-Agent، وهو إطار عمل معياري يستفيد من التأمل الذاتي والتغذية الراجعة التكرارية لتحسين اتباع التعليمات عبر الوسائط المتعددة ودقة التنفيذ في مهام التحرير المعقدة بشكل كبير.

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu2026-07-29
💻 computer science

Track-Leakage-Free Hold-Out Self-Validation for Photogrammetric Reconstruction: Protocol, Sensitivity, and Limits

تقدم هذه الورقة بروتوكول استبعاد خالٍ من تسرب التتبع للتحقق الذاتي من عمليات إعادة البناء الفوتوغرامتري، مظهرةً أنه على الرغم من فعاليته في قياس الاتساق الهندسي الداخلي، إلا أنه يفشل في التنبؤ بالدقة المطلقة أو الكشف بشكل موثوق عن النماذج المشوهة عالمياً.

Behnam Asadi2026-07-29
💻 computer science

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

تجادل ورقة الموقف هذه بأن كواشف السمية الشاملة تفشل في حماية المجتمعات المهمشة، مثل ذوي القزامة أو الإعاقات البصرية، وتوضح أن الكشف عن السمية الخاص بالمجتمعات، رغم تحسينه الكبير للتعرف على الضرر من خلال التكيف القائم على المطالبات والضبط الدقيق، لا يزال يتطلب بحثاً مكثفاً للوصول إلى مستويات الأداء التي تحققها الأنظمة العامة.

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camill (…)2026-07-29
💬 NLP

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

يُعد Mage-VL نموذجاً تأسيسياً للبث المباشر، كفؤاً ومبنياً على نظام ترميز (codec-native)، يستفيد من أداة ترميز مدركة للحركة وبنية ذات نظام مزدوج لتحقيق فهم متعدد الوسائط في الوقت الفعلي مع تقليل استهلاك الرموز (tokens) بشكل كبير وتسريع الاستدلال، مع مضاهاة أو تجاوز النماذج الأكبر والأحدث في مهام الاستدلال الثابت والديناميكي.

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, P (…)2026-07-29
💻 computer science

Intrinsic and Triangulation-Agnostic Attention: A Simple and Powerful Approach for Learning on Meshes

تقدم هذه الورقة آلية انتباه جديدة وبسيطة للمشابك المثلثية (triangle meshes) تحقق أداءً فائقاً في مختلف مهام معالجة الهندسة من خلال ضمان الخصائص الجوهرية والمستقلة عن التثليث عبر التعامل مع الاستعلامات والمفاتيح والقيم كدوال مستمرة متقطعة يتم معالجتها عبر تكاملات طريقة العناصر المحدودة.

Ashwath Shetty, Zihan Zhu, Soeren Pirk, Noam Aigerman2026-07-29