💬 NLP

Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models

من خلال سبر أغوار نماذج اللغات الكبيرة متعددة الوسائط (LVLMs) باستخدام مجموعة بيانات رسوم بيانية موجهة اصطناعية، تكشف هذه الدراسة أنه بينما يتم ترميز معلومات العقد والبنية خطياً في مرحلة مبكرة في المشفر البصري، فإن تمثيلات الحواف لا تظهر إلا لاحقاً في الرموز النصية للنموذج اللغوي، مما يفسر معاناة هذه النماذج المستمرة مع الفهم العلاقاتي.

Haruto Yoshida, Keito Kudo, Yoichi Aoki, Ryota Tanaka, Itsumi Saito, Keisuke Sakaguchi, Kentaro Inui2026-03-04
💻 computer science

SemanticDialect: Semantic-Aware Mixed-Format Quantization for Video Diffusion Transformers

تقترح الورقة البحثية SemanticDialect، وهو إطار عمل للكمّنة مختلطة التنسيق ومعتمدة على الدلالة لنماذج محولات الانتشار للفيديو (Video Diffusion Transformers)، يستخدم اختيار التنسيق على مستوى الكتل، وتفكيك التنشيط مع التصحيح المتبقي، وتجميع الرموز الدلالية لتحقيق توليد فيديو عالي الجودة مع تقليل تكاليف الذاكرة والحوسبة بشكل كبير.

Wonsuk Jang, Thierry Tambe2026-03-04
🤖 AI

StegaFFD: Privacy-Preserving Face Forgery Detection via Fine-Grained Steganographic Domain Lifting

تُعد StegaFFD إطار عمل للكشف عن تزييف الوجوه مع الحفاظ على الخصوصية، حيث تقوم بدمج صور الوجوه في صور غطاء طبيعية باستخدام تقنية إخفاء المعلومات (steganography) لتجنب الشبهات، بينما توظف آليات متخصصة للتحلل والانتباه والمحاذاة للكشف بدقة عن عمليات التزييف داخل نطاق الإخفاء رغم التداخل الدلالي.

Guoqing Ma, Xun Lin, Hui Ma, Ajian Liu, Yizhong Liu, Wenzhong Tang, Shan Yu, Chenqi Kong, Yi Yu2026-03-04
💻 computer science

GloPath: An Entity-Centric Foundation Model for Glomerular Lesion Assessment and Clinicopathological Insights

يُعد GloPath نموذجاً تأسيسياً قابلاً للتوسع ومركزاً على الكيانات، تم تدريبه على أكثر من مليون كبيبة كلوية، وهو يتفوق على الأساليب الرائدة في مهام تقييم الآفات المتنوعة ويكشف عن ارتباطات سريرية مرضية هامة، مما يعزز الترجمة السريرية للذكاء الاصطناعي في علم أمراض الكلى.

Qiming He, Jing Li, Tian Guan, Yifei Ma, Zimo Zhao, Yanxia Wang, Hongjing Chen, Yingming Xu, Shuang Ge, Yexing Zhang, Yi (…)2026-03-04
💻 computer science

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

تقترح هذه الورقة طريقة شبه مُشرفة فعالة للتكيف بلقطات قليلة لنماذج الرؤية واللغة في التصوير الطبي، والتي تستفيد من البيانات غير المُصنفة لنشر الملصقات الزائفة المستندة إلى النصوص، مما يقلل متطلبات التوسيم بنسبة تزيد عن 50% مع معالجة تحديات عدم توازن الفئات.

Julio Silva-Rodríguez, Ender Konukoglu2026-03-04
💻 computer science

The Dresden Dataset for 4D Reconstruction of Non-Rigid Abdominal Surgical Scenes

تُعد مجموعة بيانات دريسدن (D4D) معياراً شاملاً يضم أكثر من 300,000 إطار و369 سحابة نقاط من جراحات جثث الخنازير، مما يوفر فيديوهات تنظيرية مقترنة بهندسة الضوء المهيكل عالية الجودة لتمكين التقييم الكمي لطرق إعادة البناء رباعي الأبعاد غير الصلب، وتحديد الموقع ورسم الخرائط آنياً (SLAM)، وتقدير العمق في المشاهد الجراحية البطنية الواقعية.

Reuben Docea, Rayan Younis, Yonghao Long, Maxime Fleury, Jinjing Xu, Chenyang Li, André Schulze, Ann Wierick, Johannes B (…)2026-03-04
💻 computer science

VIRGi: View-dependent Instant Recoloring of 3D Gaussians Splats

تُعد VIRGi طريقة مبتكرة لإعادة تلوين مشاهد Gaussian Splatting ثلاثية الأبعاد بسرعة وواقعية فوتوغرافية من خلال تفكيك اللون إلى مكونات منتشرة (diffuse) وأخرى تعتمد على زاوية الرؤية، مما يتيح تحريراً في الوقت الفعلي باستخدام صورة واحدة يحافظ على اللمعان الانعكاسي ويتفوق على النهج القائم على NeRF.

Alessio Mazzucchelli, Ivan Ojeda-Martin, Fernando Rivas-Manzaneque, Elena Garces, Adrian Penate-Sanchez, Francesc Moreno (…)2026-03-04
🤖 AI

Geometry-Guided Reinforcement Learning for Multi-view Consistent 3D Scene Editing

تقترح هذه الورقة RL3DEdit، وهو إطار عمل للتعلم التعزيزي يستفيد من مسبقات النماذج التأسيسية ثلاثية الأبعاد من VGGT لتوليد مكافآت جديدة لتحسين التحرير القائم على الانتشار ثنائي الأبعاد، مما يحقق اتساقاً مستقراً متعدد الرؤى في تحرير المشاهد ثلاثية الأبعاد دون الحاجة إلى بيانات تدريب مقترنة.

Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, Yuyang Yin, Lang Nie, Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang Liao (…)2026-03-04
🤖 AI

Conditioned Activation Transport for T2I Safety Steering

لمعالجة المقايضة بين السلامة وجودة الصورة في نماذج تحويل النص إلى صورة، يقترح المؤلفون "نقل التنشيط المشروط" (CAT)، وهو إطار عمل يستخدم مجموعة بيانات تباينية وخرائط نقل غير خطية قائمة على الهندسة لتوجيه التنشيطات غير الآمنة دون إضعاف عمليات التوليد السليمة.

Maciej Chrabąszcz, Aleksander Szymczyk, Jan Dubiński, Tomasz Trzciński, Franziska Boenisch, Adam Dziedzic2026-03-04
💬 NLP

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

تقدم هذه الورقة البحثية ACE-Brain-0، وهو دماغ تأسيسي عام يستفيد من الذكاء المكاني كركيزة عالمية ويوظف نموذج (Scaffold-Specialize-Reconcile - SSR) لتوحيد المهام المتجسدة المتنوعة مثل القيادة الذاتية والروبوتات ضمن نموذج لغوي كبير متعدد الوسائط واحد، محققاً أداءً هو الأفضل في فئته عبر 24 معياراً.

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen L (…)2026-03-04