🤖 AI

DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation

تقترح الورقة البحثية DualDiT، وهو نموذج محول انتشار ثنائي المخرجات ومشروط يتفوق على نماذج الانتشار التقليدية القائمة على بنية U-Net في توليد صور التصوير المقطعي للتماسك البصري (OCT) وأقنعة التجزئة لعيون الفئران بشكل واقعي، مما يعالج بفعالية ندرة البيانات من خلال دقة توليدية فائقة وفائدة في عمليات التجزئة اللاحقة.

Fernando García-Torres, Rocío del Amor, Sandra Morales, Álvaro Barroso, Peter Heiduschka, Björn Kemper, Valery Naranjo2026-08-03
💻 computer science

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

يُعد SatEdit إطار عمل لتحرير صور الأقمار الاصطناعية مشروطاً بالقناع، حيث يستفيد من نماذج التجزئة التأسيسية والنماذج الرؤية-اللغوية لتوليد بيانات تدريب مصنفة تلقائياً من صور غير مصنفة، محققاً بذلك تحكماً فائق الدقة مكانياً على مستوى الكائنات ومحاذاة دلالية مقارنة بنماذج التحرير الحالية.

Muhammad Talha, Muhammad Ahmed Amer2026-08-03
💻 computer science

OSEF: One-Step Evidence Fusion for Cross-Video Scene Procedure Planning

تقدم هذه الورقة البحثية مهمة تخطيط إجراءات المشاهد عبر الفيديوهات (CVSPP)، وهي مهمة جديدة تتطلب من النماذج استرجاع الأدلة المرئية ذات الصلة وتخطيط الإجراءات في آن واحد، وتقترح طريقة دمج الأدلة في خطوة واحدة (OSEF)، وهي طريقة تتجنب الاختيار الصارم عبر دمج جميع الأدلة المرشحة في شبكة لينة للتخطيط، محققةً أداءً هو الأفضل في فئته على معيار مرجعي جديد مكون من أحد عشر مصدراً.

Zhentong Ye, Lei Zhang, Sijia Zhou, Yingda Yu, Yuehan Shi, Jiaqi Xuan, Shuaiwu Dong, Guanchao Tong, Meimei Zhang, Bin Li2026-08-03
💻 computer science

Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs

تقدم هذه الورقة البحثية "Role-Break"، وهي ظاهرة موحدة على مستوى الرأس، حيث تظهر الهلوسة في نماذج الرؤية واللغة كاختلافات موضعية في رؤوس الانتباه، مما يتيح تطوير كاشف خطي خفيف الوزن ولا يتطلب ضبطاً دقيقاً يحقق دقة عالية عبر نماذج ومعايير متنوعة.

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Nan Duan, Tong Jia, Chaoran Luo, Ying Li2026-08-03
⚡ electrical engineering

MoPET: Parameter-Efficient Mixture-of-Experts for Unified Medical Image Classification

تقدم الورقة البحثية MoPET، وهو إطار عمل لخليط من الخبراء فعال في استخدام المعلمات، يستخدم موجهاً متفرقاً لاختيار المهايئات منخفضة الرتبة ديناميكياً ضمن نموذج تأسيسي مجمد، مما يدمج بفعالية مهام متعددة متباينة في التصوير الطبي داخل شبكة واحدة مع التخفيف من حدة الانتقال السلبي والتفوق على كل من الضبط الدقيق الكامل ونهج المهايئات المنعزلة.

Sebastian Doerrich, Daniel Würtinger, Francesco Di Salvo, Shyam Nandan Rai, Christian Ledig2026-08-03
🧬 biology

Multi-Source Multi-View Graph Domain Adaptation with Hyperbolic Residual Encoding for Cross-Site MDD Identification from rs-fMRI

تقترح هذه الورقة إطار عمل للتكيف النطاقي للرسوم البيانية متعدد المصادر ومتعدد الرؤى مع ترميز متبقٍ زائدي، يقوم بنمذجة رؤى الاتصال الوظيفي غير المتجانسة وتنسيق التوزيعات متعددة المصادر بشكل مشترك لتحقيق تحديد قوي عبر المواقع للاضطراب الاكتئابي الكبير من بيانات التصوير بالرنين المغناطيسي الوظيفي في حالة الراحة.

Zhanpeng Zheng, Xiran Chen, Haiteng Jiang, Renjie Tian, Qinyu Cai, Jiexi Liu, Xiaofeng Chen, Weikai Li, Yansu Wang2026-08-03
💬 NLP

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

تقدم الورقة البحثية "FriendBench"، وهو معيار لقياس مدى القدرة على استنتاج الألفة الثنائية من مقاطع فيديو لكسر الجليد مدتها 20 ثانية، والتي كشفت أنه في حين تضاهي النماذج متعددة الوسائط الرائدة دقة البشر، إلا أنها تعتمد على إشارات مختلفة وتظهر انحيازاً لتصنيف الأزواج كغرباء، بينما يستفيد البشر بشكل فريد من الإشارات السلوكية المرئية التي تتجاوز الكلام.

Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin2026-08-03
💬 NLP

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

تقدم الورقة البحثية نموذج "ناقد العالم" (WCM)، وهو نهج مبتكر للتعلم المعزز القائم على الرؤية واللغة والأفعال، يستفيد من بنية LeJEPA خفيفة الوزن للتنبؤ المشترك بالحالات الكامنة المستقبلية وتقدير القيم، مما يتغلب على قيود الناقد أحادي الإطار ويحقق أداءً رائدًا وقدرة على التعميم عبر مهام التلاعب الروبوتية المتنوعة.

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu2026-08-03
🤖 machine learning

A Human-Centered Validation of the Explainability-Performance Coefficient

تقدم هذه الورقة درجة EPC، وهي مقياس غير مرتبط بنموذج محدد يحدد جودة التفسير من خلال الموازنة بين ندرة الميزات والحفاظ على الأداء، وتثبت فعاليتها عبر أنماط متعددة من البيانات من خلال إظهار توافقها القوي مع الفهم المتمحور حول الإنسان.

Christian Oliva, Luis F. Lago-Fernández2026-08-03
💻 computer science

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

يقدم HierDoc إطار عمل هرمي لتوجيه الأدلة يتكون من مرحلتين، يعمل على تحسين اختيار الصفحات واستخراج المناطق بشكل متسلسل باستخدام تقنية GRPO المرحلية مع مكافآت المجموعات المهيكلة، محققاً أداءً هو الأفضل في فئته في مجال الإجابة على الأسئلة المرئية للوثائق الطويلة عبر سد الفجوة بفعالية بين الاستحواذ العام على الصفحات والتحديد الدقيق للمناطق.

Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li2026-08-03