💻 computer science

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

تقدم الورقة البحثية إطار عمل LaViT، الذي يسد فجوة الإدراك في التقطير متعدد الوسائط من خلال محاذاة الأفكار البصرية الكامنة ومسارات الانتباه بدلاً من التضمينات الثابتة، مما يمكن النماذج المدمجة من تحقيق أداء متفوق في الاستدلال البصري يضاهي الأنظمة المملوكة الأكبر حجماً.

Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung2026-08-12
💻 computer science

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

تقدم هذه الورقة "فقدان عدسة اللوجيت" (Logit Lens Loss - LLL)، وهو هدف مساعد خفيف الوزن يعزز القابلية للتفسير على مستوى الرقعة في النماذج الرؤية-اللغوية من خلال محاذاة تضمينات الرموز المرئية مع مفاهيمها النصية المقابلة، مما يؤدي إلى تحسين التأسيس وتقليل الهلوسة دون الحاجة إلى تغييرات هيكلية أو إعادة تدريب مكثفة.

Parsa Esmaeilkhani, Longin Jan Latecki2026-08-12
🤖 machine learning

A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline

تقدم هذه الورقة دراسة تجريبية لتقييم وكلاء البرمجة القائمين على الذكاء الاصطناعي للأغراض العامة في مسار معقد لتحويل البيانات العصبية إلى اكتشافات، كاشفةً عن أنه بينما يمكن للوكلاء أتمتة مراحل فردية، إلا أنهم يواجهون حالياً صعوبة في التنفيذ الشامل من البداية إلى النهاية، والتقييم الذاتي دون معايير محددة مسبقاً، والتعميم على بيانات جديدة.

Kai A. Horstmann, Ethan Lin, Alice A. Robie, Jennifer J. Sun, Kristin Branson2026-08-12
💻 computer science

Introspective Attention Modulation for Safe Text-to-Image Generation

تقدم هذه الورقة البحثية "تعديل الانتباه الاستبطاني" (Introspective Attention Modulation)، وهو أسلوب في وقت الاستدلال يعزز سلامة نماذج تحويل النص إلى صورة القائمة على التدفق عبر تنظيم تنشيطات الانتباه ديناميكيًا لتثبيط المفاهيم غير الآمنة مع الحفاظ على المواءمة الدلالية وجودة الصورة، متفوقًا بذلك على تقنيات محو المفاهيم الحالية.

Basim Azam, Hossein Rahmani, Naveed Akhtar2026-08-12
💻 computer science

Embeddings based Anomaly Detection for Cleaning Global Crop Type Reference Datasets

تقترح هذه الورقة وتتحقق من صحة إطار عمل للكشف عن الشذوذ يعتمد على التضمين ومراعٍ للمحلية، يعمل بفعالية على تحديد وتخفيف ضوضاء التصنيف في مجموعات البيانات المرجعية العالمية لأنواع المحاصيل، مما يؤدي إلى تحسين دقة نماذج خرائط المحاصيل اللاحقة دون الاعتماد على قواعد عالمية بسيطة.

Syed Roshaan Ali Shah, Kristof Van Tricht, Christina Butsko, Jeroen Degerickx, Zoltan Szantoi2026-08-12
💻 computer science

EliSeg: Verified Target Construction for Report-Grounded Abnormality Segmentation

تقدم الورقة البحثية إطار عمل EliSeg، وهو إطار مبتكر يعالج الغموض في تقارير الأشعة من خلال دمج بناء الأهداف مع توليد الأقنعة عبر عملية (الممثل-التحقق-المراجعة)، مما يمكّن النماذج من تحديد التشوهات المؤهلة وتوليد أقنعة التجزئة المقابلة لها بشكل مستقل دون الاعتماد على مطالبات محددة مسبقاً أو أوراكل للأهداف.

Chengyi Peng, Haoyu Yang, Meixing Shi, Yuxiang Cai, Yankai Jiang2026-08-12
💻 computer science

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

يُعد SimWAM نموذج عالم-فعل (World-Action Model) بسيطاً وفعالاً للقيادة الذاتية من طرف إلى طرف، حيث يستفيد من التنبؤ بالفيديو المستقبلي كإشارة إشراف أثناء وقت التدريب لتمكين تخطيط المسار بكفاءة وزمن انتقال منخفض دون الحاجة لتوليد إطارات مستقبلية صريحة عند الاستنتاج، محققاً أداءً هو الأفضل في فئته على منصة NAVSIM ونقلاً صفري القدرة (zero-shot transfer) إلى nuScenes.

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai2026-08-12
💻 computer science

HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers

تقدم هذه الورقة البحثية HSMLA، وهي آلية انتباه مبتكرة تجمع بين الانتباه الخطي القائم على ReLU، والتحسين الانتقائي لـ softmax، والتلافيف العميقة متعددة المقاييس للتغلب على التعقيد التربيعي لنماذج Vision Transformers القياسية، محققةً تسريعاً كبيراً في عملية الاستنتاج مع الحفاظ على دقة عالية في مهام التنبؤ الكثيف مثل تقسيم الصور الطبية وتحليل الأمراض.

Dong Liu, Yanxuan Yu, Renata Borovica-Gajic, Tong Geng, Ying Nian Wu2026-08-12
⚡ electrical engineering

SpecF2M: A Spectral-Aware Multi-task Network Estimating Axial Length and Refractive Error from Pediatric Fundus Photographs

تقدم الورقة البحثية SpecF2M، وهي شبكة متعددة المهام مدركة للطيف تستفيد من عمود فقري هجين مكاني-طيفي وتعزيز موجه تشريحياً لتقدير الطول المحوري والخطأ الانكساري لدى الأطفال بدقة من صور قاع العين، محققة أداءً فائقاً على النماذج المرجعية بمتوسط أخطاء مطلقة يبلغ 0.5347 مم و0.7062 ديوبتر على التوالي.

Mengxian He, Xinyue Liu, Yunyun Sun, Wei Hao, Minqing Zhang, Lichun Wang, Shunyi Zhang, Wu Yuan2026-08-12
⚡ electrical engineering

Structural Guidance for Unified Joint Demosaicing and Denoising

تقترح هذه الورقة إطاراً موحداً موجهاً بالبنية يعزز عملية فك التشفير وإزالة الضجيج المشتركة من خلال دمج فرع استدلال بنيوي موازٍ مع مهايئ خفيف الوزن لحقن المعرفة البنيوية المسبقة في عملية الاستعادة المدركة لمصفوفة الألوان الكاملة (CFA)، مما يتغلب على قيود الإشراف على مستوى البكسل ويحسن المتانة ضد تدهور الحواف والضجيج.

Qixin Zheng, Ping Chen, Qiangqiang Shen, Haijin Zeng2026-08-12