🤖 AI

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

تقترح الورقة البحثية إطار عمل EAGLE، وهو إطار عمل متعدد الوكلاء لا يتطلب تدريباً، يعزز الإجماع في نماذج الرؤية واللغة من خلال إعطاء الأولوية للأدلة البصرية المتوافقة على مجرد الاتفاق على الإجابة، مما يحقق أداءً فائقاً وقابلاً للتفسير عبر مختلف معايير اختبار الأسئلة المرئية والإجابة عنها (VQA).

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang (…)2026-06-01
🤖 machine learning

A Context-Aware Middleware for Medical Image Based Reports: An approach based on image feature extraction and association rules

تقترح هذه الورقة وسيطاً برمجياً مدركاً للسياق يستخدم استخراج ميزات الصور وقواعد الارتباط لاستنتاج الموظف الطبي الأكثر ملاءمة للصور الواردة تلقائياً، مما يؤدي إلى تحسين كفاءة سير العمل من خلال القضاء على العملية اليدوية المستهلكة للوقت المتمثلة في تعيين التشخيصات المتخصصة.

Erick O. Rodrigues, Jose Viterbo, Aura Conci, Trueman Mac Henry2026-06-01
💻 computer science

Mathematical Morphology in Machine Learning

تقدم هذه الورقة المورفولوجيا الرياضية في تعلم الآلة من خلال اقتراح خوارزمية تجميع إعادة البناء المورفولوجي السريع، ومقياس مسافة هجين جديد يتفوق بشكل كبير على المسافات القياسية في السرعة والدقة، ومصنفات جديدة تنمذج بشكل فريد الشكل والكثافة والمعلومات الفركتلية.

Erick Oliveira Rodrigues, Aura Conci2026-06-01
💻 computer science

Equivariant Latent Alignment via Flow Matching under Group Symmetries

تقدم هذه الورقة البحثية "التدفق الكامن المتبقي" (Residual Latent Flow)، وهو إطار عمل قائم على التدفق يعمل على تصحيح عدم المحاذاة الكامنة في تعلم التمثيلات المتكافئة لتعزيز الاتساق الهندسي وجودة تركيب المشاهد من زوايا جديدة تحت تماثلات المجموعات مثل SO(n).

Sunghyun Kim, Jaehoon Hahm, Jeongwoo Shin, Joonseok Lee2026-06-01
🤖 machine learning

Beyond Accuracy: Evaluating Efficiency, Robustness and Explainability in Deep Learning for Malaria Diagnosis

تقوم هذه الورقة البحثية بتقييم نماذج التعلم العميق لتشخيص الملاريا باستخدام مجموعة بيانات NLM-Malaria، حيث تُثبت أن البنيات خفيفة الوزن تحقق دقة مماثلة للنماذج الأثقل، مع تسليط الضوء في الوقت ذاته على نقاط الضعف الحرجة في القابلية للتفسير اللاحق وثقة النموذج تحت تأثير فساد الصور، وذلك لتوجيه النشر السريري المسؤول في البيئات محدودة الموارد.

Olivier Kanamugire, Kerol Djoumessi2026-06-01
🤖 AI

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

تقدم هذه الورقة البحثية MechVQA، وهي أول مجموعة بيانات ومعيار شامل لفهم الرسومات الميكانيكية تحتوي على 21 ألف زوج من الأسئلة والأجوبة، وتقدم MechVL، وهو نموذج متعدد الوسائط متخصص يتفوق بشكل كبير على النماذج المرجعية الحالية من خلال معالجة التحديات الفريدة المتمثلة في كثافة التوسيم والقيود الهندسية الصارمة في الرسومات الهندسية.

Qian Kou, Xiaofeng Shi, Yulin Li, Xiaosong Qiu, Xinyang Wang, Hua Zhou, Cao Dongxing2026-06-01
💻 computer science

Function2Scene: 3D Indoor Scene Layout from Functional Specifications

يُعد Function2Scene إطار عمل مبتكرًا يولد تخطيطات داخلية ثلاثية الأبعاد من مواصفات وظيفية باللغة الطبيعية عبر تحليل احتياجات المستخدم إلى قيود تصميمية وتحسين المشهد بشكل تكراري من خلال حلقة "فحص وإصلاح" مدعومة بالأدوات، متفوقًا بذلك بشكل كبير على الأسالط المتمحورة حول الأشياء في تلبية المتطلبات المكانية المتمحورة حول الإنسان.

Ruiqi Wang, Qimin Chen, Daniel Ritchie, Angel X. Chang, Manolis Savva, Kai Wang, Hao Zhang2026-06-01
💻 computer science

LegSegNet: A Public Deep Learning System for Lower Extremity CT Tissue Segmentation and Quantification

يُعد LegSegNet نظاماً جديداً متاحاً للعموم يعتمد على التعلم العميق المتكامل (end-to-end)، ويحقق أداءً رائداً في تقسيم وقياس أنسجة الطرف السفلي عبر التصوير المقطعي المحوسب، بما في ذلك العظام، والعضلات الهيكلية، ومختلف حصص الدهون، وذلك لتسهيل تحليل تكوين الجسم على نطاق واسع ومراقبة أمراض الجهاز العضلي الهيكلي.

Yuwen Chen, Yaqian Chen, Roy Colglazier, Haoyu Dong, Hanxue Gu, Maciej A. Mazurowski, Kevin W. Southerland2026-06-01
💻 computer science

SteerFace: Debiasing Synthetic Face Generation via Adaptive Residue Perturbation

تقترح هذه الورقة إطار عمل SteerFace، وهو إطار تدريب يخفف من فجوة الميل البصري في توليد الوجوه الاصطناعية عن طريق تشويش تضمينات الهوية بشكل تكيفي نحو اتجاهات متعامدة عشوائية، مما يثبط الاعتماد على الإشارات البصرية غير المتعلقة بالهوية ويحسن أداء التعرف على الوجوه في المهام اللاحقة.

Yuxi Mi, Qiuyang Yuan, Jianqing Xu, Yichun Zhou, Xuan Zhao, Jun Wang, Rizen Guo, Shuigeng Zhou2026-06-01
💻 computer science

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

يقدم MergeTok مُجزئاً بصرياً موحداً يربط بين المشفرات التلقائية التباينية (VAEs) المستمرة ونماذج التكميم المتجهي (VQ) المنفصلة عبر الاستفادة من دمج الرموز لإنشاء أسبقية هيكلية، مما يحقق إعادة بناء عالية الدقة، وتدريباً مستقراً، وتمثيلات منظمة دلالياً مناسبة لكل من التوليد الصوري بالانتشار والتوليد الصوري بالتسلسل التكراري.

Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wa (…)2026-06-01