⚡ electrical engineering

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

تُعد NeuroQA معياراً مرجعياً واسع النطاق ومبنياً على الصور، يضم ما يقرب من 57,000 زوج من الأسئلة والأجوبة المستمدة من أحجام الرنين المغناطيسي ثلاثية الأبعاد للدماغ عبر 12 مجموعة بيانات وخمسة مجالات سريرية، وهو مصمم لتقييم الاستدلال البصري الطبي ثلاثي الأبعاد بصرامة مع القضاء على الاختصارات النصية فقط من خلال بروتوكولات التأسيس الصارم على الصور والتحقق من قبل الخبراء.

Mohammad H. Abbasi (Stanford University), Favour Nerrise (Stanford University), Shaurnav Ghosh (Stanford University), Ri (…)2026-05-21
💬 NLP

What Do Biomedical NER and Entity Linking Benchmarks Measure? A Corpus-Centric Diagnostic Framework

تقدم هذه الورقة إطاراً تشخيصياً متمحوراً حول المتون اللغوية يحلل خمس عائلات رئيسية من خصائص المعايير المرجعية للكشف عن اختلافات جوهرية في إشارات التقييم ومتطلبات التعميم عبر متون التعرف على الكيانات المسماة (NER) واستخراج الكيانات (EL) في المجال الحيوي الطبي، محاججةً بأن الإحصاءات السطحية غير كافية لتوصيف ما تقيسه هذه المعايير المرجعية حقاً.

Robert Leaman, Rezarta Islamaj, Zhiyong Lu2026-05-21
💬 NLP

Multi-agent Collaboration with State Management

تقدم هذه الورقة STORM، وهو إطار عمل للإدارة الموجهة بالحالة يتوسط التفاعلات بين الوكلاء المتعددين لاكتشاف وحل تعارضات الكود عند وقت الكتابة، متفوقاً بشكل كبير على النماذج المرجعية التقليدية لعزل مساحة العمل في اختبارات البرمجة مع ضمان رؤى متسقة لقاعدة الكود المشتركة.

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong2026-05-21
💬 NLP

Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

تقدم هذه الورقة تقييماً واسع النطاق لأكثر من 6,000 نموذج لغوي كبير طبي مُنشر عبر الويب، كاشفةً عن مخاطر جسيمة تتعلق بالهلوسة، وانتهاكات السياسات، وفجوات الخصوصية، مع تقديم أطر تقييم جديدة ومجموعة بيانات لتوجيه تحسينات السلامة المستقبلية.

Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood2026-05-21
💬 NLP

Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies

تتحدى هذه الورقة المفهوم القائل بأن التدريب الذاتي يؤدي مجرد تسطيح اللغة، من خلال إثبات أنه يعيد هيكلتها بدلاً من ذلك عبر انهيار غير متماثل حيث تضمحل السمات النحوية العميقة بينما تتضخم العلامات السطحية، وهي ظاهرة تمت صياغتها رسمياً كفرضية العمق البنيوي.

Ming Liu2026-05-21
💬 NLP

HRM-Text: Efficient Pretraining Beyond Scaling

تقدم الورقة البحثية نموذج HRM-Text، وهو نموذج بمليار معلمة يحقق أداءً تنافسيًا مع النماذج الأكبر حجمًا بشكل ملحوظ من خلال الجمع بين بنية متكررة هرمية، وتقنيات تدريب متخصصة، وتدريب مسبق يعتمد على التعليمات فقط لتقليل متطلبات الحوسبة والبيانات لأبحاث النماذج اللغوية التأسيسية بشكل جذري.

Guan Wang, Changling Liu, Chenyu Wang, Cai Zhou, Yuhao Sun, Yifei Wu, Shuai Zhen, Luca Scimeca, Yasin Abbasi Yadkori2026-05-21
💬 NLP

Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents

تقدم الورقة البحثية Auto-Dreamer، وهو مدمج ذاكرة غير متصل بالإنترنت (offline) مُتعلم مستوحى من نظرية أنظمة التعلم المتكاملة، والذي يفصل بين اكتساب الخبرة السريع عبر الإنترنت وبين الدمج البطيء عبر الجلسات، مما يمكّن الوكلاء اللغويين من تجريد الأنماط المتكررة وتقليم الحشو لتحقيق أداء فائق مع بنوك ذاكرة نشطة أصغر بكثير عبر بيئات متعددة.

Chongrui Ye, Yuxiang Liu, Yu Wang, Haofei Yu, Yining Zhao, Ge Liu, Julian McAuley, Jiaxuan You2026-05-21
💬 NLP

Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task

فاز فريق جامعة فلوريدا غيتورز بمهمة AmericasNLP 2026 المشتركة للتعليق على الصور الثقافية للغات السكان الأصليين عبر توظيف مسار عمل مكون من مرحلتين يجمع بين نموذج Qwen2.5-VL للتعليق الوسيط باللغة الإسبانية والتعزيز بالاسترجاع باستخدام التلقين متعدد الأمثلة (many-shot prompting) عبر نموذج Gemini 2.5 Flash، محققاً تحسينات في الأداء تتجاوز 120% مقارنة بالنموذج المرجعي عبر لغات بريبري، وغواراني، وأوريزابا ناهواتل.

Aashish Dhawan, Christopher Driggers-Ellis, Dzmitry Kasinets, Daisy Zhe Wang, Christan Grant2026-05-21
💬 NLP

Divide-Prompt-Refine: a Training-Free, Structure-Aware Framework for Biomedical Abstract Generation

تقدم الورقة البحثية إطار عمل DPR-BAG، وهو إطار عمل يعتمد على البنية ولا يتطلب تدريباً، يقوم بتوليد ملخصات طبية حيوية متماسكة ومستندة إلى الحقائق من المقالات كاملة النص عبر تفكيكها إلى جوانب بلاغية، وتلخيصها بشكل متوازٍ، وتحسين المخرجات لضمان التماسك الشامل، مع إثبات أن استراتيجيات التلقين البسيطة غالباً ما تحقق توافقاً واقعياً أفضل من الاستراتيجيات المعقدة.

Sylvey Lin, Joe Menke, Shufan Ming, Dongin Nam, Neil Smalheiser, Halil Kilicoglu2026-05-21
💬 NLP

Beyond Semantic Similarity: A Two-Phase Non-Parametric Retrieval Workflow for Corporate Credit Underwriting

تقدم هذه الورقة نظام استرجاع غير معلمي ثنائي المراحل يعالج "فجوة التشابه والمنفعة" في عمليات الاكتتاب الائتماني للشركات من خلال إعطاء الأولوية للفائدة التحليلية على التشابه الدلالي، مما نجح في تقليل وقت مراجعة المستندات من ساعات إلى دقائق لأكثر من 800 محلل.

Linus Ng Junjia, Ezekiel Tee Kongquan, Kelvin Heng, Kenneth Zhu Ke, Zhao Jing Yuan2026-05-21