💬 NLP

AISAC: An Integrated multi-agent System for Transparent, Retrieval-Grounded Scientific Assistance

طُوِّر في مختبر أرغون الوطني، يُعد AISAC بيئة تشغيل متعددة الوكلاء، شفافة ونمطية، تفرض ضمانات هيكلية لدلالات الأدوار، والتنسيق الميزاني، والوصول المتوافق إلى الذاكرة، والشفافية القائمة على التتبع لدعم الاستدلال العلمي القائم على الأدلة عبر مجالات متنوعة مثل أبحاث الاحتراق والمواد.

Chandrachur Bhattacharya, Sibendu Som2026-03-31
💬 NLP

OEMA: Ontology-Enhanced Multi-Agent Collaboration Framework for Zero-Shot Clinical Named Entity Recognition

تقترح الورقة البحثية إطار عمل OEMA، وهو إطار تعاون متعدد الوكلاء معزز بالأنطولوجيا، يحقق أداءً رائدًا في التعرف على الكيانات السريرية بأسلوب التعلم الصفري من خلال دمج مُصنف ذاتي، ومُميز يعتمد على SNOMED CT، ومتنبئ مدرك لنوع الكيان للتغلب على قيود النماذج التقلية الخاضعة للإشراف والنهج الحالية القائمة على النماذج اللغوية الكبيرة.

Xinli Tao, Xin Dong, Xuezhong Zhou2026-03-31
💬 NLP

HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning

تقدم هذه الورقة HEAD-QA v2، وهي مجموعة بيانات موسعة متعددة اللغات تضم أكثر من 12,000 سؤال من أسئلة امتحانات الرعاية الصحية باللغة الإسبانية، وتوضح أن نتائج القياس المرجعي مدفوعة بشكل أساسي بحجم النموذج وقدرات الاستنتاج الجوهرية بدلاً من استراتيجيات الاستدلال المعقدة.

Alexis Correa-Guillén, Carlos Gómez-Rodríguez, David Vilares2026-03-31
💬 NLP

Towards Hyper-Efficient RAG Systems in VecDBs: Distributed Parallel Multi-Resolution Vector Search

تقدم هذه الورقة البحثية "فهرسة الهرم الدلالي" (SPI)، وهو إطار عمل جديد لفهرسة المتجهات متعدد الدقة يعمل على تكييف دقة الاسترجاع ديناميكيًا مع استعلامات المستخدم، محققًا تحسينات كبيرة في سرعة البحث، وكفاءة الذاكرة، ودقة الإجابة على الأسئلة لأنظمة التوليد المعزز بالاسترجاع (RAG) مع الحفاظ على التوافق مع الأنظمة الخلفية لقواعد بيانات المتجهات الحالية.

Dong Liu, Yanxuan Yu2026-03-31
💬 NLP

Estonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation

تقدم هذه الورقة ترجمة إستونية مكيفة ثقافياً لمعيار WinoGrande، مبرهنةً على أن مجموعات البيانات المترجمة بشرياً تقدم تقييمات أكثر موثوقية لاستدلال النماذج اللغوية الكبيرة من تلك المترجمة آلياً، مع تسليط الض الضوء على الفعالية المحدودة لهندسة الأوامر في التغلب على تحديات الترجمة.

Marii Ojastu, Hele-Andra Kuulmets, Aleksei Dorkin, Marika Borovikova, Dage Särg, Kairit Sirts2026-03-31
💬 NLP

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

يقدم VideoARM نموذج استدلال وكيل مع ذاكرة متعددة الوسائط هرمية تتيح تحليلاً تكيفياً للفيديو من المستوى العام إلى المستوى الدقيق في الوقت الفعلي، محققاً أداءً هو الأفضل في فئته في فهم مقاطع الفيديو طويلة المدى مع تقليل استهلاك الرموز (tokens) بشكل كبير مقارنة بالأساليب الحالية.

Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu2026-03-31
💬 NLP

RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering

تقدم الورقة البحثية RadImageNet-VQA، وهي مجموعة بيانات ضخمة منسقة من قبل خبراء تضم 750 ألف صورة للأشعة المقطعية والرنين المغناطيسي مع 7.5 مليون زوج من الأسئلة والأجوبة المصممة للنهوض بمجال الإجابة البصرية على الأسئلة الإشعاعية مع إثبات متانتها ضد الاختصارات اللغوية والقيود الحالية للنماذج الحديثة في تحديد الأمراض الدقيقة.

Léo Butsanets, Charles Corbière, Julien Khlaut, Pierre Manceron, Corentin Dancette2026-03-31
📊 statistics

Measuring all the noises of LLM Evals

تُعرّف هذه الورقة وتُحدد كمياً ضجيج التنبؤ وضجيج البيانات في تقييمات النماذج اللغوية الكبيرة، وتقترح طريقة الأزواج لجميع الثنائيات تكشف عن أنماط الضجيج القابلة للتنبؤ وتُثبت أن المتوسط لتقليل ضجيج التنبؤ يعزز بشكل كبير القدرة الإحصائية لمقارنات النماذج.

Sida Wang2026-03-31
💬 NLP

Beg to Differ: Understanding Reasoning-Answer Misalignment Across Languages

تقدم هذه الورقة إطار عمل تم التحقق منه بشرياً يكشف أن النماذج اللغوية الكبيرة تظهر عدم توافقاً كبيراً بين الاستدلال والاستنتاج في النصوص غير اللاتينية مقارنة بالنصوص اللاتينية، على الرغم من دقة الأداء العالية في المهام، مما يكشف عن نقاط ضعف حرجة في ممارسات التقييم متعددة اللغات الحالية.

Anaelia Ovalle, Candace Ross, Sebastian Ruder, Adina Williams, Karen Ullrich, Mark Ibrahim, Levent Sagun2026-03-31
💬 NLP

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

تقدم هذه الورقة AppellateGen، وهو معيار يتكون من 7,351 زوجًا من القضايا لتوليد أحكام قانونية من الدرجة الثانية، وتقترح نظامًا متعدد الوكلاء يعتمد على إجراءات تشغيل قياسية قضائية (SLMAS) لمعالجة التعقيدات الجدلية للمراجعة الاستئنافية، كاشفةً أنه في حين يعمل النظام على تحسين الاتساق المنطقي، إلا أن النماذج اللغوية الكبيرة الحالية لا تزال تعاني من التحديات المتأصلة في الاستدلال الاستئنافي.

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang (…)2026-03-31