🤖 machine learning

Sparse Layers are Critical to Scaling Looped Language Models

تُظهر الورقة البحثية أن الجمع بين بنيات "خليط الخبراء" (MoE) وآليات تكرار الطبقات والخروج المبكر يُمكّن النماذج اللغوية من التفوق على نماذج "ترانسفورمر" القياسية في كفاءة التوسع مع تقليل تكاليف الذاكرة والاستدلال بشكل كبير.

Ryan Lee, Jacob Biloki, Edward J. Hu, Jonathan May2026-05-12
🤖 AI

WorldSpeech: A Multilingual Speech Corpus from Around the World

تقدم الورقة البحثية WorldSpeech، وهو متن لغوي ضخم متعدد اللغات يحتوي على 65,000 ساعة من البيانات الصوتية والنصية المتوافقة عبر 76 لغة، مما يحسن بشكل كبير أداء التعرف التلقائي على الكلام للغات ذات الموارد المنخفضة من خلال تقليل معدلات خطأ الكلمات بمتوسط قدره 63.5%.

Antonis Asonitis, Luca A. Lanzendörfer, Frédéric Berdoz, Roger Wattenhofer2026-05-12
🤖 AI

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

تقدم هذه الورقة "Open Ontologies"، وهو نظام مفتوح المصدر قائم على لغة Rust، يوضح أن المطابقة المستقرة بنسبة 1 إلى 1 هي العامل الحاسم للمحاذاة عالية الجودة للأنطولوجيا، وأن الوصول المنظم إلى أدوات بروتوكول سياق النموذج (MCP) يتفوق بشكل كبير على كل من قراءة الملفات الخام والأساسات التي لا تعتمد على الملفات في التفاعل مع الأنطولوجيا المدفوع بالنماذج اللغوية الكبيرة.

Fabio Rovai2026-05-12
🤖 AI

Agentic MIP Research: Accelerated Constraint Handler Generation

تقدم هذه الورقة إطار عمل وكيلِيّاً يستفيد من النماذج اللغوية الكبيرة لتوليد والتحقق من وتقييم معالجات قيود SCIP لبرمجة الأعداد الصحيحة المختلطة بشكل مستقل، مما نجح في استعادة هياكل القيود العالمية واكتشاف استراتيجيات انتشار مبتكرة تُحسن أداء الحلّال على النماذج المرجعية.

Liding Xu, Yugeng Zhou, Sebastian Pokutta2026-05-12
🤖 AI

Emergent Semantic Role Understanding in Language Models

تُثبت هذه الورقة أن فهم الأدوار الدلالية يظهر جزئياً في نماذج المحولات المكونة من فك تشفير فقط (decoder-only transformers) والمجمدة أثناء مرحلة ما قبل التدريب، كما يتضح من خلال المسابير الخطية، رغم أن الأداء الكامل يتطلب الضبط الدقيق، كما يصبح التمثيل الداخلي لهذه الأدوار موزّعاً بشكل متزايد مع زيادة حجم النموذج.

Carla Griffiths, Mirco Musolesi2026-05-12
🤖 machine learning

Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs

تُثبت هذه الورقة أن فشل النماذج اللغوية الكبيرة في عدّ الرموز المتكررة لا ينبع من عدم القدرة على تمثيل العدد الصحيح داخلياً، بل من آلية "طبقة بيرسبترون متعدد الطبقات" (MLP) محفزة بتنسيق محدد تقوم باستبدال التمثيل الدقيق بإجابة خاطئة ثابتة أثناء عملية توليد المخرجات.

Sohan Venkatesh2026-05-12
🤖 AI

Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation

تحدد هذه الورقة البحثية "رموز الصخور" (Rock Tokens) كفئة فرعية مستمرة من الرموز ذات الخسارة العالية في عملية التقطير داخل السياسة (On-Policy Distillation)، والتي تستهلك موارد تحسين كبيرة رغم مساهمتها الضئيلة في أداء الاستنتاج، مما يثبت أن تجاوزها استراتيجياً يمكن أن يؤدي إلى تبسيط عملية محاذاة النموذج.

Yuxuan Jiang, Runchao Li, Shubhashis Roy Dipta, Dawei Li, Zhao Yang2026-05-12
🤖 AI

Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs

تقدم هذه الورقة معياراً اصطناعياً لتقييم مدى قدرة عشرة نماذج لغوية كبيرة على التعامل مع تبديل السياق في المحادثات متعددة الأدوار، كاشفةً أنه بينما تستطيع بعض النماذج ذات القدرة على الاستنتاج والالتزام القوي بالتعليمات اكتشاف التحولات في المواضيع، فإن معظمها يعاني من مشكلات السياق القديم وانحياز الموضع، مما يسلط الضوء على تحديات حرجة لتحسين متانة الحوار طويل الأمد.

Aditya Sinha, Harald Steck, Vito Ostuni, Matteo Rinaldi2026-05-12
🤖 AI

Towards Conversational Medical AI with Eyes, Ears and a Voice

تقدم هذه الورقة البحثية "المساعد الطبي الذكي" (AI co-clinician)، وهو نظام ذكاء اصطناي محادثاتي متعدد الوسائط يستفيد من البيانات السمعية والبصرية في الوقت الفعلي لدعم اتخاذ القرار الطبي، مُظهراً أداءً يضاهي الأطباء في مقاييس الطب عن بُعد الرئيسية، مع تسليط الضوء على ضرورة النماذج الثلاثية التعاونية لضمان سلامة الذكاء الاصطناعي التشخيصي في الحالات عالية المخاطر.

Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya (…)2026-05-12
🤖 AI

A Prompt-Aware Structuring Framework for Reliable Reuse of AI-Generated Content in the Agentic Web

تقترح هذه الورقة إطار عمل هيكلياً مدركاً للمطالبات يقوم تلقائياً بإرفاق بيانات وصفية ووثائق اعتماد قابلة للتحقق بالمحتوى المُنشأ بواسطة الذكاء الاصطناعي وقت إنشائه، مما يتيح التقييم الموثوق، وتتبع المصدر، وإعادة الاستخدام الآمن لهذا المحتوى ضمن الويب الوكيل الناشئ.

Shusaku Egami, Masahiro Hamasaki2026-05-12