🤖 machine learning

Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs

تُثبت هذه الورقة أن فشل النماذج اللغوية الكبيرة في عدّ الرموز المتكررة لا ينبع من عدم القدرة على تمثيل العدد الصحيح داخلياً، بل من آلية "طبقة بيرسبترون متعدد الطبقات" (MLP) محفزة بتنسيق محدد تقوم باستبدال التمثيل الدقيق بإجابة خاطئة ثابتة أثناء عملية توليد المخرجات.

Sohan Venkatesh2026-05-12
🤖 AI

Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation

تحدد هذه الورقة البحثية "رموز الصخور" (Rock Tokens) كفئة فرعية مستمرة من الرموز ذات الخسارة العالية في عملية التقطير داخل السياسة (On-Policy Distillation)، والتي تستهلك موارد تحسين كبيرة رغم مساهمتها الضئيلة في أداء الاستنتاج، مما يثبت أن تجاوزها استراتيجياً يمكن أن يؤدي إلى تبسيط عملية محاذاة النموذج.

Yuxuan Jiang, Runchao Li, Shubhashis Roy Dipta, Dawei Li, Zhao Yang2026-05-12
🤖 AI

Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs

تقدم هذه الورقة معياراً اصطناعياً لتقييم مدى قدرة عشرة نماذج لغوية كبيرة على التعامل مع تبديل السياق في المحادثات متعددة الأدوار، كاشفةً أنه بينما تستطيع بعض النماذج ذات القدرة على الاستنتاج والالتزام القوي بالتعليمات اكتشاف التحولات في المواضيع، فإن معظمها يعاني من مشكلات السياق القديم وانحياز الموضع، مما يسلط الضوء على تحديات حرجة لتحسين متانة الحوار طويل الأمد.

Aditya Sinha, Harald Steck, Vito Ostuni, Matteo Rinaldi2026-05-12
🤖 AI

Towards Conversational Medical AI with Eyes, Ears and a Voice

تقدم هذه الورقة البحثية "المساعد الطبي الذكي" (AI co-clinician)، وهو نظام ذكاء اصطناي محادثاتي متعدد الوسائط يستفيد من البيانات السمعية والبصرية في الوقت الفعلي لدعم اتخاذ القرار الطبي، مُظهراً أداءً يضاهي الأطباء في مقاييس الطب عن بُعد الرئيسية، مع تسليط الضوء على ضرورة النماذج الثلاثية التعاونية لضمان سلامة الذكاء الاصطناعي التشخيصي في الحالات عالية المخاطر.

Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya (…)2026-05-12
🤖 AI

A Prompt-Aware Structuring Framework for Reliable Reuse of AI-Generated Content in the Agentic Web

تقترح هذه الورقة إطار عمل هيكلياً مدركاً للمطالبات يقوم تلقائياً بإرفاق بيانات وصفية ووثائق اعتماد قابلة للتحقق بالمحتوى المُنشأ بواسطة الذكاء الاصطناعي وقت إنشائه، مما يتيح التقييم الموثوق، وتتبع المصدر، وإعادة الاستخدام الآمن لهذا المحتوى ضمن الويب الوكيل الناشئ.

Shusaku Egami, Masahiro Hamasaki2026-05-12
💬 NLP

LEAF-SQL: Level-wise Exploration with Adaptive Fine-graining for Text-to-SQL Skeleton Prediction

يُعد LEAF-SQL إطار عمل مبتكر يعزز أداء تحويل النص إلى SQL في الاستعلامات المعقدة عبر إعادة صياغة التنبؤ بالهيكل العظمي كعملية بحث في شجرة من الخشن إلى الناعم، مستخدماً تسلسلاً هرمياً ثلاثي المستويات ووكلاء متخصصين لاستكشاف وتكييف الفرضيات الهيكلية المتنوعة بشكل منهجي، مما يحقق دقة تنفيذ رائدة على مقياس BIRD.

Zhao Tan, Xiping Liu, Qing Shu, Qizhi Wan, Dexi Liu, Changxuan Wan2026-05-12
🤖 AI

Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation

تحدد هذه الورقة ظاهرة "تآكل القدرة" في وكلاء النماذج اللغوية الكبيرة ذاتية التطور، حيث يؤدي التكيف مع مهام جديدة إلى تدهور المهارات المتعلمة سابقاً عبر أبعاد سير العمل، والمهارة، والنموذج، والذاكرة، وتقترح إطار عمل "التطور الحافظ للقدرة" (CPE) لتحقيق استقرار التكيف طويل الأمد من خلال منع هذا الانحراف التدميري بشكل صريح.

Ye Yu, Xiaopeng Yuan, Haibo Jin, Heming Liu, Yaoning Yu, Haohan Wang2026-05-12
🤖 machine learning

Mem-W: Latent Memory-Native GUI Agents

يقدم Mem-W فئة جديدة من وكلاء واجهة المستخدم الرسومية (GUI) التي تدمج الذاكرة التاريخية والذاكرة العاملة مباشرة في السياق الكامن للنموذج كرموز مدمجة، مما يلغي التباين بين الذاكرة الرمزية الخارجية والتمثيلات الداخلية لتحسين أداء المهام طويلة المدى بشكل كبير عبر اختبارات الويب والهاتف المحمول.

Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan2026-05-12
🤖 machine learning

Test-Time Speculation

تقدم هذه الورقة البحثية "التخمين وقت الاختبار" (TTS)، وهي طريقة تقطير عبر الإنترنت تعمل على تكييف نموذج مسودة باستمرار أثناء الاستدلال باستخدام إشارات التحقق من النموذج المستهدف، مما يتغلب على تدهور الأداء للنماذج المخمنة الحالية في التسلسلات الطويلة ويحسن أطوال القبول بشكل كبير.

Avinash Kumar, Sujay Sanghavi, Poulami Das2026-05-12✓ Author reviewed
🤖 AI

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

تقدم هذه الورقة HOME-KGQA، وهو مجموعة بيانات مرجعية جديدة متعددة الوسائط للإجابة على الأسئلة القائمة على الرسوم البيانية للمعرفة والمتمحورة حول الأنشطة المنزلية اليومية، والتي تكشف عن فجوات أداء كبيرة في الأساليب الحالية القائمة على النماذج اللغوية الكبيرة عند التعامل مع الاستدلال المكاني الزماني المعقد والربط متعدد الوسائط المطلوب لتططبيقات الذكاء الاصطناعي المتجسد في العالم الحقيقي.

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamur (…)2026-05-12