🤖 AI

Position: Medical AI Neglects Real Treatment Outcomes

تجادل ورقة الموقف هذه بأن اعتماد الذكاء الاصطناعي الطبي على الآراء البشرية والتركيبات النصية بدلاً من بيانات نتائج العلاج الفعلية المستمدة من المصادر الرصدية والتجريبية يحد بشكل خطير من إمكاناته، مما يستوجب تحولاً نحو دمج بيانات النتائج الواقعية في كل من التدريب والتقييم لتحقيق الهدف الأسمى المتمثل في تحسين صحة المرضى بشكل أفضل.

Shiva Kaul, Anjum Khurshid2026-08-18
🤖 AI

When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning

تقدم هذه الورقة معياراً لتقييم تحديد القانون واجب التطبيق زمنياً، وتكشف أن النماذج اللغوية الكبيرة تظهر انحيازاً قوياً نحو تطبيق القانون الأحدث بسبب تقارب الاستدلال الناجم عن التعلم المعزز، مما يؤدي إلى علاقة عكسية غير بديهية حيث تؤدي النماذج ذات قدرات الاستدلال العام الأقوى أداءً أسوأ في المهام القانونية المرتبطة زمنياً.

Yiqian Huang, Shuyuan Zheng, Qianying Liu, Shaowen Peng, Yuntao Kong, Kotaro Funakoshi, Chuan Xiao, Manabu Okumura, Yang (…)2026-08-18
🤖 AI

Do LLM Agents Negotiate Rationally? A Mechanism-Design Framework for Verifiable Multi-Agent Interaction over A2A/MCP

تقدم هذه الورقة إطار عمل لتصميم الآليات يقوم بترميز بروتوكولات التفاوض الكلاسيكية في مخططات رسائل A2A/MCP مع التحقق من الصحة أثناء التشغيل، مما يكشف أنه بينما يضمن التفاعل المنظم نجاح المهمة، فإن الوكلاء القائمين على النماذج اللغوية الكبيرة غالباً ما يفشلون في إظهار السلوكيات العقلانية والمتوافقة مع الحوافز التي تتنبأ بها نظرية الألعاب.

Wael Albayaydh, Rui Zhao2026-08-18
🤖 machine learning

DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

تُثبت هذه الورقة أن عنقوداً مكوناً من 128 وحدة معالجة رسومية، تم بناؤه من أجهزة مستعملة ومتقاعدة، يمكنه خدمة نماذج اللغات الكبيرة مثل LLaMA-70B بشكل اقتصادي، وإن كانت استدامته البيئية تعتمد بشكل صارم على نشره في مناطق ذات كهرباء منخفضة الكربون لتعويض الاستهلاك العالي للطاقة للوحدات الرسومية الأقدم.

Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov, Yiren Zhao2026-08-18
🤖 AI

Large Language Models and their Awareness of Mechanics and Spatial Geometry

تقدم هذه الورقة MecEng، وهو معيار مؤتمت بالكامل يقيم الوعي بالهندسة الميكانيكية لـ 34 نموذجاً من النماذج اللغوية الكبيرة عبر اختبار قدرتها على توليد نماذج أنظمة متعددة الأجسام جاهزة للمحاكاة من أوصاف نصية، مما يكشف أنه بينما تظهر النماذج الحالية تحسناً سريعاً ومعدلات نجاح عالية في مهام الأجسام الصلبة، إلا أنها لا تزال تواجه صعوبة في الأنظمة متعددة الأجسام المرنة والمعقدة.

Johannes Gerstmayr, Sebastian Weyrer, Tobias Möltner, Peter Manzl, Michael Pieber2026-08-18
🤖 machine learning

Calibrated Trust, Not Sharper Prediction: An Empirical Test of Uncertainty Fusion

تُظهر هذه الدراسة التجريبية حول قضايا المحكمة الأوروبية لحقوق الإنسان أن دمج أدوات عدم اليقين مع النماذج اللغوية الكبيرة المتطورة لا يحسن دقة التنبؤ بل يؤدي غالباً إلى تدهور المعايرة، ولكنه يوفر بدلاً من ذلك قيمة تشغيلية من خلال تمكين التصفية الآلية عالية الدقة للقضايا عبر الثقة المعايرة والتنبؤ الانتقائي.

Surya Saka2026-08-18
🤖 machine learning

Explaining Reinforcement Learning Decisions in Self-adaptive Systems

تقدم هذه الورقة البحثية مكتبة EARL، وهي مكتبة بلغة بايثون تولد تفسيرات مضادة للواقع بديهية لقرارات التعلم التعزيزي في الأنظمة ذاتية التكيف، والتي تم استعراضها من خلال تطبيقها على محاكاة لخدمة CitiBike لتعزيز الشفافية وثقة المستخدم.

Jasmina Gajcin, Juan C. Rosero, Ivana Dusparic2026-08-18
💻 computer science

AutoMem: A Text-Gradient Recursive Self-Improvement Framework for Automated Memory Architectures Search

تقترح الورقة البحثية AutoMem، وهو إطار عمل للتحسين الذاتي التكراري القائم على تدرج النصوص، والذي يكتشف تلقائياً بنيات ذاكرة متكيفة مع المهام من خلال الجمع بين البحث الموجه بالخبرة والتشخيص الوظيفي للمكونات الموجه بالفشل، متفوقاً باستمرار على النماذج المرجعية المصممة بشرياً مع تحسين المقايضات بين الدقة والكفاءة.

Lin Du, Jie Zhou, Yuxuan Cai, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Wei Li, Liang He2026-08-18
🤖 AI

Learning Agent Execution for KV-Cache Management in Agentic Serving

تقدم هذه الورقة CacheScout، وهو وقت تشغيل لـ KV-cache مدرك للوكيل يتعلم انتقالات تنفيذ الوكيل عبر الإنترنت لإدارة استبعاد التخزين المؤقت والتحميل المسبق بشكل استباقي، مما يحسن معدلات الإصابة بشكل كبير ويقلل زمن الاستجابة لخدمة النماذج اللغوية الكبيرة متعددة الوكلاء دون الحاجة إلى رسوم بيانية لسير العمل محددة مسبقاً.

Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu2026-08-18
💻 computer science

Local AI pre-screening for human triple-blind peer review in health sciences

تقترح هذه الورقة إطار عمل شفافاً وثلاثي التعمية لمراجعة الأقران في العلوم الصحية، يستخدم نماذج لغوية كبيرة مفتوحة الأوزان ومستضافة محلياً لإجراء فحص مسبق متعدد المراحل للتخفيف من المخاطر المرتبطة باستخدام الذكاء الاصطناعي غير المعلن ونقص المراجعين، مع ضمان احتفاظ الخبراء البشريين بسلطة اتخاذ القرار النهائي.

Rodrigo Martins Boos2026-08-18