💻 computer science

Measuring Security Without Fooling Ourselves: Why Benchmarking Agents Is Hard

تحدد هذه الورقة ثلاث نقاط ضعف حرجة — وهي ثغرات المعايير المرجعية، والتقادم الزمني، وعدم اليقين أثناء التشغيل — التي تقوض التقييمات الأمنية الحالية لوكلاء الذكاء الاصطناعي، وتقترح اتجاهات عملية لتطوير أطر عمل أكثر متانة وموثوقية.

Sahar Abdelnabi, Chris Hicks, Konrad Rieck, Ahmad-Reza Sadeghi2026-05-22
💬 NLP

Beyond Temperature: Hyperfitting as a Late-Stage Geometric Expansion

تكشف هذه الورقة أن ظاهرة "الفرط في الملاءمة" (Hyperfitting) في النماذج اللغوية الكبيرة لا تنتج مجرد نتيجة لحدة انخفاض الإنتروبيا، بل تنبع من توسع هندسي ديناميكي معتمد على السياق في كتلة المحولات الأخيرة التي تعزز الرموز ذات الذيل العميق، وهي آلية يمكن محاكاتها بكفاءة باستخدام استراتيجية "LoRA في المرحلة المتأخرة" المستهدفة التي تقوم بتحديث آخر خمس طبقات فقط.

Meimingwei Li, Yuanhao Ding, Esteban Garces Arias, Christian Heumann2026-05-22
💻 computer science

MoSA: Motion-constrained Stress Adaptation for Mitigating Real-to-Sim Gap in Continuum Dynamics via Learning Residual Anisotropy

تُعد MoSA إطار عمل للتكيف مع الإجهاد المقيد بالحركة، وهي تجسر الفجوة بين الواقع والمحاكاة في ديناميكيات الاستمرارية عبر استخدام نموذج متماثل المناحي كسابقة فيزيائية لتعلم مؤثرات الإجهاد المتبقية التي تلتقط التباين والتباين النوعي الطفيف، مما يحقق دقة فائقة، وقدرة على التعميم، ونقلاً من المحاكاة إلى الواقع في مهام التلاعب الروبوتي.

Jiaxu Wang, Junhao He, Jingkai Sun, Yi Gu, Yunyang Mo, Jiahang Cao, Qiang Zhang, Renjing Xu2026-05-22
💻 computer science

Think Thrice Before You Speak: Dual knowledge-enhanced Theory-of-Mind Reasoning for Persuasive Agents

تقدم هذه الورقة مهمة ToM-PD ومجموعة بيانات ToM-BPD لمعالجة أوجه القصور في قدرات الاستنتاج المتعلقة بنظرية العقل لدى النماذج اللغوية الكبيرة الحالية، مقترحةً إطار عمل "فكر ثلاث مرات قبل أن تتحدث" (TTBYS) الذي يستفيد من المعرفة المزدوجة للتفوق بشكل كبير على GPT-5 في التنبؤ بالرغبات، والمعتقدات، واستراتيجيات الإقناع.

Minghui Ma, Bin Guo, Runze Yang, Mengqi Chen, Yan Liu, Jingqi Liu, Yahan Pei, Xuehao Ma, Qiuyun Zhang, Zhiwen Yu2026-05-22
💻 computer science

Innovations in Cardless Artificial Intelligence Banking: A Comprehensive Framework for Cyber Secure and Fraud Mitigation using Machine Learning Algorithms

تقترح هذه الورقة إطار عمل شاملاً للخدمات المصرفية القائمة على الذكاء الاصطناعي بدون بطاقات، يستفيد من خوارزميات تعلم الآلة، وتشفير البيانات المدفوع بالذكاء الاصطناعي، والبطاقات الافتراضية المولدة تلقائياً لتعزيز الأمن السيبراني، والمصادقة على المعاملات، والتخفيف الاستباقي لمخاطر الاحتيال.

Md Israfeel2026-05-22✓ Author reviewed
💻 computer science

Healthcare LLM Benchmarks Are Only as Good as Their Explicit Assumptions

تجادل هذه الورقة بأن الفجوة بين أداء نماذج اللغات الكبيرة في معايير الرعاية الصحية وبين النشر في العالم الحقيقي تنبع من افتراضات ضمنية غير مختبرة حول سلوك المستخدم، وتقترح إطاراً لتصنيف هذه الافتراضات وتقدم "بطاقات المعايير" (BenchmarkCards) والتقييم المرحلي لمعالجتها بشكل منهجي.

Naveen Raman, Santiago Cortes-Gomez, Mateo Dulce Rubio, Fei Fang, Bryan Wilder2026-05-22
💻 computer science

Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents

تقدم هذه الورقة "المهارات التعاقدية"، وهو إطار عمل مستوحى من GovernSpec يعمل على هيكلة تعليمات وكلاء الذكاء الاصطنا-الاصطناعي للمؤسسات في شكل عقود مهام قابلة للقراءة لتعزيز قابلية فحص الأهداف والحدود ومعايير الجودة، مبرهنةً من خلال التجارب أن هذا النهج يحسن الحوكمة وقابلية الصيانة بدلاً من كونه آلية سلامة قائمة بذاتها.

Ting Liu2026-05-22
💬 NLP

More Context, Larger Models, or Moral Knowledge? A Systematic Study of Schwartz Value Detection in Political Texts

تُظهر هذه الدراسة المنهجية أنه في حين أن استرجاع المعرفة الأخلاقية يحسن باستمرار الكشف عن قيم "شوارتز" في النصوص السياسية، فإن مجرد زيادة طول السياق أو حجم النموذج لا يضمن أداءً أفضل، حيث يتفوق الدمج المبكر للمعرفة المسترجعة على متغيرات "RAG" الأخرى والنماذج الأكبر حجماً.

Víctor Yeste, Paolo Rosso2026-05-22
💬 NLP

Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora

تُثبت هذه الورقة أنه على الرغم من التحديات المتعلقة بالفروق الثقافية الدقيقة واللغة العامية، فإن الترجمة الآلية القائمة على النماذج اللغوية الكبيرة تحافظ بفعالية على الإشارات الأخلاقية الدقيقة في بيانات وسائل التواصل الاجتماعي البولندية، مما يتيح إجراء أبحاث عابرة للغات حول القيم الأخلاقية بتكلفة اقتصادية من خلال تشابه دلالي عالٍ وفجوات أداء ضئيلة في مهام التصنيف اللاحقة.

Maciej Skorski2026-05-22✓ Author reviewed
💻 computer science

WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance

تقدم هذه الورقة البحثية WorkstreamBench، وهو معيار مرجعي جديد لتقييم وكلاء النماذج اللغوية الكبيرة (LLMs) في مهام الجداول البيانات المالية من البداية إلى النهاية باستخدام تصنيف متعدد الأبعاد يشمل الدقة، والصيغة، والتنسيق، مما يكشف أنه بينما تنتج النماذج الرائدة مثل Claude مخرجات ذات مظهر احترافي، إلا أن الوكلاء الحاليين لا يزالون يعانون من أجل التعامل بموثوقية مع التعقيد ومعايير الجودة المطلوبة لتدفقات العمل المالية في العالم الحقيقي.

Thomson Yen, Julian Poeltl, Harshith Srinivas Gear, Yilin Meng, Joshua Fan, Adam Shen, Yili Liu, Ali Bauyrzhan, Siri Du (…)2026-05-22