🤖 machine learning

Honest Lying: Understanding Memory Confabulation in Reflexive Agents

تكشف هذه الورقة أن الوكلاء من نمط "Reflexion" يعانون من "تخليق الذاكرة"، حيث يقومون بتخزين والاعتماد المتكرر على تأملات ذاتية خاطئة بثقة، وتقترح استراتيجية تخفيف باستخدام إشارات فشل برمجية لاستبدال التشخيص الذاتي مفتوح النهايات، مما يقلل بشكل كبير من معدل الخطأ هذا ويحسن أداء المهام.

Prakhar Dixit, Sadia Kamal, Tim Oates2026-05-29
🤖 machine learning

Composing Non-Conjugate Factor Graphs with Closed-Form Variational Inference

تُثبت هذه الورقة أن الاستدلال التبايني ذو الصيغة المغلقة يمكن الحفاظ عليه في البنيات الاحتمالية العميقة عبر تركيب خمسة عناصر أولية محددة من الرسوم البيانية العاملية، مما يُمكّن من بناء مُقربات دالة عالمية مثل أشجار القرار ومزيج الخبراء البايزي مع عدم يقين مُعاير دون الحاجة إلى معاملات بوابات مُتعلمة.

Mykola Lukashchuk, Kyrylo Yemets, Wouter M. Kouw, Dmitry Bagaev, żsmail Şenöz, Jeff Beck, Bert de Vries2026-05-29
🤖 AI

SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing

تقدم الورقة البحثية SciIntBench، وهو معيار تنافسي لتقييم 16 نموذجاً من النماذج اللغوية الكبيرة عبر 810 مطالبات ضمن عشر فئات من نزاهة البحث العلمي، كاشفةً أنه في حين ترفض النماذج بسلاسة سوء السلوك الصريح، إلا أنها تخفق بشكل متكرر في الالتزام بمعايير السلوك المسؤول عندما يتم تأطير الانتهاكات بشكل مستتر كاختصارات مدفوعة بالضغط.

Almene De Meran Meguimtsop, Maria Leonor Pacheco, Daniel E. Acuna2026-05-29
🤖 AI

MOOSE-Copilot: A Web-Based Interactive Assistant for Unified Exploratory and Fine-Grained Scientific Hypothesis Discovery

يُعد MOOSE-Copilot إطار عمل موحداً قائماً على الويب يسد الفجوة بين التفكير الاستكشافي والتحسين الدقيق في اكتشاف الفرضيات العلمية من خلال تمكين العلماء من توجيه العملية التوليدية بنشاط عبر بروتوكول تفاعل رسمي بين الإنسان والذكاء الاصطناعي، متفوقاً بذلك على النماذج المرجعية ذاتية التشغيل ومساهمًا في دمقرطة الوصول إلى الاختراقات العلمية المدفوعة بالذكاء الاصطناعي.

Hongran An, Zonglin Yang2026-05-29
🤖 AI

Evolutionary Rule Extraction from Corporate Default Prediction Models

تُظهر هذه الدراسة أن الجمع بين نماذج تعلم الآلة وإطار عمل مبتكر لاستخراج القواعد تطوري (DEXiRE-EVO) يعزز بشكل كبير كلاً من دقة التنبؤ وقابلية التفسير لتقييمات مخاطر الائتمان للمؤسسات الصغيرة والمتوسطة الإيطالية، مما يكشف عن مؤشرات رئيسية للتعثر المالي مثل قيود السيولة، وتآكل رأس المال، والرافعة المالية العالية.

Desirè Fabbretti, Matteo Pasquino, Elia Pacioni, Caterina Lucarelli, Davide Calvaresi2026-05-29
🤖 AI

VitalAgent: A Tool-Augmented Agent for Reactive and Proactive Physiological Monitoring over Wearable Health Data

تقدم هذه الورقة البحثية VitalAgent، وهو إطار عمل معزز بالأدوات يستفيد من الذاكرة الفسيولوجية الطولية والحوسبة الديناميكية للإشارات لتمكين كل من الإجابة التفاعلية على الأسئلة والمراقبة الاستباقية عبر بيانات الصحة المستمرة القابلة للارتداء، والتي تم التحقق من صحتها بواسطة مجموعة بيانات VitalBench الجديدة.

Di Zhu, Yu Yvonne Wu, Hong Jia, Aaqib Saeed, Vassilis Kostakos, Ting Dang2026-05-29
🤖 machine learning

PhoneWorld: Scaling Phone-Use Agent Environments

تقدم PhoneWorld مساراً قابلاً للتوسع يقوم تلقائياً بتحويل مسارات واجهة مستخدم الهاتف المحمول الحقيقية إلى بيئات تدريب قابلة للتحكم والتحقق عبر 34 تطبيقاً، مما يحسن بشكل كبير من أداء الوكيل في العديد من الاختبارات المرجعية من خلال نقل التركيز من بناء الاختبارات المرجعية يدوياً إلى الإنتاج الضخم لبيئات استخدام الهاتف.

Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo Guo, Zhengyao Fang, Yang Ding, Yi Zhang, Wein (…)2026-05-29
🤖 AI

The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF

تقدم هذه الورقة معيار DistractionIF للكشف عن أن النماذج اللغوية الكبيرة الأضخم تعاني من قانون قياس عكسي في المتانة ضد التعليمات المشتتة ضمن النص المرجعي، وهي ثغرة يمكن التخفيف من حدتها بفعالية من خلال التعلم التعزيزي باستخدام تحسين السياسة النسبي للمجموعات (GRPO).

Zeli Su, Zhankai Xu, Tianlei Chen, Longfei Zheng, Xiaolu Zhang, Jun Zhou, Wentao Zhang2026-05-29
🤖 AI

The New Pro Se: Generative AI and the Surge in Federal Civil Self-Representation

تحلل هذه الورقة بيانات التقاضي المدني الفيدرالي من عام 2008 إلى عام 2025 لتوضيح أن الاعتماد الواسع النطاق للذكاء الاصطناعي التوليدي قد أدى إلى زيادة كبيرة في الدعاوى المرفوعة من قبل أشخاص يمثلون أنفسهم، لا سيما بين المدعين من المرة الأولى والنساء في قضايا الحقوق المدنية، مما أسفر عن شكاوى أكثر كثافة في الاستشهادات تواجه معدلات استبعاد أعلى دون تحسين نتائج التقاضي.

Or Cohen-Sasson2026-05-29
🤖 machine learning

Quotient DAGs for Off-Policy Evaluation:Forward-Flow Importance Sampling and Exact Slate Propensities

تقدم هذه الورقة إطار عمل (quotient-DAG) وخوارزمية (Forward-DP) للقضاء على تباين المتغيرات المزعجة وتمكين الحساب الدقيق لميول القوائم غير المرتبة (unordered slate propensities) من أجل تقييم فعال خارج السياسة في أنظمة التوصية ذات التوليد الذاتي (autoregressive recommendation systems).

Ziwen Xie, Shaowen Xiang, Hongyu He, Dianbo Liu2026-05-29