🤖 AI

Not Too Generative, Not Too Discriminative: The Human Alignment Sweet Spot

باستخدام نماذج الطاقة المشتركة لعزل أهداف التعلم ضمن بنية ثابتة، تُظهر هذه الدراسة أن التمثيلات المرئية المتوافقة مع القدرات البشرية لا يتم تعظيمها من خلال التدريب التمييزي أو التوليدي البحت، بل من خلال توازن أمثل بين كلا الهدفين.

Jorge Chang Ortega, Bastien Le Lan, Thomas Serre, Victor Boutin2026-05-25
🤖 machine learning

It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt

تُظهر هذه الدراسة أن التحيز الجيوسياسي في النماذج اللغوية الكبيرة يتم إدخاله وتضخيمه بشكل أساسي خلال مرحلة محاذاة ما بعد التدريب بدلاً من كونه موروثاً من بيانات ما قبل التدريب، مع تباين اتجاه وحجم هذه التحيزات باختلاف منطقة المطور واللغة المستخدمة في التلقين.

Stuart Bladon, Brinnae Bent2026-05-25
🤖 AI

Leveraging Foundation Models for Causal Generative Modeling

تقدم هذه الورقة FM-CGM، وهو إطار عمل معياري يستفيد من النماذج التأسيسية سابقة التدريب وآلية توجيه دلالي سببي مبتكرة لتمكين الاكتشاف السببي، والتدخل، وتوليد الصور الواقعي المضاد للواقع (counterfactual) ضمن مسار موحد في مرحلة الصفر (zero-shot).

Aneesh Komanduri, Xintao Wu2026-05-25
🤖 AI

Human Decision-Making with Persuasive and Narrative LLM Explanations

تكشف هذه الدراسة واسعة النطاق أنه في حين أن التفسيرات السردية التي تولدها النماذج اللغوية الكبيرة تزيد من الاعتماد على تنبؤات الذكاء الاصطناعي بغض النظر عن دقتها، إلا أنها لا تحسن أداء اتخاذ القرار لدى البشر، بل قد تعيق أيضاً أوقات الاستجابة والقدرة على التمييز بين مخرجات الذكاء الاصطناعي الصحيحة والخاطئة.

Laura R. Marusich, Mary Grace Kozuch Dhooghe, Jonathan Z. Bakdash, Murat Kantarcioglu2026-05-25
🤖 AI

CHRONOS: Temporally-Aware Multi-Agent Coordination for Evolving Data Marketplaces

تُعد CHRONOS بنية ثلاثية الطبقات لأسواق بيانات الرسوم البيانية المعرفية الزمنية، توحد بين تحسين الاستدعاء القائم على المعادلات التفاضلية العادية العصبية (neural-ODE)، وتسعير شابلي المدرك لنقاط التغيير، والخصوصية التفاضلية لـ EXP3-IX، لمعالة الإخفاقات المزدوجة المتمثلة في فهرسة البيانات القديمة، وسوء عزو القيمة، والاستهلاك المفرط للميزانية في بيئات البيانات المتطورة.

Joydeep Chandra2026-05-25
💬 NLP

ETCHR: Editing To Clarify and Harness Reasoning

تقدم الورقة البحثية ETCHR، وهو إطار عمل لتحرير الصور يعتمد على الفصل والوعي بالاستدلال، يعمل على سد الفجوة بين الأسئلة المجردة والتحولات البصرية من خلال وصفة تدريب مكونة من مرحلتين، مما يعزز بشكل كبير قدرات الاستدلال البصري لمختلف النماذج اللغوية الكبيرة متعددة الوسائط عبر عائلات مهام متعددة.

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin2026-05-25
🤖 AI

From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills

تقدم هذه الورقة تقييماً منهجياً لدورة الحياة الكاملة للمهارات التي تولدها النماذج للوكلاء، كاشفةً أنه في حين أنها تحسن الأداء بشكل عام، إلا أن فائدتها تتباين بشكل كبير عبر المستخرِجات والمستهلكات بسبب السلوكيات غير الموحدة والنقل السلبي، مما أدى إلى تطوير إطار عمل للمهارات العليا (meta-skill) يعمل على تحسين الاستخراج لتعزيز الجودة والحد من الفشل.

Zisu Huang, Jingwen Xu, Yifan Yang, Ziyang Gong, Qihao Yang, Muzhao Tian, Xiaohua Wang, Changze Lv, Xuemei Gao, Qi Dai (…)2026-05-25
💬 NLP

Internal narratives parameterise affective states

من خلال دراستين واسعتي النطاق تستخدمان تمثيلات النماذج اللغوية الكبيرة، يوضح هذا البحث أن بنية وديناميكيات السرديات الداخلية لا تتنبأ بشدة الاكتئاب فحسب، بل تؤثر أيضًا بشكل سببي على الحالات الوجدانية، مما يشير إلى أن الوجدان يعمل كحالة حوسبية تقيد بناء السرد وتدمج السياق.

Jakub Onysk, Quentin J. M. Huys2026-05-22
💬 NLP

Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark

تقدم هذه الورقة البحثية GPBench، وهو معيار تقييم جديد قائم على الكفاءة للممارسة العامة، لتقييم عشرة من النماذج اللغوية الكبيرة المتطورة، وتخلص إلى أن النماذج الحالية ليست مناسبة بعد للنشر السريري المستقل، مما يستلزم إشرافاً بشرياً مستمراً وتحسيناً إضافياً.

Zheqing Li, Yiying Yang, Jiping Lang, Wenhao Jiang, Junrong Chen, Yuhang Zhao, Shuang Li, Dingqian Wang, Zhu Lin, Xuanna (…)2026-05-22
🤖 AI

PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving

تقدم الورقة البحثية PHYSICS، وهو معيار شامل يتكون من 1,297 مسألة في الفيزياء على المستوى الجامعي تم تصنيفها من قبل خبراء، والذي يكشف أن حتى أكثر النماذج التأسيسية تقدمًا مثل o3-mini تعاني في الاستدلال العلمي عالي المستوى، حيث تحقق دقة تبلغ 59.9% فقط رغم استراتيجيات التحسين المختلفة.

Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan2026-05-22