📈 economics

CausalForge: A Formally Grounded, Self-Improving Agentic Framework for Automated Research in Causal Inference

تُعد CausalForge إطار عمل وكيلِيّاً ذاتي التحسين ومبنياً على أسس صورية، يعمل على أتمتة أبحاث الاستدلال السببي من خلال الجمع بين مكتبة Causalean القائمة على لغة Lean وبين مسار عمل يقوم بتوليد وتصوير وتدقيق البراهين لضمان موثوقية النتائج التي يتم فحصها آلياً.

Jiyuan Tan, Vasilis Syrgkanis2026-07-27
💬 NLP

Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

تُظهر هذه الورقة أن النماذج اللغوية الكبيرة التجارية تُبدي مواقف معرفية غير مستقرة وغامضة تجاه الادعاءات العلمية الزائفة، حيث تعتمد نتائج التحقق على تكوينات النشر، وأنواع الواجهات، والتحديثات الصامتة، بدلاً من كونها خصائص متأصلة في النماذج نفسها.

Davide Scarso, Hugo Noronha de Almeida, Joaquim Pina2026-07-27
🤖 AI

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

تكشف هذه الورقة أن إضافة المهارات الإجرائية إلى وكلاء النماذج اللغوية الكبيرة غالباً ما يتسبب في تراجعات كبيرة في الأداء بسبب التناضح الوصفي، وإزاحة التجذر، وإزاحة التحقق، محاججةً بأن الموثوقية تعتمد على تحسين التجذر والتحقق أكثر من اعتمادها على تحسين التوجيه الإجرائي.

Darshan Tank, Baran Nama2026-07-27
🤖 AI

Expert Behavior Prior Reinforcement Learning

تقترح الورقة البحثية خوارزمية "أولوية سلوك الخبير" (EBP)، التي تستخدم مشفرًا تلقائيًا متغيرًا مشروطًا موجهًا بـ Q لتوليد أولويات سياسة الخبير ذات القيمة العالية مباشرة من مخازن إعادة التشغيل عبر الإنترنت، مما يتغلب على قيود مجموعات البيانات غير المتصلة بالإنترنت الثابتة لتحقيق كفاءة عينة فائقة وتقارب مستقر في التعلم المعزز عبر الإنترنت.

Gong Gao, Weidong Zhao, Xianhui Liu, Ning Jia2026-07-24
🤖 AI

LLM Bias Evaluation: Gender, Racial, and Age Disparities in Occupational and Crime Scenarios

تقيم هذه الورقة التحيزات القائمة على النوع الاجتماعي، والعرق، والعمر في أربعة من النماذج اللغوية الكبيرة الرائدة لعام 2024 عبر سيناريوهات مهنية وإجرامية، مما يكشف عن انحرافات كبيرة عن بيانات الواقع ويُظهر أن جهود معالجة التحيز الحالية غالباً ما تخلق مقايضات جديدة للعدالة تُعرف باسم "مفارقة معالجة التحيز".

Vishal Mirza, Rahul Kulkarni, Aakanksha Jadhav2026-06-01
💬 NLP

Breaking Information Cocoons: A Hyperbolic Framework for Balancing Exploration and Exploitation in Recommender Systems

تقترح الورقة البحثية HERec، وهو إطار عمل زائدي يجمع بين النمذجة الهرمية المعززة دلاليًا والتجميع التلقائي لموازنة الاستكشاف والاستغلال بفعالية في أنظمة التوصية، مما يؤدي إلى التخفيف من حدة الشرانق المعلوماتية مع التفوق على النماذج المرجعية الحالية الإقليدية والزائدية.

Qiyao Ma, Menglin Yang, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying2026-06-01
💬 NLP

Beyond Memorization: Assessing Semantic Generalization in Large Language Models Using Phrasal Constructions

تقدم هذه الورقة مجموعة بيانات تقييمية مبتكرة قائمة على نحو القواعد (Construction Grammar) لتقييم قدرات التعميم الدلالي للنماذج اللغوية الكبيرة، كاشفةً أن حتى النماذج الأكثر تطوراً تعاني في التمييز بين التراكيب العبارية المتطابقة تركيبياً والمتباينة دلالياً، حيث أظهرت انخفاضاً في الأداء يتجاوز 40% مقارنة بالحدس البشري.

Wesley Scivetti, Melissa Torgbi, Austin Blodgett, Mollie Shichman, Taylor Hudson, Claire Bonial, Harish Tayyar Madabushi2026-06-01
🤖 AI

Unifying and Optimizing Data Values for Selection via Sequential Decision-Making

توحد هذه الورقة بين اختيار البيانات وتقييمها من خلال إعادة صياغة المشكلة كمسألة اتخاذ قرار متسلسل يمكن حلها عبر البرمجة الديناميكية، مما يكشف أن الأساليب الحالية مثل "Data Shapley" هي تقريبات قاصرة النظر، وتقترح بديلاً قابلاً للتوسع يعتمد على الرسم البياني ثنائي الأجزاء يحقق مكاسب أداء مثبتة في كل من تعلم الآلة الكلاسيكي والضبط الدقيق لنماذج اللغات الكبيرة واسعة النطاق.

Hongliang Chi, Qiong Wu, Zhengyi Zhou, Jonathan Light, Emily Dodwell, Yao Ma2026-06-01
🤖 AI

ProofWala: A Framework for Multilingual Proof Data Synthesis and Theorem-Proving

تقدم هذه الورقة ProofWala، وهو إطار عمل متعدد اللغات مبني على مكتبة قابلة لإعادة الاستخدام للتفاعل البرمجي مع مبرهنات التفاعل التي تتيح استخراج بيانات برهنة وفحصاً متوازياً يتسمان بالقدرة على التوسع والأمانة الدلالية، مما يثبت أن التدريب عبر اللغات بين Lean وRocq يحسن بشكل كبير أداء إثبات النظريات والتكيف مع المجالات.

Amitayush Thakur, George Tsoukalas, Greg Durrett, Swarat Chaudhuri2026-06-01
💬 NLP

Chain-of-Thought Reasoning In The Wild Is Not Always Faithful

تُظهر هذه الورقة أن استدلال "سلسلة الأفكار" (Chain-of-Thought) في النماذج اللغوية الكبيرة غالباً ما يكون غير مخلص حتى في المطالبات الطبيعية غير العدائية، حيث تولد النماذج في كثير من الأحيان تبريرات متماسكة ولكن متناقضة مدفوعة بانحيازات ضمنية أو اختصارات غير منطقية، مما يكشف أن الاستدلال المنطوق لا يعكس بدقة عملية اتخاذ القرار الداخلية.

Iván Arcuschin, Jett Janiak, Robert Krzyzanowski, Senthooran Rajamanoharan, Neel Nanda, Arthur Conmy2026-06-01