📈 economics

Measuring What Cannot Be Surveyed: LLMs as Instruments for Latent Cognitive Variables in Labor Economics

تؤسس هذه الورقة إطاراً نظرياً لاستخدام النماذج اللغوية الكبيرة كأدوات قياس صالحة للمتغيرات المعرفية الكامنة في اقتصاديات العمل، مبرهنةً من خلال بناء والتحقق من صحة "مؤشر رأس المال البشري المعزز" أن النماذج اللغوية الكبيرة يمكنها قياس محتوى المهام الوظيفية بشكل موثوق للكشف عن أبعاد متميزة للتعرض للذكاء الاصطناعي وتصحيح خطأ القياس في التقدير الاقتصادي.

Cristian Espinal Maya2026-04-06
💬 NLP

SWAY: A Counterfactual Computational Linguistic Approach to Measuring and Mitigating Sycophancy

تقدم هذه الورقة SWAY، وهو مقياس مضاد للواقع غير خاضع للإشراف لقياس تملق النماذج اللغوية، وتُبين أن استراتيجية التخفيف عبر سلسلة الأفكار المضادة للواقع تقلل هذا التحيز بفعالية إلى ما يقرب من الصفر دون المساس بالاستجابة للأدلة الحقيقية.

Joy Bhalla, Kristina Gligorić2026-04-06
🤖 machine learning

Do We Need Frontier Models to Verify Mathematical Proofs?

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة مفتوحة المصدر والأصغر حجمًا يمكنها مضاهاة النماذج الرائدة في التحقق من البراهين الرياضية عند تزويدها بمطالبات متخصصة موجهة من قِبل النماذج اللغوية الكبيرة تتغلب على عدم اتساقها وحساسيتها للمطالبات، مما يتحدى ضرورة استخدام النماذج الرائدة لهذه المهمة.

Aaditya Naik, Guruprerana Shabadi, Rajeev Alur, Mayur Naik2026-04-06
💬 NLP

Skeleton-based Coherence Modeling in Narratives

تقترح هذه الورقة شبكة تشابه الجملة/الهيكل (SSN) لتقييم التماسك السردي من خلال تحليل الاتساق بين الجملة وهيكلها، لكنها تجد أن النماذج القائمة على مستوى الجملة تتفوق على النهج القائمة على الهيكل، مما يشير إلى أن التقنيات الحالية المتطورة التي تركز على الجمل الكاملة أكثر فعالية من تلك التي تعتمد على البنى تحت الجملية.

Nishit Asnani, Rohan Badlani2026-04-06
💬 NLP

Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets

تجادل هذه الورقة بأن نماذج اللغات الكبيرة أحادية الوكيل أكثر كفاءة في المعلومات من الأنظمة متعددة الوكلاء في الاستدلال متعدد الخطوات تحت ميزانية متساوية من الرموز (tokens)، حيث تثبت من خلال دراسة تجريبية وتحليل معلوماتي نظري أن المزايا المزعومة للأنظمة متعددة الوكلاء تنبع غالباً من الحوسبة غير المنضبطة والآثار السياقية بدلاً من الفوائد الهيكلية المتأصلة.

Dat Tran, Douwe Kiela2026-04-06
💬 NLP

Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تُظهر انحيازاً تأكيدياً أثناء مهام اكتشاف القواعد، مما يؤدي إلى عدم كفاءة في اختبار الفرضيات، ولكنها تُظهر أن هذا القصور يمكن التخفيف من حدته بفعالية من خلال التلقين المستهدف والتقطير السلوكي، مما يؤدي بدوره إلى تحسين أداء الاستدلال لديها.

Ayush Rajesh Jhaveri, Anthony GX-Chen, Ilia Sucholutsky, Eunsol Choi2026-04-06
💬 NLP

Social Meaning in Large Language Models: Structure, Magnitude, and Pragmatic Prompting

تُظهر هذه الورقة أنه بينما تُحاكي النماذج اللغوية الكبيرة الأنماط الهيكلية للاستدلالات الاجتماعية البشرية نوعياً، إلا أنها غالباً ما تُشوه حجم هذه الاستدلالات، وهو قصور يمكن التخفيف من حدته جزئياً عبر استراتيجيات التلقين القائمة على النظرية التداولية، وتحديداً تلك التي تتناول معرفة المتحدث ودوافعه.

Roland Mühlenbernd2026-04-06
💬 NLP

PolyJarvis: LLM Agent for Autonomous Polymer MD Simulations

يُعد PolyJarvis عميلاً مستقلاً مدفوعاً بنماذج اللغات الكبيرة (LLM) يتكامل مع منصة RadonPy لتنفيذ محاكاة ديناميكيات جزيئية كاملة الذرات من البداية إلى النهاية للبوليمرات، حيث نجح في التنبؤ بالخصائص الرئيسية مثل الكثافة ومعامل المرونة ببراعة عالية، مع إثبات أن وكلاء نماذج اللغات الكبيرة يمكنهم مضاهاة أداء الخبراء في سير عمل محاكاة البوليمرات.

Alexander Zhao, Achuth Chandrasekhar, Amir Barati Farimani2026-04-06
💬 NLP

Principled and Scalable Diversity-Aware Retrieval via Cardinality-Constrained Binary Quadratic Programming

تقدم هذه الورقة إطار عمل مبدئيًا وقابلًا للتوسع للاسترجاع الواعي بالتنوع في أنظمة توليد المخرقات المعززة بالاسترجاع (RAG) من خلال صياغة المشكلة كبرنامج تربيعي ثنائي مقيد بالعدد، وحلها باستخدام خوارزمية مبتكرة قائمة على طريقة "فرانك-وولف" توفر ضمانات نظرية مع التفوق على الأساليب الحالية في كل من المقايضات بين الصلة والتنوع والكفاءة الحسابية.

Qiheng Lu, Nicholas D. Sidiropoulos2026-04-06
💬 NLP

High Volatility and Action Bias Distinguish LLMs from Humans in Group Coordination

تكشف هذه الورقة أن النماذج اللغوية الكبيرة تواجه صعوبة في تحقيق تنسيق جماعي مستقر مقارنة بالبشر، حيث تُظهر تبديلاً مفرطاً في الأفعال واستجابة محدودة للتغذية الراجعة الأكثر ثراءً، مما يسلط الضوء على اختلافات سلوكية جوهرية في استراتيجيات التعلم التكيفي والتقارب.

Sahaj Singh Maini, Robert L. Goldstone, Zoran Tiganj2026-04-06