💬 NLP

Investigating individual writing style as a contributor to gender gaps in science and technology

تكشف هذه الدراسة أن النساء في مجالات العلوم والتكنولوجيا يستخدمن بشكل منهجي أسلوباً كتابياً أكثر "تفاعلية" (علاقاتياً وموجهاً نحو الجمهور) من الرجال، وهو اختلاف أسلوبي يستمر عبر مختلف المجالات والقوالب ويؤثر بشكل كبير على أنماط الاستشهاد حسب النوع الاجتماعي، مما يشير إلى أن الأسلوب اللغوي يعمل كمصدر خفي وغير ملحوظ لانحياز التقييم.

Kara Kedrick, Ekaterina Levitskaya, Russell J. Funk2026-08-17
⚡ electrical engineering

BAT: Learning to Reason about Spatial Sounds with Large Language Models

تقدم هذه الورقة البحثية BAT، وهو إطار عمل مبتكر يدمج مشفرًا صوتيًا ثنائي الأذن يُسمى Spatial-AST مع نموذج لغوي كبير (LLaMA-2) لتمكين الإدراك والاستنتاج المتقدمين للصوت المكاني، مدعومًا بمجموعة بيانات مُخلّقة حديثًا ومعيار متخصص للإجابة على الأسئلة.

Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath2026-08-17
💬 NLP

Leveraging Few-Shot Learning and Large Language Models for Analyzing Blood Pressure Variations Across Biological Sex from Scientific Literature

تقيم هذه الدراسة جدوى استخدام النماذج اللغوية الكبيرة (LLMs) والتعلم بلقطات قليلة لاستخراج إحصائيات ضغط الدم الخاصة بكل جنس تلقائيًا من الأدبيات العلمية، بهدف معالجة أوجه القصور في المعايير التشخيصية الحالية التي تتجاهل العوامل الديموغرافية.

Yuting Guo, Seyedeh Somayyeh Mousavi, Reza Sameni, Abeed Sarker2026-08-17
🔬 materials science

LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction

تقدم هذه الورقة البحثية LLM4Mat-Bench، وهو أكبر معيار مرجعي حتى الآن يضم 1.9 مليون بنية بلورية و45 خاصية عبر أنماط مدخلات متعددة، لتقييم وتسليط الضوء بشكل منهجي على أوجه القصور في كل من النماذج اللغوية الكبيرة العامة والمتخصصة في مهام محددة عند التنبؤ بخصائص المواد.

Andre Niyongabo Rubungo, Kangming Li, Jason Hattrick-Simpers, Adji Bousso Dieng2026-08-17
💬 NLP

Research-Oriented Human-Centric Evaluation for Foundation Models

تقدم هذه الورقة إطار عمل للتقييم المتمحور حول الإنسان موجهًا نحو البحث، يعالج أوجه القصور في المعايير الموضوعية من خلال رصد تصورات المستخدمين عبر القدرة على حل المشكلات، وجودة المعلومات، وتجربة التفاعل من خلال 604 جلسات بشرية، بينما يثبت أنه حتى النماذج اللغوية الكبيرة المتقدمة لا يمكنها محاكاة القيمة التي لا تُعوض للحكم البشري من منظور الشخص الأول بشكل كامل.

Yijin Guo, Kaiyuan Ji, Xiaorong Zhu, Junying Wang, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai2026-08-17
💬 NLP

A Unified Assessment of the Poverty of the Stimulus Argument for Neural Language Models

تقدم هذه الورقة \poshbench، وهو معيار موحد يوضح أنه بينما يمكن للنماذج اللغوية العصبية اكتساب تعميمات تعتمد على البنية من بيانات محدودة دون وجود تحيزات نحوية فطرية، إلا أنها تظل أقل كفاءة من الأطفال وتتطلب انحيازات استقرائية إضافية مدفوعة معرفيًا لمطابقة التعلم الشبيه بالبشر بشكل كامل.

Xiulin Yang, Arianna Bisazza, Nathan Schneider, Ethan Gotlieb Wilcox2026-08-17
💬 NLP

TradeVerse: A Longitudinal Benchmark of Political Negotiation in International Trade

تقدم هذه الورقة TradeVerse، وهو أول معيار مرجعي طولي مستمد من سجلات اجتماعات منظمة التجارة العالمية يقيم قدرات النماذج اللغوية الكبيرة في فهم المفاوضات التجارية السياسية متعددة الأدوار من خلال ثلاث مهام: التنبؤ برموز المنتجات، وتحديد الدول المستجيبة، وتوليد البيانات الدبلوماسية.

Debodeep Banerjee, Amitangshu Dasgupta2026-08-17
🤖 AI

Modular Cognitive Architecture Emerges in Large Language Models

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تطور تلقائياً بنية معرفية نمطية تحاكي التخصص الوظيفي الموجود في الدماغ البشري، مما يشير إلى أن هذه النمطية هي خاصية أساسية للأنظمة الذكية وليست مجرد مصادفة بيولوجية.

Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda2026-08-17
💬 NLP

Does a Language Server Save Tokens for Coding Agents? A Measurement Methodology and Preliminary Study

تتحدى هذه الورقة الافتراض القائل بأن الاسترجاع الدلالي عبر بروتوكول خادم اللغة (LSP) هو بطبيعته أكثر كفاءة في استهلاك الرموز (tokens) من البحث المعجمي لوكلاء البرمجة، حيث تكشف من خلال منهجية قياس جديدة أن بروتوكول (LSP) غالباً ما يزيد من تكاليف الرموز ويفشل في مضاهاة فعالية أداة "grep" في التعديلات المعقدة، ومن ثم تدعو إلى استراتيجية تكيفية لاختيار الأدوات بناءً على نوع المهمة وقدرة النموذج.

Pengcheng Xu2026-08-17
💬 NLP

Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems

تقدم هذه الورقة البحثية InflationAgent، وهو إطار عمل توجيه مبتكر يعالج فجوة "تضخم الرموز" (token inflation) في أنظمة النماذج اللغوية الكبيرة الوكيلية من خلال التنبؤ بتكاليف مستوى سير العمل عبر "إنتروبيا تفرع سلسلة الأفكار" (CoT Branching Entropy) وتحسين اختيار النماذج عبر "سعر صرف دلالي" (Semantic Exchange Rate)، محققاً بذلك دقة أعلى بعدد أقل من الرموز مقارنة بالطرق الحالية مثل FrugalGPT.

Heming Fu, Shan Lin, Qianqian Xie, Guojun Xiong2026-08-17