💬 NLP

Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs

تتقصى هذه الورقة ما إذا كان نموذجا LLaMA 2 وFlan-T5 يظهران استدلالاً انتقالياً حقيقياً أم يعتمدان على إشارات سطحية من خلال ضبط التداخلات اللفظية، والمعرفة المسبقة، والكيانات المسماة، مما يكشف أنه بينما يستفيد كلا النموذجين من التداخلات المعجمية، فإن Flan-T5 يُظهر مرونة أكبر تجاه التلاعبات القائمة على المعرفة، مما يشير إلى دور محتمل للضبط الدقيق في تطوير الفهم المنطقي.

Houman Mehrafarin, Arash Eshghi, Ioannis Konstas2026-09-10
🤖 AI

Quantifying Logical Consistency in Transformers via Query-Key Alignment

تقترح هذه الورقة استراتيجية تقييم خفيفة الوزن تكمّم الاتساق المنطقي في النماذج اللغوية الكبيرة من خلال تحليل محاذات الاستعلام والمفتاح (query-key alignments) ضمن رؤوس الانتباه في المحولات (transformer attention heads)، مما يثبت فعاليتها في التمييز بين الاستدلالات الصحيحة وغير الصحيحة عبر نماذج تتراوح أحجامها من 1.5 مليار إلى 70 مليار معلمة.

Eduard Tulchinskii, Anastasia Voznyuk, Laida Kushnareva, Andrei Andriiainen, Irina Piontkovskaya, Evgeny Burnaev, Sergue (…)2026-09-10
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

تحدد هذه الورقة "انهيار الاستكشاف" كنمط فشل رئيسي حيث تفقد وكلاء النماذج اللغوية الكبيرة القدرة على اكتشاف حلول جديدة في البيئات غير المألوفة أثناء التعلم التعزيزي، وتقترح طريقة SPA، وهي طريقة تعمل على تحسين الأداء من خلال ترسيخ الوكيل أولاً في التنبؤ بالحالة والانتقال عبر الضبط الدقيق الخاضع للإشراف من خلال الخبرة الذاتية قبل التحسين من أجل المكافأة.

Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junx (…)2026-09-10
💬 NLP

Revisiting the Shape Convention of Transformer Language Models

تقدم هذه الورقة نماذج "Hourglass Transformers"، التي تستبدل شبكات التغذية الأمامية التقليدية ذات الهيكل (ضيق-عريض-ضيق) بآليات انتباه ووحدات (sub-MLPs) ذات شكل ساعة رملية لتحقيق أداء مماثل في نمذجة اللغة مع كفاءة تدريب محسنة، وفك تشفير أسرع، وتقليل استهلاك الذاكرة، وهو ما يفيد بشكل خاص في تطبيقات السياق الطويل.

Feng-Ting Liao, Guan-Ting Yi, Tzu-Quan Lin, Meng-Hsi Chen, Da-shan Shiu2026-09-10
💬 NLP

False positive bias in AI-powered speech-based cognitive screening for multilingual English speakers in the UK

تكشف هذه الدراسة أنه بينما تحقق نماذج الذكاء الاصطناعي القائمة على الكلام للفحص المعرفي دقة عالية في نسخ المتحدثين باللغة الإنجليزية متعددي اللغات في المملكة المتحدة، فإن نماذج التصنيف اللاحقة تظهر انحيازاً كبيراً في النتائج الإيجابية الكاذبة، حيث تصنف الأفراد متعددي اللغات بشكل خاطئ على أنهم يعانون من ضعف إدراكي بمعدلات تزيد بمقدار 2.5 مرة عن المتحدثين بلغة واحدة.

Madhurananda Pahar, Caitlin Illingworth, Dorota Braun, Bahman Mirheidari, Lise Sproson, Daniel Blackburn, Heidi Christen (…)2026-09-10
💬 NLP

"What Are You Really Trying to Do?": Co-Creating Life Goals from Everyday Computer Use

تقدم هذه الورقة البحثية "الخلق المشترك الساعي"، وهو نظام يرتكز على نظرية النشاط يعمل على استنتاج وتطوير أهداف الحياة طويلة المدى للمستخدمين بشكل تعاوني من خلال استخدامهم اليومي للحاسوب عبر واجهة تحرير تفاعلية، مما يتغلب بذلك على قيود الأنظمة الحالية التي تكتفي فقط برصد الأفعال السطحية.

Shardul Sapkota, Matthew Jörke, Zane Sabbagh, Omar Shaikh, Grace Wang, James A. Landay2026-09-10
💬 NLP

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

تقدم الورقة البحثية EVA-Bench، وهو إطار عمل مفتوح المصدر وشامل يجمع بين محاكاة المحادثة الديناميكية من بوت إلى بوت مع مقاييس مركبة (EVA-A و EVA-X) لتقييم الوكلاء الصوتيين بشكل شامل عبر 213 سيناريو للمؤسسات، مما يكشف عن فجوات كبيرة في دقة الأنظمة الحالية وموثوقيتها ومتانتها ضد اللهجات والضجيج.

Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Ra (…)2026-09-10
💬 NLP

X-CoSD: Communication-Efficient Cross-Vocabulary Collaborative Speculative Decoding

تقترح هذه الورقة إطار عمل X-CoSD، وهو إطار عمل للفك التخميني التعاوني يتسم بكفاءة الاتصال وعدم الفقدان، يتيح الاستدلال الموزع للنماذج اللغوية الكبيرة بين الأجهزة والخوادم ذات المفردات غير المتجانسة من خلال تقديم إعادة أخذ العينات الهجينة ومتغير إعادة أخذ العينات من الخادم مع التحقق من الجهاز لتسريع توليد الرموز بشكل كبير دون المساس بجودة المخرجات.

Jaeduk Lee, Wan Choi2026-09-10
💻 computer science

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

تقترح الورقة البحثية إطار عمل HEAL، وهو إطار عمل مبتكر يحدد ويخفف من حدة الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط من خلال تحليل انزياحات توزيع المعلومات في رؤوس التآزر وتطبيق المعايرة الديناميكية لتوجيه المخرجات نحو الأدلة الواقعية.

Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han2026-09-10