💬 NLP

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

تقدم هذه الورقة مساراً متعدد الوسائط قائماً على الأدلة يقوم ببناء رسوم بيانية معرفية قابلة للتدقيق من مقاطع الفيديو المحاضراتية عبر دمج البيانات الصوتية والنصية والبصرية لاستخراج المفاهيم والتحقق من صحتها بدقة استرجاع عالية، مع إعطاء الأولوية للشفافية المنهجية على ادعاءات الأداء المتفوق.

Sahil Al Farib, Momota Ahsana Meem, Sheikh Redwanul Islam, Md. Tanvir Raihan2026-08-05
🤖 machine learning

Agentic Reinforcement Learning with Self-Distilled Reward Shaping

تقدم هذه الورقة "التعلم التعزيزي الوكيل مع تشكيل المكافأة بالتقطير الذاتي" (ADRS)، وهو إطار عمل يعزز أداء وكلاء اللغة في المهام طويلة الأمد من خلال توليد ائتمان على مستوى الرمز المرتبط بالعائد عبر إشارات مهارة مميزة ومقطرة ذاتياً، يتم معايرتها وحجبها بشكل مشترك بواسطة ثقة المعلم والعوائد المحققة.

Ranxu Zhang, Guinan Chen, Chenshaodong, Jinghao Lin, Xiaozhou Xu, Sunzhe, Yanyong Zhang, Chao Wang2026-08-05
🤖 machine learning

The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics

تُثبت هذه الورقة أن تحليل الديناميكيات الهيكلية لتتبعات "سلسلة الأفك‏ر" (Chain-of-Thought)، بدلاً من محتواها الدلالي، يمكن أن يكشف بفعالية عن إخفاقات الاستدلال ويصححها في النماذج اللغوية الكبيرة في مهام القابلية للإرضاء البوليانية (Boolean satisfiability)، كما يتضح من تدخل مستهدف رفع دقة نموذج Llama3-70B من 13.3% إلى 85%.

Shashwat Sourav, Aishwarya Balwani2026-08-05
💬 NLP

Distractor-Aware Truncation: Disentangling Context-Length Effects from Signal Loss in Long-Context LLM Benchmarks

تُثبت هذه الورقة أن تدهور الأداء الملاحظ عادةً في معايير قياس النماذج اللغوية الكبيرة ذات السياق الطويل تحت ظروف البتر القياسية ناتج في المقام الأول عن الإزالة العرضية للمعلومات ذات الصلة بالمهمة وليس بسبب قيود متأصلة في طول السياق، حيث يتم الحفاظ على الأداء أو تحسينه عندما يتم تطبيق البتر بطريقة واعية بالمشتتات تضمن الاحتفاظ بالإشارات.

Mohsen Arjmandi2026-08-05
💬 NLP

Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks

تقيم هذه الورقة الصلاحية التنبؤية لمعايير القياس المعتمدة على نطاق واسع في مجال المنطق العام عبر اختبار ٢٣ نموذجاً عبر مهام متنوعة، وتجد أن هذه المعايير لا تقدم سوى أدلة تعتمد على المهمة، بدلاً من تقديم أدلة عامة، حول كفاءة النماذج اللغوية الكبيرة في مهام الاستدلال الواقعي في التطبيقات اللاحقة.

Ine Gevers, Walter Daelemans2026-08-05
💬 NLP

FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact

تقدم الورقة البحثية FACTWASH، وهو بوابة مفتوحة المصدر تعمل في وقت الكتابة وتكتشف بشكل حتمي "غسيل الحقائق" (factwashing) — أي فقدان القابلية للتحقق عندما تعيد نماذج الذكاء الاصطناعي صياغة الأقاويل لتظهر كحقائق — من خلال الجمع بين الفحوصات القائمة على القواعد للنفي الصريح مع "شاهد" (witness) مستهدف يعتمد على النماذج اللغوية الكبيرة للكشف عن التحوط والإسناد، مما يكشف عن انتشار مثل هذه الأخطاء في أنظمة الذاكرة الحوارية بينما تندر في رسائل البريد الإلكتروني للأعمال.

Alex Kwon2026-08-05
💬 NLP

DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models

تقدم الورقة البحثية إطار عمل DUD (ديناميكيات التحديث المنفصلة)، الذي يعمل على تحسين تقدير عدم اليقين في النماذج اللغوية الكبيرة عبر فصل وتحليل المساهمات المتميزة لشبكات التغذية الأمامية وآليات الانتباه من خلال التدخلات السببية، مما يسمح بالتقاط الصراعات الميكانيكية الداخلية التي تغفل عنها الطرق التقليدية.

Yixin Bu, Runze Xia, Guanyun Zou, Yupeng Ji, Haodong Liu, Piji Li2026-08-05
💬 NLP

Dynamically Allocating Evaluation Effort for Model Ranking

تقترح هذه الورقة إطار عمل يعتمد على "المتعدد الأذرع" (multi-armed bandit) يقوم بتخصيص جهد التقييم البشري ديناميكياً للنماذج الأكثر تنافسية، مما يقلل التكاليف ويحسن كفاءة تحديد نماذج معالجة اللغات الطبيعية الأعلى أداءً مقارنة ببروتوكولات التقييم الشاملة.

Vilém Zouhar, Julia Kreutzer, Alon Lavie, Tom Kocmi, Matt Post, Ondřej Bojar, Mrinmaya Sachan2026-08-05
💬 NLP

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

تقدم هذه الورقة استراتيجية التبديل الموجه بالانتباه (AGS)، وهي استراتيجية استنتاج خالية من التدريب للنماذج اللغوية الكبيرة متعددة الوسائط، تعمل ديناميكيًا على موازنة الكفاءة والدقة باستخدام نسبة انتباه الرؤية إلى النص لتفعيل الاستدلال الكامن بشكل انتقائي للمهام الإدراكية مع فرض توليد نصي صريح للاستنتاج المنطقي.

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang2026-08-05
💬 NLP

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

تقدم هذه الورقة ChartAnno، وهو معيار مرجعي يضم 1,200 مخطط من العالم الحقيقي صُممت لتقييم قدرات النماذج اللغوية الكبيرة متعددة الوسائط في توليد تعليقات توضيحية للمخططات، مما يكشف أنه بينما تحقق التعليمات المحددة والنماذج المملوكة نتائج أفضل، فإن استنتاج القصد المجرد والاستفادة من صور المخططات لا يزالان يشكلان تحديات كبيرة.

Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo (…)2026-08-05