💬 NLP

Adaptive Triggering for Bias Correction in LLM Reasoning

تقترح هذه الورقة إطار عمل للتحفيز التكيفي يصيغ تصحيح الانحياز في استدلال النماذج اللغوية الكبيرة كمسألة كشف عن نقطة تغير عبر الإنترنت، حيث يتدخل ديناميكياً فقط عندما يتجاوز الدليل المتراكم على انتشار الصور النمطية عتبة مُعايرة، وذلك للحد من الانحياز بفعالية مع تقليل التعطيل غير الضروري للاستدلال الصحيح.

Nayoung Kim, Mickey Mancenido, Huan Liu2026-08-27
💬 NLP

OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora

تقدم هذه الورقة البحثية OmniPhys، وهو معيار مرجعي متعدد الوسائط واسع النطاق مستمد من مجموعات النصوص التعليمية الصينية، والذي يقيم ويعزز فهم الفيزياء وتوليد الرسوم التخطيطية المهيكلة في النماذج اللغوية الكبيرة متعددة الوسائط من خلال 15,246 سؤالاً و19,850 صورة.

Hao Chen, Yumin Lin, Nadila Yushanjiang, Xin Lin, Min Zhang2026-08-27
💬 NLP

MathAdv: What Theorem Provers Know, Reason, Formalize, and Generalize

تقدم الورقة البحثية MathAdv، وهو معيار تشخيصي شامل يمتد عبر 13 مجالاً رياضياً يقيم أثباتات النظريات من خلال مهام مساعدة متعددة للكشف عن الاختناقات الحرجة في الصياغة الرسمية، والتباينات في الأداء الخاصة بكل مجال، وحدود المتانة التي غالباً ما تحجبها مقاييس الدقة التجميعية.

Jiaxin Yuan, Connor Martinez Lockhart, Xiaoyu Liu, Jiaqi Wang, Chenghao Deng, Xiayimei Han, Vlasios Mastrantonis, Dmitri (…)2026-08-27
🤖 machine learning

A Storage-Retrieval Gap in Parametric Knowledge Graph Memory

تُثبت هذه الورقة أنه في حين أن تجميع الرسوم البيانية للمعرفة في محولات "LoRA" الخاصة بكل كيان يتيح تخزيناً بارامترياً فعالاً للمعرفة الواقعية بتكلفة سياقية صفرية، إلا أن الأوزان الناتلة تفتقر إلى القدرة على الاسترجاع القائم على التشابه الدلالي، مما يؤكد الحاجة إلى آلية متعلمة ومشروطة بالاستعلام لاختيار وتكوين المحولات الصحيحة.

Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Volker Tresp2026-08-27
💬 NLP

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

تُعد CaSKG إطار عمل سببي-تخيلي يعمل على تعزيز استرجاع مهارات وكلاء النماذج اللغوية الكبيرة (LLM) القابل للتوسع من خلال بناء ومعايرة رسم بياني للمهارات موجه عبر تجميع الأدلة غير المتصل بالإنترنت واستقصاءات التخيل النصي، مما يؤدي إلى تحسين معدلات نجاح المهام وكفاءتها بشكل كبير عبر مختلف الاختبارات المعيارية مقارنة بالطرق الحالية.

Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang2026-08-27
💬 NLP

When Stale Constraints Go Unchecked: Budgeted Verification Failures in Inherited Agent Memory

تُثبت هذه الورقة أنه في ظل ميزانية ثابتة قدرها سجلان، فإن الوكلاء الذين يعتمدون على الذاكرة الموروثة غالباً ما يفشلون في اكتشاف القيود المستبدلة، ولكن إعادة تخصيص موارد التحقق استراتيجياً لمسار المصدر الحرج يقلل بشكل كبير من أخطاء الاتساق القديم عبر نماذج ومجالات متعددة.

Kazuki Nakayashiki2026-08-27
💬 NLP

Virgil: Navigating Explainability for Transformer-based Language Models

تقدم الورقة البحثية "فيرجيل" (Virgil)، وهو نظام تفاعلي مصمم لمساعدة المستخدمين على التنقل والاكتشاف والمقارنة بين المنظومة المتجزئة بشكل متزايد لأدوات التفسير الخاصة بالنماذج اللغوية القائمة على المحولات (transformer-based language models) من خلال واجهة موحدة مدعومة بقاعدة معرفية منسقة.

Martino Ciaperoni, Sezer Kutluk, Benedetta Muscato, Marta Marchiori Manerba, Fosca Giannotti2026-08-27
💬 NLP

EgoArgus: Benchmarking VLMs as Situational Assistants for Modality-Grounded User Supports

تقدم الورقة البحثية EgoArgus، وهي مجموعة بيانات مرجعية مُوسومة بشرياً صُممت لتقييم قدرة نماذج الرؤية واللغة على العمل كمساعدين موثوقين في منظور الشخص الأول من خلال التحكيم بين الأدلة البصرية وحوار المستخدم في السيناريوهات اليومية، مما يكشف عن القيود الحالية في تقييم الثقة في الأنماط وتأثير طرق الحد من الانحياز الحالية المحدودة.

Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen2026-08-27
💬 NLP

Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study

تقدم هذه الورقة دراسة مقارنة تثبت أنه في حين أن المقاييس القائمة على المشفرات (مثل BERTScore وSemDist) والمعدة بشكل صحيح تحقق ارتباطاً قوياً مع الأحكام البشرية لتقييم التعرف الآلي على الكلام (ASR)، فإن النماذج اللغوية الكبيرة التوليدية تقدم نقاط قوة تكميلية في اختيار الفرضيات الزوجية وتحسين قابلية التفسير لتحليل الأخطاء.

Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wot (…)2026-08-27
💬 NLP

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

تقدم هذه الورقة JIT-Agent، وهو نموذج قابل للتدريب يقوم تلقائياً بتخليق وتطوير أطر عمل (harnesses) خاصة بالمهام عند الطلب، مما يعزز بشكل كبير أداء مختلف النماذج التأسيسية ويجعل من ذكاء أطر العمل بُعداً قابلاً للتوسع ومتعامداً مع قدرات الوكيل.

Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun (…)2026-08-27