💬 NLP

Generative Value Conflicts Reveal LLM Priorities

تقدم هذه الورقة ConflictScope، وهو مسار آلي يكشف كيف تغير النماذج اللغوية الكبيرة أولويات قيمها من القيم الحمائية إلى القيم الشخصية في سيناريوهات الصراع مفتوحة النهاية، مع إثبات أن مطالبات النظام التفصيلية يمكن أن تحسن بشكل متوسط التوافق مع ترتيب القيم المستهدف.

Andy Liu, Kshitish Ghate, Mona Diab, Daniel Fried, Atoosa Kasirzadeh, Max Kleiman-Weiner2026-02-27
💬 NLP

Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies

تقترح هذه الورقة مجدول إزالة قناع مُتعلم لنماذج الانتشار المنفصلة، والذي تمت صياغته كعملية قرار ماركوف منتظمة بتباعد كولباك - ليبلر مع سياسة مرجعية صريحة، وهو ما يتفوق نظرياً وتجريبياً على الجداول الاستدلالية الحالية من خلال توليد عينات تطابق توزيع البيانات بشكل أفضل.

Chunsan Hong, Seonho An, Min-Soo Kim, Jong Chul Ye2026-02-27
💬 NLP

PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing

تقدم الورقة البحثية PATCH، وهي طريقة مبتكرة تحدد وتعدل مباشرةً الدوائر الحسابية المحددة المسؤولة عن تسريب معلومات الهوية الشخصية (PII) في النماذج اللغوية، محققةً توازناً أفضل بكثير بين الخصوصية والمنفعة وتسريباً متبقياً يقترب من الصفر عند دمجها مع الخصوصية التفاضلية مقارنة بالدفاعات الحالية.

Anthony Hughes, Vasisht Duddu, N. Asokan, Nikolaos Aletras, Ning Ma2026-02-27
💬 NLP

Mapping Semantic & Syntactic Relationships with Geometric Rotation

تقدم هذه الورقة تقدير الإزاحة الثابتة للدوران (RISE)، وهي طريقة هندسية تنجح في رسم التحولات الدلالية والنحوية على مستوى الخطاب كعمليات دورانية متسقة عبر لغات ونماذج تضمين متنوعة، مما يوفر دعماً تجريبياً لفرضية التمثيل الخطي على مستوى الجملة.

Michael Freenor, Lauren Alvarez2026-02-27
💬 NLP

PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions

تقدم هذه الورقة البحثية PoSh، وهو مقياس يعتمد على نموذج لغوي كبير (LLM) كحكم وموجه برسم بياني للمشهد (scene graph) لتقييم الأوصاف التفصيلية للصور، وتتحقق من صحته من خلال معيار DOCENT الجديد، مما يظهر ارتباطاً فائقاً مع الأحكام البشرية ومتانة عبر أنواع الصور المتنوعة مقارنة بالمقاييس الحالية.

Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford, Julia Demarest, Adam Purvis, Keith Krut, Robert Stein, Rina El (…)2026-02-27
💬 NLP

RELOOP: Recursive Retrieval with Multi-Hop Reasoner and Planners for Heterogeneous QA

يُعد RELOOP إطار عمل للتعزيز بالاسترجاع المعتمد على البنية، حيث يوحد مصادر الأدلة غير المتجانسة (النصوص، والجداول، ورسوم المعرفة البيانية) في تسلسل هرمي، ويستخدم نظاماً متعدد الوكلاء مع تكرار موجه ومدرك للميزانية لحل الأسئلة المعقدة متعددة الخطوات بكفاءة مع تحسين الدقة والاتساق.

Ruiyi Yang, Hao Xue, Imran Razzak, Hakim Hacid, Flora D. Salim2026-02-27
💬 NLP

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

تقدم الورقة البحثية Toolathlon، وهو معيار شامل يضم 32 تطبيقاً متنوعاً و108 مهام واقعية طويلة المدى ذات تنفيذ قابل للتحقق، صُمم لتقييم وكشف القصور الكبير في الوكلاء اللغويين الحاليين ذوي الحالة الراهنة في سير عمل الخطوات المتعددة المعقدة والواقعية.

Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Ju (…)2026-02-27
💬 NLP

Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability

تقدم هذه الورقة البحثية المشفّرات التلقائية المتناثرة الزمنية (T-SAEs)، وهي طريقة مبتكرة تستفيد من الطبيعة التسلسلية للغة من خلال فقد تبايني لاكتشاف سمات دلالية أكثر سلاسة وتماسكاً وقابلية للتفسير البشري في النماذج اللغوية دون الحاجة إلى إشراف دلالي صريح.

Usha Bhalla, Alex Oesterling, Claudio Mayrink Verdun, Himabindu Lakkaraju, Flavio P. Calmon2026-02-27
💬 NLP

Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

تقدم هذه الورقة مفهوم "الذكاء لكل واط" (IPW) كمقياس مبتكر لتقييم كفاءة استنتاج الذكاء الاصطناعي المحلي، حيث تثبت من خلال دراسة تجريبية واسعة النطاق أن النماذج اللغوية الصغيرة التي تعمل على مسرعات محلية يمكنها التعامل بدقة مع غالبية الاستعلامات الواقعية مع تقديم كفاءة طاقة أفضل بكثير من البدائل القائمة على السحابة، مما يؤكد صلاحية الاستنتاج المحلي كاستراتيجية لإعادة توزيع الطلب من البنية التحتية المركزية.

Jon Saad-Falcon, Avanika Narayan, Hakki Orhun Akengin, J. Wes Griffin, Herumb Shandilya, Adrian Gamarra Lafuente, Medhya (…)2026-02-27
💬 NLP

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

لمعالجة تشبع المعايكات الحالية الناجم عن الحوسبة القائمة على القوالب، تقدم هذه الورقة البحثية ReasoningMath-Plus، وهو معيار مرعي للعمليات يتضمن 150 مسألة معقدة هيكلياً وإطار تقييم مقابل (HCRS ونموذج مكافأة العمليات) يكشف عن فجوات كبيرة بين دقة الإجابة العالية وكفاءة الاستدلال الهيكلي الحقيقية في النماذج اللغوية الكبيرة الرائدة.

Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang (…)2026-02-27