💬 NLP

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

تقدم هذه الورقة Social Gym، وهو معيار ألعاب متعدد الوكلاء قابل للتحقق لتقييم الاستدلال الاجتماعي للنماذج اللغوية الكبيرة بشكل موضوعي، وSPaRTan، وهو إطار عمل للتحسين الذاتي لا يتطلب تدريباً يستفيد من التأمل وكتيبات اللعب القابلة للنقل لتعزيز الأداء في أدوار ألعاب محددة دون الحاجة إلى تحديث أوزان النموذج.

Keyu He, Xuhui Zhou, Maarten Sap2026-08-11
💬 NLP

Beyond Direct Identifiers: Probabilistic Privacy Risk Estimation for Privacy-Conscious LLM Query Delegation

تقترح هذه الورقة نسخة احتمالية من التفويض الواعي بالخصوصية تستخدم مقياس تقدير الـ k-anonymity المدفوع بنماذج اللغات الكبيرة (LLM) ومجموعة بيانات PUPA-SD التي تم إنشاؤها حديثاً لحماية المستخدمين بشكل أفضل من مخاطر الخصوصية الناجمة عن الإفصاحات الذاتية الخالية من معلومات الهوية الشخصية (PII)، مما يثبت أن هذا النهج يحقق توازناً أمثلاً بين الخصوصية والمنفعة لنماذج مثل Llama-3.2-3B.

Li Siyan, Zhou Yu, Julia Hirschberg2026-08-11
💬 NLP

UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following

تقدم الورقة البحثية UNSPECIFIC، وهو إطار عمل ومعيار جديد مصمم للقضاء على اختصارات النسخ واللصق في اتباع التعليمات من قبل النماذج اللغوية الكبيرة، وذلك عبر توليد قيود مشتركة لمقالات مرجعية متشابهة وتقييم الاستجابات على كل من النصوص الكاملة والملخصات لضمان الالتزام الحقيقي بدلاً من النسخ السطحي.

Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang2026-08-11
💬 NLP

Failure-Aware Long-Form Translation: Design and Implementation of a Recoverable LLM Translation System

تقدم هذه الورقة تصميم وتنفيذ نظام ترجمة للنصوص الطويلة قابل للاسترداد، يعمل على التخفيف من حدة إخفاقات مستوى واجهة برمجة التطبيقات (API) عن طريق تأخير إصدار المخرجات، والتحقق من صحة النتائج المجمعة، وتوظيف بروتوكول إعادة محاولة مهيكل مع تتبع المصدر لضمان تسليم نص قابل للاستخدام رغم الانقطاعات أو عمليات التصفية.

Yanlin Yu2026-08-11
💬 NLP

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

تقدم هذه الورقة البحثية EmoS، وهو إطار عمل قائم على النظرية يتكون من معيار التقييم EmoSBench، ومجموعة بيانات EmoDialogue، ونموذج متخصص تم تدريبه باستخدام تقنيات تحسين متقدمة لتقليص الفجوة بشكل كبير بين نماذج اللغة المنطوقة الحالية والذكاء العاطفي على المستوى البشري.

Junyu Wang, Siyuan Zhang, Peiyuan Jiang, Jian Zong, Jingyu Zhang, Tianrui Wang, Yuqin Lin, Zhenghui Chen, Shuqing Xie, Z (…)2026-08-11
💬 NLP

UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers

تقدم الورقة البحثية UNMASK، وهو مسار عمل مؤتمت بالكامل يكتشف الارتباطات الزائفة في مصنفات النصوص ويتحقق منها سببياً ويخفف من حدتها دون الحاجة إلى تسميات توضيحية بشرية إضافية، مما يؤدي إلى تحسين المتانة في معايير القياس خارج نطاق التوزيع ويمكّن إعادة وزن المجموعات بدون تسميات توضيحية.

Chidaksh Ravuru, Shashank Srivastava2026-08-11
💬 NLP

Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline

تقدم هذه الورقة البحثية WarehouseReliabilityBench وتثبت أن وكيل تحليل يعتمد على القواعد (QueryProof) بحجم 7 مليارات معلمة يتفوق بشكل كبير على نموذج أساسي بحجم 32 مليار معلمة يتم توجيهه مباشرة، وذلك في تحقيق "الحقيقة التجارية" عبر إعطاء الأولوية لعمليات التحقق الحتمية بعد التنفيذ والاستيضاح على دقة بناء جمل SQL الخام، كل ذلك مع تقليل التكاليف.

Morris Lee2026-08-11
💬 NLP

Is the ACL Responsible NLP Checklist a Box-Ticking Exercise? A Large-Scale Analysis of EMNLP 2025

تقدم هذه الورقة تحليلاً واسع النطاق لقوائم مراجعة معالجة اللغات الطبيعية المسؤولة الخاصة بـ EMNLP 2025، كاشفةً أن التنفيذ الحالي غالباً ما ينحدر إلى مجرد عملية سطحية لاستيفاء المتطلبات تتسم بضعف المبررات، والتناقضات المنطقية، وتهميش الأخلاقيات باعتبارها فكرة ثانوية.

Nusrath Jinnath, Wei Zhao2026-08-11
💬 NLP

ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons

تقدم هذه الورقة ComboShoppingBench، وهو معيار مرجعي مبتكر مصمم لتقييم وكلاء النماذج اللغوية الكبيرة (LLMs) في مهام تسوق السلال المعقدة والمقيدة بالميزانية، وذلك من خلال الجمع بين التقييم الدلالي والتحقق الحتمي لمعالجة تحديات التحقق من مجموعات المنتجات الممكنة، والمُحسّنة باستخدام الكوبونات، والمتوافقة.

Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu2026-08-11
💬 NLP

Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law

تقدم هذه الورقة البحثية FiscalQA Pro، وهو معيار مرجعي يوضح أن أنظمة استرجاع المعلومات المعززة بالتوليد (RAG) القانونية القياسية تفشل في التعامل مع الخطأ الزمني في تحديد المراجع في قانون الضرائب الفرنسي من خلال استرجاع النسخ الحالية فقط من المواد، وتُظهر أن نظام استرجاع مدرك للإصدارات يمكنه تحقيق دقة بنسبة 98.3% مقارنة بالأداء الذي يقترب من الصفر للنهج الثابت.

Rose Cymbler, Daniel Guez, Laurent Fabre2026-08-11