💬 NLP

Security and Privacy Taxonomy Generation from Mobile App Reviews

تقدم هذه الورقة TaxoScale، وهو مسار معالجة قابل للتوسع يقوم بتصفية أكثر من 600,000 مراجعة لتطبيقات الهاتف المحمول ويستخدم التجميع الهرمي المتكرر المدمج مع التسمية القائمة على النماذج اللغوية الكبيرة لإنشاء تصنيف شامل وجديد للأمن والخصوصية تلقائيًا، متجاوزًا بذلك قيود الطرق الحالية التي تواجه صعوبة في التعامل مع مجموعات البيانات الضخمة.

Moghis Fereidouni, Vinaik Chhetri, Umar Farooq, A. B. Siddique2026-08-11
💬 NLP

The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora

تجادل هذه الورقة بأن وجود الإعلانات الهيكلية، وليس تدوينها المحدد، هو المتغير الحاسم الذي يؤثر على سلوك النموذج في مجموعات بيانات ما قبل التدريب، وتقترح تنسيقاً جديداً للبيانات يفصل هذه الإعلانات إلى "مقصورات جانبية" (sidecars) قابلة للعكس مع إعطاء الأولوية لخيارات التنسيق المدفوعة بالقدرة على حساب الحفاظ على الدقة.

E. M. Freeburg2026-08-11
💬 NLP

Evo-Bench: Can Language Models Improve Agent Harness?

تقدم هذه الورقة "إيفو-بنش" (Evo-Bench)، وهو أول معيار مصمم لعزل وتقييم القدرة الجوهرية للنماذج اللغوية على تطوير أطر تشغيلها ذاتياً، مما يكشف عن مكاسب كبيرة في الأداء وهياكل استدلال قابلة للنقل، مع تسليط الضوء على التحديات الخاصة بمجالات معينة في المهام التي تتطلب سير عمل دقيق للغاية.

Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le, Yang Song, Wayne Xin Zhao, Tao Zhang2026-08-11
💬 NLP

LexKairos: Benchmarking Legal Temporal Capabilities in LLMs

تقدم هذه الورقة LexKairos، وهو معيار شامل مصمم لتقييم القدرات الزمنية للنماذج اللغوية الكبيرة في السياق القانوني الصيني عبر المعرفة التشريعية، ونمذجة القضايا، والاستنتاج، مما يكشف أن حتى النماذج الأعلى أداءً لا تزال تعاني في المهام القانونية الدقيقة والحساسة للوقت.

Chenyang Li, Zejia Feng, Yuqin Huang, Yuxiao Ye, Huiyuan Xie2026-08-11
💬 NLP

Subjective Multi-Bias Detection with Large Language Models

تقدم هذه الورقة مشروعاً يستخدم النماذج اللغوية الكبيرة للكشف عن ثلاثة أنواع من الانحيازات الذاتية -التأطير، والإبستمولوجي، والديموغرافي- وتصنيفها في النصوص، وذلك بالاستفادة من مجموعة بيانات WIKIBIAS التي تضم أكثر من 4,000 زوج من تعديلات ويكيبيديا لتحديد المواقف والتشويهات غير اللائقة.

Ruiyu Li, Zhiying Zhu2026-08-11
💬 NLP

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

تقدم هذه الورقة Social Gym، وهو معيار ألعاب متعدد الوكلاء قابل للتحقق لتقييم الاستدلال الاجتماعي للنماذج اللغوية الكبيرة بشكل موضوعي، وSPaRTan، وهو إطار عمل للتحسين الذاتي لا يتطلب تدريباً يستفيد من التأمل وكتيبات اللعب القابلة للنقل لتعزيز الأداء في أدوار ألعاب محددة دون الحاجة إلى تحديث أوزان النموذج.

Keyu He, Xuhui Zhou, Maarten Sap2026-08-11
💬 NLP

Beyond Direct Identifiers: Probabilistic Privacy Risk Estimation for Privacy-Conscious LLM Query Delegation

تقترح هذه الورقة نسخة احتمالية من التفويض الواعي بالخصوصية تستخدم مقياس تقدير الـ k-anonymity المدفوع بنماذج اللغات الكبيرة (LLM) ومجموعة بيانات PUPA-SD التي تم إنشاؤها حديثاً لحماية المستخدمين بشكل أفضل من مخاطر الخصوصية الناجمة عن الإفصاحات الذاتية الخالية من معلومات الهوية الشخصية (PII)، مما يثبت أن هذا النهج يحقق توازناً أمثلاً بين الخصوصية والمنفعة لنماذج مثل Llama-3.2-3B.

Li Siyan, Zhou Yu, Julia Hirschberg2026-08-11
💬 NLP

UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following

تقدم الورقة البحثية UNSPECIFIC، وهو إطار عمل ومعيار جديد مصمم للقضاء على اختصارات النسخ واللصق في اتباع التعليمات من قبل النماذج اللغوية الكبيرة، وذلك عبر توليد قيود مشتركة لمقالات مرجعية متشابهة وتقييم الاستجابات على كل من النصوص الكاملة والملخصات لضمان الالتزام الحقيقي بدلاً من النسخ السطحي.

Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang2026-08-11
💬 NLP

Failure-Aware Long-Form Translation: Design and Implementation of a Recoverable LLM Translation System

تقدم هذه الورقة تصميم وتنفيذ نظام ترجمة للنصوص الطويلة قابل للاسترداد، يعمل على التخفيف من حدة إخفاقات مستوى واجهة برمجة التطبيقات (API) عن طريق تأخير إصدار المخرجات، والتحقق من صحة النتائج المجمعة، وتوظيف بروتوكول إعادة محاولة مهيكل مع تتبع المصدر لضمان تسليم نص قابل للاستخدام رغم الانقطاعات أو عمليات التصفية.

Yanlin Yu2026-08-11
💬 NLP

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

تقدم هذه الورقة البحثية EmoS، وهو إطار عمل قائم على النظرية يتكون من معيار التقييم EmoSBench، ومجموعة بيانات EmoDialogue، ونموذج متخصص تم تدريبه باستخدام تقنيات تحسين متقدمة لتقليص الفجوة بشكل كبير بين نماذج اللغة المنطوقة الحالية والذكاء العاطفي على المستوى البشري.

Junyu Wang, Siyuan Zhang, Peiyuan Jiang, Jian Zong, Jingyu Zhang, Tianrui Wang, Yuqin Lin, Zhenghui Chen, Shuqing Xie, Z (…)2026-08-11