💬 NLP

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

تقدم هذه الورقة Social Gym، وهو معيار ألعاب متعدد الوكلاء قابل للتحقق لتقييم الاستدلال الاجتماعي للنماذج اللغوية الكبيرة بشكل موضوعي، وSPaRTan، وهو إطار عمل للتحسين الذاتي لا يتطلب تدريباً يستفيد من التأمل وكتيبات اللعب القابلة للنقل لتعزيز الأداء في أدوار ألعاب محددة دون الحاجة إلى تحديث أوزان النموذج.

Keyu He, Xuhui Zhou, Maarten Sap2026-08-11
🤖 AI

TRACE: TRajectory Attribution for Automated Context Engineering

إنَّ TRACE هو إطار عمل مؤتمت يستخرج مسارات الوكلاء التاريخية لتحديد إشارات عدم الرضا الضمنية، مما يتيح العزو الدقيق والمعالجة لإخفاقات طبقة السياق عبر المطالبات والأدوات وقواعد المعرفة دون الحاجة إلى إعادة تدريب النموذج أو الحصول على تعليقات صريحة من المستخدم.

Yikai Zhao, Pradeep Kumar Misra, Saurabh Pandey2026-08-11
🤖 AI

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

تقدم هذه الورقة طريقة غير مسموعة لاختبار الاختراق تسمى "الإغلاق المتقطع منخفض التردد" (ILL) تستغل الإشارات منخفضة التردد لتقليل أداء النماذج اللغوية الصوتية الكبيرة (LALMs) بشكل كبير، مع اقتراح آلية "حارس إعادة الاستعلام التوزيعي" (DRG) للكشف عن مثل هذه الهجمات واستعادة الدقة الدلالية.

Yuanhe Zhang, Weiliu Wang, Jie Ren, Liang Lin, Zhenhong Zhou, Haoran Gao, Kun Wang, Chen Li, Li Sun, Sen Su2026-08-11
🤖 AI

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

تقدم هذه الورقة البحثية CIDER، وهي مجموعة بيانات واسعة النطاق لحدود الإفصاح السياقية المستمدة من التقييمات البشرية، لتقييم وتحسين توافق النماذج اللغوية الكبيرة مع تفضيلات الخصوصية الفردية الدقيقة من خلال التخصيص أثناء وقت الاستدلال.

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li2026-08-11
🤖 AI

From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents

تقدم هذه الورقة البحثية RADEG، وهي آلية بوابات خفيفة الوزن ومدركة للمكافأة تتنبأ بجدوى تنفيذ حزم المهارات المسترجعة لوكلاء النماذج اللغوية الكبيرة (LLM) لتقليل التكاليف الحسابية غير الضرورية بشكل كبير مع الحفاظ على أداء المهام اللاحقة.

Liang He, Jingbo Wen, Hongyu Gu, Hao Li, Haoyu Wang, Yixiong Chen, Kangning Cui, Xilu Wang2026-08-11
🤖 AI

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

تقدم هذه الورقة طريقة لضغط الرموز البصرية الحساسة للتبعات لنماذج الرؤية واللغة، والتي تخصص الموارد الحسابية ديناميكيًا بناءً على التكلفة المحتملة للأخطاء، مما يقلل بشكل كبير من الأخطاء عالية المخاطر ومعدلات الخطأ الإجمالية المرجحة بالتكلفة مقارنة باستراتيجيات التخصيص المعتمدة على المحتوى أو التخصيص الموحد التقليدية.

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang2026-08-11
🤖 AI

Signature-Guided Capacity Occupancy for Dense Expert Merging

يُعد SigMerge إطار عمل مهيكلاً لدمج الخبراء الكثيف يعالج التضاربات بين الخبراء ويخصص سعة الطبقات بناءً على طلب النطاق باستخدام تواقيع التضارب وقواعد الإشغال المتسلسلة، متفوقاً بشكل كبير على الأساليب الحالية عبر مجموعات نماذج وإعدادات متنوعة.

Lingching Tung, Chi-Jui Kim, Beicheng Xu, Yuchen Wang, Bin Cui2026-08-11
🤖 AI

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

تقترح الورقة البحثية إطار عمل CRUISE، وهو إطار عمل مبتكر يعزز القيادة الذاتية القوية من خلال دمج نموذج رؤية ولغة لتوليد تقديرات عدم يقين دقيقة على مستوى البكسل، وتوظيف آلية تكيف ديناميكية لدمج المستشعرات عبر الوسائط بشكل فعال في الظروف الصعبة.

Junyao Wang, Yulin Xu, Yu Li, Pramod Khargonekar, Mohammad Abdullah Al Faruque2026-08-11
🤖 AI

Governing the KV Cache: Preventing Timing Side-Channel Leakage in Multi-Tenant LLM Inference

تقدم هذه الورقة KVGov، وهي طبقة حوكمة تمنع هجمات القنوات الجانبية الزمنية في استدلال النماذج اللغوية الكبيرة متعددة المستأجرين عبر عزل مفاتيح ذاكرة التخزين المؤقت (KV cache) تشفيرياً بين المستأجرين من خلال تمليح لكل طرف وجدول زمني للتدقيق، مما يقضي على تسرب البيانات بين المستأجرين مع الحفاظ على 93% من كفاءة التخزين المؤقت للبادئات.

Tejasvi C. Addagada2026-08-11
🤖 AI

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

تقدم هذه الورقة SafeSceneReason، وهو معيار متعدد الوسائط ومتن تدريبي يربط بين مشاهد السلامة الصناعية ومعرفة التحقيق في الحوادث لتقييم وتعزيز قدرات النماذج اللغوية الرؤية في الاستدلال القائم على الأدلة لتقييم المخاطر والوقاية من الحوادث.

Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wa (…)2026-08-11