💬 NLP

Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

تقدم هذه الورقة تصنيفاً شاملاً لـ 4×6 (هدف × تقنية) وإطار عمل لتدقيق تغطية المعايك المرجعية، مستخلصاً من 932 دراسة أمنية، والذي يكشف أن المعايك المرجعية الحالية لهجمات النماذج اللغوية الكبيرة تغطي في مجموعها 25% كحد أقصى من سطح التهديد وتعاني من فجوات تقييم كبيرة وتجزئة في التسميات.

Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray, Alexey A. Shvets2026-05-15
💬 NLP

Self-Distilled Agentic Reinforcement Learning

تقدم الورقة البحثية إطار عمل SDAR، وهو إطار عمل مبتكر يدمج التقطير الذاتي المعتمد على السياسة (On-Policy Self-Distillation) كهدف مساعد محكوم ببوابة (gated auxiliary objective) في التعلم التعزيزي لتوفير توجيه كثيف ومستقر على مستوى الرمز (token-level) للمهام الوكيلية طويلة الأمد، متفوقاً بشكل كبير على التعلم التعزيزي القياسي والأساليب الهجينة البدائية عبر عدة معايير ونطاقات نماذج.

Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang (…)2026-05-15
💬 NLP

MeMo: Memory as a Model

تقدم الورقة البحثية MeMo، وهو إطار عمل معياري يقوم بترميز المعرفة الجديدة في نموذج ذاكرة مخصص لتمكين التكامل القائم على مبدأ "التوصيل والتشغيل" مع النماذج اللغوية الكبيرة المجمدة، مما يوفر استرجاعاً قوياً للمعلومات المعقدة عبر المستندات دون حدوث نسيان كارثي أو اعتماد على أوزان النموذج.

Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bryan Kian Hsiang Low (…)2026-05-15
💬 NLP

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

تقدم هذه الورقة إطار عمل للمحاذاة متعدد الوسائط المعزز بالاسترجاع، والذي يعيد بناء جداول زمنية سريرية دقيقة من خلال دمج السرديات غير المهيكلة الغنية دلاليًا ولكنها غامضة زمنيًا مع بيانات السجلات الصحية الإلكترونية الدقيقة هيكليًا ولكنها غير مكتملة، مما يحسن بشكل كبير من دقة الطوابع الزمنية ويستوعب الأحداث التي فاتتها السجلات الجدولية وحدها.

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss2026-05-15
💬 NLP

MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

تقدم هذه الورقة البحثية MetaBackdoor، وهو هجوم باب خلفي مبتكر على النماذج اللغوية الكبيرة يستغل الترميز الموضعي (positional encoding) كمحفز لتنشيط سلوكيات خبيثة — مثل تسريب مطالبات النظام أو استحثاث استدعاءات الأدوات — دون الحاجة إلى أي تعديل في المحتوى الدلالي للنص المدخل.

Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem2026-05-15
💬 NLP

Is Grep All You Need? How Agent Harnesses Reshape Agentic Search

تقدم هذه الورقة دراسة تجريبية تُظهر أن الاسترجاع القائم على grep غالباً ما يتفوق على الاسترجاع المتجهي في أنظمة البحث الوكيلية، مع تسليط الض الضوء على أن الأداء العام يتأثر بشكل كبير بهيكل الوكيل ونموذج استدعاء الأدوات المستخدم، حتى عندما تظل البيانات الأساسية ثابتة.

Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah2026-05-15
💬 NLP

FutureSim: Replaying World Events to Evaluate Adaptive Agents

تقدم الورقة البحثية FutureSim، وهو معيار مرجعي يعيد تشغيل أحداث من العالم الحقيقي تسلسلياً لتقييم قدرة الوكلاء الاصطناعيين على التنبؤ بالأحداث المستقبلية والتكيف عبر آفاق زمنية طويلة، مما يكشف عن فجوات كبيرة في الأداء بين النماذج الرائدة ويسلط الضوء على الحاجة إلى تحسين قدرات التكيف أثناء وقت الاختبار، والذاكرة، والاستدلال.

Shashwat Goel, Nikhil Chandak, Arvindh Arun, Ameya Prabhu, Steffen Staab, Moritz Hardt, Maksym Andriushchenko, Jonas Gei (…)2026-05-15
💬 NLP

Task Prompt Vectors: Effective Initialization through Multi-Task Soft-Prompt Transfer

تقدم هذه الورقة "ناقلات مهام التلقين" (Task Prompt Vectors)، وهي طريقة تستفيد من العمليات الحسابية على التلقينات اللينة المستمدة من الفروقات الخاصة بالمهام لتمكين التهيئة متعددة المهام والنقل الفعال في ضبط التلقين دون الحاجة إلى إعادة تدريب كاملة.

Robert Belanec, Simon Ostermann, Ivan Srba, Maria Bielikova2026-05-14
💬 NLP

BEAVER: An Enterprise Benchmark for Text-to-SQL

تقدم الورقة البحثية BEAVER، وهو أول معيار مرجعي لتحويل النص إلى لغة SQL مستمد من مستودعات بيانات الشركات الخاصة ويضم 9,128 استعلاماً من واقع العمل عبر 19 مجالاً، والذي يكشف عن فجوة أداء كبيرة للنماذج المتطورة ويقترح إطار تقييم دقيق لتشخيص التحديات المعقدة مثل المعرفة بالمجال واستخدام الدوال المتقدمة.

Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Mich (…)2026-05-14