cs.CL
11158 ورقة بحثية
Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks
تقدم هذه الورقة تصنيفاً شاملاً لـ 4×6 (هدف × تقنية) وإطار عمل لتدقيق تغطية المعايك المرجعية، مستخلصاً من 932 دراسة أمنية، والذي يكشف أن المعايك المرجعية الحالية لهجمات النماذج اللغوية الكبيرة تغطي في مجموعها 25% كحد أقصى من سطح التهديد وتعاني من فجوات تقييم كبيرة وتجزئة في التسميات.
Self-Distilled Agentic Reinforcement Learning
تقدم الورقة البحثية إطار عمل SDAR، وهو إطار عمل مبتكر يدمج التقطير الذاتي المعتمد على السياسة (On-Policy Self-Distillation) كهدف مساعد محكوم ببوابة (gated auxiliary objective) في التعلم التعزيزي لتوفير توجيه كثيف ومستقر على مستوى الرمز (token-level) للمهام الوكيلية طويلة الأمد، متفوقاً بشكل كبير على التعلم التعزيزي القياسي والأساليب الهجينة البدائية عبر عدة معايير ونطاقات نماذج.
MeMo: Memory as a Model
تقدم الورقة البحثية MeMo، وهو إطار عمل معياري يقوم بترميز المعرفة الجديدة في نموذج ذاكرة مخصص لتمكين التكامل القائم على مبدأ "التوصيل والتشغيل" مع النماذج اللغوية الكبيرة المجمدة، مما يوفر استرجاعاً قوياً للمعلومات المعقدة عبر المستندات دون حدوث نسيان كارثي أو اعتماد على أوزان النموذج.
Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment
تقدم هذه الورقة إطار عمل للمحاذاة متعدد الوسائط المعزز بالاسترجاع، والذي يعيد بناء جداول زمنية سريرية دقيقة من خلال دمج السرديات غير المهيكلة الغنية دلاليًا ولكنها غامضة زمنيًا مع بيانات السجلات الصحية الإلكترونية الدقيقة هيكليًا ولكنها غير مكتملة، مما يحسن بشكل كبير من دقة الطوابع الزمنية ويستوعب الأحداث التي فاتتها السجلات الجدولية وحدها.
MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
تقدم هذه الورقة البحثية MetaBackdoor، وهو هجوم باب خلفي مبتكر على النماذج اللغوية الكبيرة يستغل الترميز الموضعي (positional encoding) كمحفز لتنشيط سلوكيات خبيثة — مثل تسريب مطالبات النظام أو استحثاث استدعاءات الأدوات — دون الحاجة إلى أي تعديل في المحتوى الدلالي للنص المدخل.
Is Grep All You Need? How Agent Harnesses Reshape Agentic Search
تقدم هذه الورقة دراسة تجريبية تُظهر أن الاسترجاع القائم على grep غالباً ما يتفوق على الاسترجاع المتجهي في أنظمة البحث الوكيلية، مع تسليط الض الضوء على أن الأداء العام يتأثر بشكل كبير بهيكل الوكيل ونموذج استدعاء الأدوات المستخدم، حتى عندما تظل البيانات الأساسية ثابتة.
FutureSim: Replaying World Events to Evaluate Adaptive Agents
تقدم الورقة البحثية FutureSim، وهو معيار مرجعي يعيد تشغيل أحداث من العالم الحقيقي تسلسلياً لتقييم قدرة الوكلاء الاصطناعيين على التنبؤ بالأحداث المستقبلية والتكيف عبر آفاق زمنية طويلة، مما يكشف عن فجوات كبيرة في الأداء بين النماذج الرائدة ويسلط الضوء على الحاجة إلى تحسين قدرات التكيف أثناء وقت الاختبار، والذاكرة، والاستدلال.
Task Prompt Vectors: Effective Initialization through Multi-Task Soft-Prompt Transfer
تقدم هذه الورقة "ناقلات مهام التلقين" (Task Prompt Vectors)، وهي طريقة تستفيد من العمليات الحسابية على التلقينات اللينة المستمدة من الفروقات الخاصة بالمهام لتمكين التهيئة متعددة المهام والنقل الفعال في ضبط التلقين دون الحاجة إلى إعادة تدريب كاملة.
BEAVER: An Enterprise Benchmark for Text-to-SQL
تقدم الورقة البحثية BEAVER، وهو أول معيار مرجعي لتحويل النص إلى لغة SQL مستمد من مستودعات بيانات الشركات الخاصة ويضم 9,128 استعلاماً من واقع العمل عبر 19 مجالاً، والذي يكشف عن فجوة أداء كبيرة للنماذج المتطورة ويقترح إطار تقييم دقيق لتشخيص التحديات المعقدة مثل المعرفة بالمجال واستخدام الدوال المتقدمة.