💬 NLP

Watermarking LLM Agent Trajectories

تقدم هذه الورقة البحثية ActHook، وهي أول طريقة للعلامات المائية مصممة لحماية مجموعات بيانات مسارات وكلاء النماذج اللغوية الكبيرة (LLM agent trajectory datasets) عبر تضمين إجراءات خطافية (hook actions) يتم تفعيلها سرياً، مما يتيح كشف ملكية الصندوق الأسود بشكل موثوق دون المساس بأداء المهام.

Wenlong Meng, Chen Gong, Terry Yue Zhuo, Fan Zhang, Kecen Li, Zheng Liu, Zhou Yang, Chengkun Wei, Wenzhi Chen2026-02-24
💬 NLP

ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models

تقدم هذه الورقة البحثية ArabicNumBench، وهو معيار شامل لتقييم 71 نموذجاً من النماذج اللغوية الكبيرة في مهام قراءة الأرقام العربية عبر سياقات واستراتيجيات تحفيز متنوعة، كاشفةً أنه في حين أن تقنية "سلسلة الأفكار" (Chain-of-Thought) في وضع التعلم من أمثلة قليلة تعزز الدقة بشكل كبير، فإن الأداء الرقمي العالي غالباً ما يفشل في الارتباط بالتوليد المتسق للمخرجات المهيكلة.

Anas Alhumud, Abdulaziz Alhammadi, Muhammad Badruddin Khan2026-02-24
💬 NLP

MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs

تقترح الورقة البحثية MANATEE، وهي آلية دفاع في وقت الاستدلال تستفيد من تقدير الكثافة القائم على الانتشار لإسقاط الحالات الخفية الشاذة إلى مناطق آمنة، مما يخفف بفعالية من هجمات كسر الحماية دون الحاجة إلى بيانات تدريب ضارة أو تعديلات هيكلية مع الحفاظ على فائدة النموذج.

Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav, Ava Cai, Kevin Zhu, Ruizhe Li, Maheep Chaudhary2026-02-24
💬 NLP

Think2^{2}: Grounded Metacognitive Reasoning in Large Language Models

تقدم هذه الورقة إطاراً معرفياً فوق-معرفي ذا أسس نفسية يعمل على تشغيل دورة "آن براون" التنظيمية ضمن "متحكم فوقي" (MetaController) ثنائي العملية وخفيف الوزن، مما يعزز بشكل كبير قدرة النماذج اللغوية الكبيرة على تشخيص الأخطاء وتصحيحها ذاتياً عبر مختلف معايير الاستدلال، مع اكتساب تفضيل بشري قوي من حيث الموثوقية.

Abraham Paul Elenjical, Vivek Hruday Kavuri, Vasudeva Varma2026-02-24
💬 NLP

DeepInnovator: Triggering the Innovative Capabilities of LLMs

تقدم الورقة البحثية DeepInnovator، وهو إطار تدريب يعزز القدرات الابتكارية للنماذج اللغوية الكبيرة من خلال الاستفادة من مسار مؤتمت لاستخراج المعرفة العلمية المهيكلة ونموذج "التنبؤ بالفكرة التالية" لنمذجة توليد الأفكار البحثية كعملية تكرارية من التخمين والتفنيد، مما ينتج عنه نموذج يتفوق بشكل كبير على النماذج المرجعية وينافس النماذج اللغوية الكبيرة الرائدة في توليد أفكار بحثية مبتكرة.

Tianyu Fan, Fengji Zhang, Yuxiang Zheng, Bei Chen, Xinyao Niu, Chengen Huang, Junyang Lin, Chao Huang2026-02-24
💬 NLP

Yor-Sarc: A gold-standard dataset for sarcasm detection in a low-resource African language

تقدم هذه الورقة Yor-Sarc، وهي أول مجموعة بيانات بمعايير ذهبية للكشف عن السخرية في لغة يوربا الأفريقية ذات الموارد المحدودة، والتي تضم 436 حالة مشروحة ثقافياً مع اتفاق عالٍ بين المقيّمين لتعزيز التفسير الدلالي وأبحاث معالجة اللغات الطبيعية في المنطقة.

Toheeb Aduramomi Jimoh, Tabea De Wille, Nikola S. Nikolov2026-02-24
💬 NLP

Whisper: Courtside Edition Enhancing ASR Performance Through LLM-Driven Context Generation

تقدم الورقة البحثية "Whisper: Courtside Edition"، وهو مسار عمل جديد لنماذج اللغات الكبيرة متعددة الوكلاء (multi-agent LLM pipeline) يحسن بشكل كبير أداء التعرف التلقائي على الكلام (ASR) الخاص بمجال محدد في التعليق الرياضي لمباريات الدوري الأمريكي لكرة السلة (NBA) من خلال توليد مطالبات مدركة للسياق لتوجيه وحدة فك التشفير، محققاً انخفاضاً نسبياً بنسبة 17.0% في معدل خطأ الكلمات دون الحاجة إلى إعادة تدريب النموذج.

Yonathan Ron, Shiri Gilboa, Tammuz Dubnov2026-02-24
💬 NLP

Benchmark Test-Time Scaling of General LLM Agents

تقدم هذه الورقة "General AgentBench"، وهو معيار موحد لتقييم وكلاء النماذج اللغوية الكبيرة (LLM) للأغراض العامة عبر مجالات متنوعة، كاشفةً أن الوكلاء الحاليين يعانون من تدهور كبير في الأداء في الإعدادات العامة، وأن لا التوسع في وقت الاختبار المتسلسل ولا المتوازي يحسن النتائج بفعالية بسبب سقوف السياق وفجوات التحقق.

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong2026-02-24
💬 NLP

Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks

تُثبت هذه الورقة أن إخفاقات الوكيل اللغوي في المهام طويلة المدى ناتجة أساساً عن الانحراف العشوائي عن مسار الحل النموذجي للمهمة بدلاً من كونها ناتجة عن قيود في القدرات، مما يكشف أن مراقبة المسارات التي تنحرف عن هذا المسار وإعادة تشغيلها يحسن الموثوقية بشكل كبير دون الحاجة إلى توسيع نطاق النموذج.

Wilson Y. Lee2026-02-24
💬 NLP

Learning to Detect Language Model Training Data via Active Reconstruction

تقدم هذه الورقة هجوم إعادة بناء البيانات النشط (ADRA)، وهو عائلة جديدة من هجمات استنتاج العضوية التي تستفيد من التعلم المعزز في السياسة المتبعة لضبط النموذج المستهدف بدقة من أجل إعادة بناء النصوص، مما يحقق دقة كشف أعلى بكثير لبيانات تدريب النماذج اللغوية الكبيرة مقارنة بالطرق السلبية الحالية.

Junjie Oscar Yin, John X. Morris, Vitaly Shmatikov, Sewon Min, Hannaneh Hajishirzi2026-02-24