💬 NLP

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

يُعد MemSearcher إطار عمل لوكيل يعتمد على النماذج اللغوية الكبيرة، يستخدم آلية ذاكرة مدمجة وخوارزمية تدريب GRPO متعددة السياقات ومبتكرة لتحقيق تعلم تعزيزي فعال وشامل من البداية إلى النهاية لمهام البحث متعددة الجولات، متفوقاً بذلك على النماذج المرجعية التقليدية القائمة على دمج السجل التاريخي مع الحفاظ على استقرار أطوال السياق.

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han2026-05-11
💬 NLP

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

تجادل هذه الورقة بأن استدلال "سلسلة الأفكور" (Chain-of-Thought) يمكن أن يكون أميناً حتى بدون التعبير اللفظي الصريح عن التلميحات المحقونة في المطالبة، مما يتحدى مقياس "الميزات المنحازة" (Biasing Features) لخلطه بين عدم الاكتمال وعدم الأمانة، ويدعو إلى مجموعة أدوات تفسيرية أوسع تتضمن تحليل الوساطة السببية.

Kerem Zaman, Shashank Srivastava2026-05-11
💬 NLP

Neural Neural Scaling Laws

تقدم هذه الورقة "قوانين القياس العصبية العصبية" (NeuNeu)، وهو نهج قائم على الشبكات العصبية يتفوق على النماذج البارامترية التقليدية من خلال صياغة التنبؤ بأداء المهام اللاحقة كمسألة استكمال خارجي للسلاسل الزمنية، محققاً معدلات خطأ أقل بكثير وقدرة على التعميم في حالة الصفر (zero-shot generalization) عبر مختلف عائلات النماذج والمهام.

Michael Y. Hu, Jane Pan, Ayush Rajesh Jhaveri, Nicholas Lourie, Kyunghyun Cho2026-05-11
💬 NLP

Can David Beat Goliath? On Multi-Hop Reasoning with Resource-Constrained Agents

تقدم الورقة البحثية إطار عمل David-GRPO، وهو إطار للتعلم التعزيزي يعزز الاستدلال متعدد الخطوات لدى الوكلاء ذوي الموارد المحدودة من خلال الجمع بين التمهيد الخبير خارج السياسة (off-policy expert bootstrapping) والاستكشاف داخل السياسة الموجه بالأدلة (evidence-guided on-policy exploration) للتغلب على ندرة مسارات التدريب المفيدة وتحقيق أداء فائق في معايير اختبار الأسئلة والأجوبة متعددة الخطوات.

Hojae Han, Heeyun Jung, Jongyoon Kim, Seung-won Hwang2026-05-11
💬 NLP

WorldCup Sampling for Multi-bit LLM Watermarking

تقدم هذه الورقة WorldCup، وهو إطار عمل للعلامات المائية متعددة البتات لنماذج اللغات الكبيرة يستخدم آلية منافسة هرمية وتعديلاً واعياً بالإنتروبيا لتحقيق توازن متفوق بين سعة الرسالة، والمتانة، وجودة النص مقارنة بالطرق الحالية.

Yidan Wang, Yubing Ren, Yanan Cao, Li Guo2026-05-11
💬 NLP

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

تتناول هذه الورقة مشكلة انهيار الإنتروبيا في التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) عبر اقتراح آلية قص ديناميكية مبتكرة تستفيد من منظور الحفاظ على التدرج للتحكم بدقة في إنتروبيا السياسة من خلال استراتيجيات مثبتة تجريبياً، مما يمنع الثقة المفرطة المبكرة ويعزز أداء الاستدلال في النماذج اللغوية الكبيرة (LLM).

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao2026-05-11
💬 NLP

Retrieval Heads are Dynamic

تتحدى هذه الورقة الرؤية الساكنة لرؤوس الاسترجاع في النماذج اللغوية الكبيرة من خلال إثبات أنها ديناميكية، وتعتمد على الخطوات الزمنية، ويمكن التنبؤ بها عبر الحالات الخفية، مما يكشف عن آلية تخطيط داخلية تعجز النماذج الساكنة عن استيعابها.

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang2026-05-11
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

تقدم هذه الورقة ScrapeGraphAI-100k، وهي مجموعة بيانات ضخمة من الواقع تتكون من 93,695 حدث استخراج مقيد بالمخطط (schema-constrained) مستمدة من القياس عن بُعد للممارسين، مما يتيح تدريب واختبار النماذج اللغوية الكبيرة على مهام التوليد المهيكل حيث كانت المجموعات السابقة الاصطناعية أو المقتصرة على النصوص غير كافية.

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan2026-05-11
💬 NLP

Utility-Preserving De-Identification for Math Tutoring: Investigating Numeric Ambiguity in the MathEd-PII Benchmark Dataset

تقدم هذه الورقة المعيار المرجعي MathEd-PII وتثبت أن استراتيجيات التلقين المدركة للمجال تتفوق بشكل كبير على الكشف العام عن معلومات الهوية الشخصية (PII) في حوارات التدريس الرياضي من خلال حل الغموض الرقمي للحفاظ على الفائدة التعليمية مع ضمان الخصوصية.

Zhuqian Zhou, Kirk Vanacore, Bakhtawar Ahtisham, Jinsook Lee, Doug Pietrzak, Daryl Hedley, Jorge Dias, Chris Shaw, Ruth (…)2026-05-11
💬 NLP

Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas

تحلل هذه الدراسة 1,500 عنصر من اختبار MMLU عبر 33 نموذجاً لغوياً كبيراً من النماذج الرائدة لتكشف أن درجات المراقبة الميتا معرفية الإجمالية تحجب تباينات كبيرة ومستقرة على مستوى المجالات، حيث يسهل مراقبة المعرفة التطبيقية بشكل موثوق مقارنة بالاستدلال الرسمي أو العلوم الطبيعية، مما يدعم استخدام الفحص النوعي الخاص بكل مجال قبل نشر النموذج.

Jon-Paul Cacioli2026-05-11