💬 NLP

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

تقدم الورقة البحثية LANG، وهو إطار عمل جديد للتعلم التعزيزي يستخدم تلميحات مشروطة باللغة مع اضمحلال تدريجي وتبديل تكيفي لتعزيز أداء الاستدلال متعدد اللغات بشكل كبير مع منع الانجراف اللغوي غير المقصود نحو اللغة الإنجليزية.

Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai (…)2026-05-22
💬 NLP

Beyond Temperature: Hyperfitting as a Late-Stage Geometric Expansion

تكشف هذه الورقة أن ظاهرة "الفرط في الملاءمة" (Hyperfitting) في النماذج اللغوية الكبيرة لا تنتج مجرد نتيجة لحدة انخفاض الإنتروبيا، بل تنبع من توسع هندسي ديناميكي معتمد على السياق في كتلة المحولات الأخيرة التي تعزز الرموز ذات الذيل العميق، وهي آلية يمكن محاكاتها بكفاءة باستخدام استراتيجية "LoRA في المرحلة المتأخرة" المستهدفة التي تقوم بتحديث آخر خمس طبقات فقط.

Meimingwei Li, Yuanhao Ding, Esteban Garces Arias, Christian Heumann2026-05-22
💬 NLP

A Tutorial on Diffusion Theory: From Differential Equations to Diffusion Models

يوفر هذا البرنامج التعليمي إطارًا موحدًا لنماذج الانتشار من خلال اشتقاق ديناميكياتها الأمامية والعكسية من المعادلات التفاضلية، وتوضيح التكافؤ بين أهداف التدريب القياسية ومطابقة الدرجة (score matching)، وتوضيح الروابط النظرية بين طرق أخذ العينات المختلفة مثل DDPM وDDIM والتوليد الموجه.

Jiayi Fu, Yuxia Wang2026-05-22
💬 NLP

Chinese sensorimotor and embodiment norms for 3,000 lexicalized concepts

تقدم هذه الورقة قاعدة بيانات شاملة لمعايير حسية حركية وتجسيدية ذات 11 بُعداً لـ 3,000 مفهوم من اللغة الصينية المندرينية، مما يثبت موثوقيتها العالية، وقدرتها التنبؤية في مهام اتخاذ القرار المعجمي، وإمكانية استردادها جزئياً من التمثيلات اللغوية البحتة.

Jing Chen, Gábor Parti, Yin Zhong, Chu-Ren Huang, Marco Marelli2026-05-22
💬 NLP

Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

تقترح هذه الورقة إطار عمل للتدريب باستخدام التعلم المعزز من التغذية الراجعة البشرية غير المتوافقة (RLIF) متعدد المكافآت وخالٍ من الانهيار، يجمع بين التصويت العنقودي على مستوى الإجابة ومكافآت اليقين الذاتي على مستوى الرمز (token) مع تطبيع GDPO وتنظيم KL-Cov لتمكين الاستدلال طويل الأمد المستقر وغير الخاضع للإشراف في النماذج اللغوية الكبيرة (LLMs) دون الاعتماد على إشراف خارجي قائم على الحقيقة الأرضية.

Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali2026-05-22
💬 NLP

More Context, Larger Models, or Moral Knowledge? A Systematic Study of Schwartz Value Detection in Political Texts

تُظهر هذه الدراسة المنهجية أنه في حين أن استرجاع المعرفة الأخلاقية يحسن باستمرار الكشف عن قيم "شوارتز" في النصوص السياسية، فإن مجرد زيادة طول السياق أو حجم النموذج لا يضمن أداءً أفضل، حيث يتفوق الدمج المبكر للمعرفة المسترجعة على متغيرات "RAG" الأخرى والنماذج الأكبر حجماً.

Víctor Yeste, Paolo Rosso2026-05-22
💬 NLP

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

تقدم هذه الورقة البحثية "غليان الضفدع" (Boiling the Frog)، وهو معيار متعدد الجولات مصمم لتقييم مدى عرضة وكلاء الذكاء الاصطناعي مستخدمي الأدوات للهجمات التدريجية في بيئات الشركات، مما يكشف أن النماذج الحالية غالباً ما تفشل في الحفاظ على السلامة مع تصاعد المهام الحميدة تدريجياً إلى سيناريوهات عالية المخاطر.

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Enrico Panai, Laura Caroli, Yue Zhu, Adam Leon S (…)2026-05-22
💬 NLP

Seeing the Poem: Image-Semantic Detection of AI-Generated Modern Chinese Poetry with MLLMs

تقترح هذه الورقة البحثية وتتحقق من صحة طريقة كشف موجهة بالدلالات الصورية، تستفيد من النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) لدمج الصور المرئية مع التحليل النصي، محققةً أداءً هو الأفضل في فئته في كشف الشعر الصيني الحديث المُنشأ بواسطة الذكاء الاصطناعي، ومتفوقةً بذلك على كل من النماذج اللغوية الكبيرة المعتمدة على النص فقط والمكتشفات التقليدية مثل RoBERTa.

Shanshan Wang, Fengying Ye, Hanjia Lyu, Caiwen Gou, Junchao Wu, Jingming Yao, Chengzhong Xu, Jiebo Luo, Derek F. Wong2026-05-22
💬 NLP

Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora

تُثبت هذه الورقة أنه على الرغم من التحديات المتعلقة بالفروق الثقافية الدقيقة واللغة العامية، فإن الترجمة الآلية القائمة على النماذج اللغوية الكبيرة تحافظ بفعالية على الإشارات الأخلاقية الدقيقة في بيانات وسائل التواصل الاجتماعي البولندية، مما يتيح إجراء أبحاث عابرة للغات حول القيم الأخلاقية بتكلفة اقتصادية من خلال تشابه دلالي عالٍ وفجوات أداء ضئيلة في مهام التصنيف اللاحقة.

Maciej Skorski2026-05-22✓ Author reviewed
💬 NLP

Tokenization with Split Trees

تقدم هذه الورقة البحثية ToaST، وهي طريقة جديدة لتقطيع الكلمات الفرعية تستخدم أشجار التقسيم والبرمجة الصحيحة لتحسين اختيار المفردات لتقليل عدد الرموز إلى الحد الأدنى، محققةً تحسينات كبيرة في كفاءة الضغط وأداء النماذج اللغوية مقارنة بالنماذج المرجعية الحالية مثل BPE وWordPiece.

Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage, Seth Ebner, Varshini Reddy, Yuval Pinter, Chris Tanner2026-05-22