💬 NLP

PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints

تقدم هذه الورقة البحثية PMark، وهي طريقة علامة مائية على المستوى الدلالي قوية وخالية من التشويه للنماذج اللغوية الكبيرة، تستخدم إطاراً نظرياً مبتكراً لوظائف الوكيل وقيود القنوات المتعددة لتقدير وسائط الجمل ديناميكياً، مما يحسن بشكل كبير من مقاومة هجمات إعادة الصياغة مع الحفاظ على جودة النص.

Jiahao Huo, Shuliang Liu, Bin Wang, Junyan Zhang, Yibo Yan, Aiwei Liu, Xuming Hu, Mingxun Zhou2026-03-03
💬 NLP

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

تقترح هذه الورقة طريقة فعالة من حيث التكلفة لإجراء تجارب ما قبل التدريب المحكومة المتعددة في آن واحد ضمن عملية تدريب واحدة، مما يثبت أن هذا النهج يمكنه محاكاة وتوسيع الأبحاث السابقة حول تلوث البيانات وسلوك النماذج مع حد أدنى من التأثير على الأداء العام.

Sebastian Bordt, Martin Pawelczyk2026-03-03
💬 NLP

Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models

تتقصى هذه الورقة عدم الاتساق بين مسارات الاستدلال والإجابات النهائية في نماذج الاستدلال الكبيرة من خلال الكشف عن اعتمادها على آليات استرجاع متنافسة، وتقترح إطار عمل FARL، وهو إطار عمل جديد للضبط الدقيق يعمل على كبح اختصارات الاسترجاع هذه لفرض قدرات استدلال حقيقية.

Yuhui Wang, Changjiang Li, Guangke Chen, Jiacheng Liang, Ting Wang2026-03-03
💬 NLP

Scaling with Collapse: Efficient and Predictable Training of LLM Families

تُثبت هذه الورقة أن منحنيات خسارة التدريب لعائلات النماذج اللغوية الكبيرة تنهار لتستقر على مسار عالمي موحد في ظل وصفات القياس المثلى، مما يرسخ هذه الظاهرة كعلامة مميزة للتدريب الفعال من حيث الحوسبة والذي يتيح الكشف المبكر عن الاعتلالات والضبط الفعال للمعلمات الفائقة، وهو ما استغله المؤلفون لتطوير عائلة نماذج *Celerity* التنافسية.

Shane Bergsma, Bin Claire Zhang, Nolan Dey, Shaheer Muhammad, Gurpreet Gosal, Joel Hestness2026-03-03
💬 NLP

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

تقدم الورقة البحثية EditReward، وهو نموذج مكافأة متوافق مع التفضيلات البشرية تم تدريبه على مجموعة بيانات تفضيلات بشرية جديدة واسعة النطاق يحقق أداءً هو الأفضل في فئته في تقييم تحرير الصور الموجه بالتعليمات ويقوم بفلترة البيانات عالية الجودة بفعالية لتحسين تدريب نماذج التحرير مفتوحة المصدر بشكل كبير.

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen2026-03-03
💬 NLP

MENLO: From Preferences to Proficiency -- Evaluating and Modeling Native-like Quality Across 47 Languages

تقدم الورقة البحثية MENLO، وهو إطار عمل ومجموعة بيانات لتقييم جودة استجابة النماذج اللغوية الكبيرة لتكون شبيهة باللغة الأم عبر 47 لغة، وتوضح أنه في حين تعجز نماذج التقييم ذات القدرة الصفرية (zero-shot) عن مضاهاة المقيّمين البشريين، فإن التعلم المعزز وتشكيل المكافأة يمكن أن يحسنا بشكل كبير كلاً من دقة التقييم وكفاءة النماذج متعددة اللغات.

Chenxi Whitehouse, Sebastian Ruder, Tony Lin, Oksana Kurylo, Haruka Takagi, Janice Lam, Nicolò Busetto, Denise Diaz, Fra (…)2026-03-03
💬 NLP

GEM: A Gym for Agentic LLMs

تقدم الورقة البحثية GEM (صانع الخبرة العام)، وهو محاكي بيئة وأدوات تقييم مفتوحة المصدر ومعيارية مصممة لتسريع أبحاث النماذج اللغوية الكبيرة الوكيلية من خلال تسهيل التعلم القائم على الخبرة عبر التنفيذ عالي الإنتاجية، والبيئات المتنوعة، والاختبارات الشاملة التي تقارن بين خوارزميات مثل REINFORCE وPPO وGRPO.

Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan (…)2026-03-03
💬 NLP

ExGRPO: Learning to Reason from Experience

يُعد ExGRPO إطار عمل مبتكر يعزز كفاءة واستقرار التعلم التعزيزي من المكافآت القابلة للتحقق، وذلك من خلال تحديد وتحديد أولويات تجارب التدفق (rollout) القيمة بناءً على الصحة والاعتلاج (entropy)، مما يؤدي إلى تحسين أداء الاستدلال بشكل كبير عبر مختلف النماذج اللغوية الكبيرة مقارنة بالطرق القياسية المعتمدة على السياسة الموحدة (on-policy).

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng2026-03-03
💬 NLP

TiTok: Transfer Token-level Knowledge via Contrastive Excess to Transplant LoRA

يُعد TiTok إطار عمل مبتكر يتيح نقل محولات LoRA عبر هياكل النماذج اللغوية الكبيرة المختلفة من خلال التقاط المعرفة على مستوى الرموز عبر التباين الزائد لتصفية البيانات الاصطناعية بشكل انتقائي، مما يحقق مكاسب كبيرة في الأداء دون الحاجة إلى نماذج إضافية أو أعباء تشغيلية.

Chanjoo Jung, Jaehyung Kim2026-03-03
💬 NLP

SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs

يُعد SwiReasoning إطار عمل لا يتطلب تدريباً يعمل على تعزيز دقة وكفاءة الرموز (tokens) للنماذج اللغوية الكبيرة من خلال التبديل الديناميكي بين الاستدلال الصريح والضمني بناءً على مقاييس الثقة المدفوعة بالاعتلاج (entropy)، مما يوازن بين الاستكشاف والتقارب مع منع الإفراط في التفكير.

Dachuan Shi, Abedelkadir Asi, Keying Li, Xiangchi Yuan, Leyan Pan, Wenke Lee, Wen Xiao2026-03-03