💬 NLP

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

تجادل هذه الورقة بأن استدلال "سلسلة الأفكور" (Chain-of-Thought) يمكن أن يكون أميناً حتى بدون التعبير اللفظي الصريح عن التلميحات المحقونة في المطالبة، مما يتحدى مقياس "الميزات المنحازة" (Biasing Features) لخلطه بين عدم الاكتمال وعدم الأمانة، ويدعو إلى مجموعة أدوات تفسيرية أوسع تتضمن تحليل الوساطة السببية.

Kerem Zaman, Shashank Srivastava2026-05-11
🤖 machine learning

SWaRL: Safeguard Code Watermarking via Reinforcement Learning

يُعد SWaRL إطار عمل قوي للحفاظ على دقة العلامات المائية للأكواد البرمجية، حيث يستفيد من التعلم التعزيزي مع التغذية الراجعة للمترجم (compiler feedback) ومتحقق سري لدمج تواقيع قابلة للتحقق في الأكواد التي تولدها النماذج اللغوية الكبيرة (LLM)، مما يضمن دقة كشف قوية ومرونة ضد الهجمات مع الحفاظ على الصحة الوظيفية.

Neusha Javidnia, Ruisi Zhang, Ashish Kundu, Farinaz Koushanfar2026-05-11
⚡ electrical engineering

ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule

تقدم هذه الورقة البحثية "الزمن المُعاد تمثيله التكيفي" (ART) ومتغير التعلم التعزيزي الخاص به (ART-RL)، وهو منهج مبني على أسس علمية لتحسين جداول الخطوات الزمنية لنماذج الانتشار من خلال تقليل خطأ التجزئة، مما يحسن جودة العينات بشكل كبير عبر مختلف مجموعات البيانات والميزانيات دون تكاليف إضافية عند الاستدلال.

Yilie Huang, Wenpin Tang, Xunyu Zhou2026-05-11
💬 NLP

Neural Neural Scaling Laws

تقدم هذه الورقة "قوانين القياس العصبية العصبية" (NeuNeu)، وهو نهج قائم على الشبكات العصبية يتفوق على النماذج البارامترية التقليدية من خلال صياغة التنبؤ بأداء المهام اللاحقة كمسألة استكمال خارجي للسلاسل الزمنية، محققاً معدلات خطأ أقل بكثير وقدرة على التعميم في حالة الصفر (zero-shot generalization) عبر مختلف عائلات النماذج والمهام.

Michael Y. Hu, Jane Pan, Ayush Rajesh Jhaveri, Nicholas Lourie, Kyunghyun Cho2026-05-11
🤖 AI

R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes

تقترح هذه الورقة البحثية خوارزمية R-GTD، وهي خوارزمية تعلم فرق زمني متدرج مُنظَّم تضمن التقارب نحو حل فريد وتوفر حدود خطأ صريحة حتى عندما تكون مصفوفة التفاعل الميزاتي مفردة، متجاوزةً بذلك قيود الطرق الحالية التي تعتمد على افتراضات عدم الانفراد.

Hyunjun Na, Donghwan Lee2026-05-11
🤖 AI

Test-Time Compute Games

تحدد هذه الورقة عدم الكفاءة الاجتماعية في أسواق نماذج اللغات الكبيرة كخدمة (LLM-as-a-service) حيث يتم تحفيز المزودين على الإفراط في استخدام الحوسبة المكلفة أثناء وقت الاختبار، وتقترح آلية مزاد عكسي من السعر الثاني لمواءمة التسعير مع القيمة الحدية، وهو ما تم التحقق منه من خلال تجارب على عائلات نماذج مختلفة عبر معايير الرياضيات والعلوم.

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez2026-05-11
📊 statistics

Diffusion Path Samplers via Sequential Monte Carlo

تقدم هذه الورقة إطار عمل لـ "مونت كارلو" المتسلسل القائم على الانتشار، والذي يقدر بكفاءة درجات وكثافات التوزيعات المستهدفة عبر تطوير متغيرات مساعدة على طول مسارات الانتشار، معززاً بمتغيرات تحكم لتقليل التباين، وتم التحقق من صحته عبر عمليات عشوائية ومجموعات بيانات متنوعة.

James Matthew Young, Paula Cordero-Encinar, Sebastian Reich, Andrew Duncan, O. Deniz Akyildiz2026-05-11
🤖 AI

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

تقدم الورقة البحثية ESSAM، وهو إطار عمل لضبط المعلمات الكامل بكفاءة في استهلاك الذاكرة يجمع بين استراتيجيات التطور والتعظيم الواعي بالحدة لتحقيق أداء تنافسي في الاستدلال الرياضي على النماذج اللغوية الكبيرة مع تقليل استخدام ذاكرة وحدة معالجة الرسومات بشكل كبير مقارنة بطرق التعلم المعزز التقليدية مثل PPO وGRPO.

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye2026-05-11
🤖 machine learning

CGF-Softmax: A Cumulant-Based Softmax Reformulation for Efficient Inference under Homomorphic Encryption

تقدم هذه الورقة البحثية CGF-Softmax، وهي إعادة صياغة مبتكرة لدالة softmax باستخدام دالة التوليد التراكمي التي تلغي عمليات القسمة المتجانسة وطرح الحد الأقصى المكلفة، مما يتيح استدلالاً فعالاً ودقيقاً يحافظ على الخصوصية لنماذج المحولات (transformer) تحت التشفير المتجانس مع تقليل العمق الضربي بشكل كبير.

Hanjun Park, Byeongseo Min, Jiheon Woo, Min-Wook Jeong, Jongho Shin, Yongwoo Lee, Young-Sik Kim, Yongjune Kim2026-05-11
📊 statistics

The Effect of Mini-Batch Noise on the Implicit Bias of Adam

تقدم هذه الورقة إطاراً نظرياً يوضح أن ضجيج الدفعات الصغيرة (mini-batch noise) يغير بشكل جوهري الانحياز الضمني لمعلمات الزخم في خوارزمية "آدم" (Adam)، كاشفةً أنه في حين أن التكوين القياسي (β1,0.999)(\beta_1, 0.999) يكون مثالياً للدفعات الصغيرة، فإن الدفعات الأكبر تتطلب تعديل β1\beta_1 ليكون أقرب إلى β2\beta_2 لتجنب التنظيم العكسي (anti-regularization) وتحسين التعميم.

Matias D. Cattaneo, Boris Shigida2026-05-11