💬 NLP

RewardBench 2: Advancing Reward Model Evaluation

تقدم هذه الورقة البحثية RewardBench 2، وهو معيار جديد صارم متعدد المهارات تم بناؤه من مطالبات بشرية جديدة يوفر تقييماً أكثر تحدياً لنماذج المكافأة مع إظهار ارتباط قوي بأدائها في المهام اللاحقة في كل من توسع وقت الاستدلال والتدريب باستخدام التعلم التعزيزي من التغذية الراجعة البشرية (RLHF).

Saumya Malik, Valentina Pyatkin, Sander Land, Jacob Morrison, Noah A. Smith, Hannaneh Hajishirzi, Nathan Lambert2026-04-24
📊 statistics

Strategic Scaling of Test-Time Compute: A Bandit Learning Approach

تقترح هذه الورقة إطار عمل جديد لتعلم "بانديت" (bandit learning) لتخصيص حسابات وقت الاختبار بشكل تكيفي، حيث يقوم بتقدير صعوبة الاستعلام ديناميكياً لإعطاء الأولوية للموارد للحالات الصعبة القابلة للحل، محققاً مكاسب أداء كبيرة مقارنة بالتخصيص الموحد في معايير الرياضيات والبرمجة.

Bowen Zuo, Yinglun Zhu2026-04-24
💬 NLP

Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs

تجادل ورقة الموقف هذه بأن النماذج اللغوية الكبيرة متعددة اللغات، ولا سيما من خلال حلقات التدريب ذاتية الاستهلاك المعروفة باسم "انهيار النموذج"، تشكل تهديداً خفياً للتنوع اللغوي عبر التآكل التدريجي للميزات النحوية النادرة والفروق الثقافية الدقيقة، مما يستوجب تحولاً في معالجة اللغات الطبيعية لحماية الإبداع متعدد اللغات وتقديره بشكل فعال.

Eva Vanmassenhove2026-04-24
💬 NLP

Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models

تقدم هذه الورقة LLMThinkBench، وهو معيار شامل ودراسة تجريبية لـ 53 نموذجاً من نماذج اللغة الكبيرة تكشف عن مقايضة حرجة بين الدقة والكفاءة، حيث تُظهر أن النماذج غالباً ما "تفرط في التفكير" في المسائل الرياضية الأساسية عبر توليد رموز (tokens) زائدة دون تحسين الدقة، وتتعرض أحياناً لانخفاضات كبيرة في الأداء عندما تكون ميزانيات التفكير مقيدة.

Gaurav Srivastava, Aafiya Hussain, Sriram Srinivasan, Xuan Wang2026-04-24
💬 NLP

EduCoder: An Open-Source Annotation System for Education Transcript Data

تقدم هذه الورقة منصة EduCoder، وهي منصة مفتوحة المصدر مصممة لمعالجة التعقيدات الفريدة لتوسيم نصوص الحوارات التعليمية من خلال تمكين التعريف التعاوني لكتيب الرموز، ودعم أنواع التوسيم المتنوعة، وتسهيل معايرة الموّسمين لتعزيز موثوقية البيانات.

Guanzhong Pan, Mei Tan, Hyunji Nam, Lucía Langlois, James Malamut, Liliana Deonizio, Dorottya Demszky2026-04-24
💬 NLP

Unveiling Unicode's Unseen Underpinnings in Undermining Authorship Attribution

تحلل هذه الورقة أوجه القصور في أساليب إخفاء الهوية التقليدية ضد عزو التأليف القائم على القياس الأسلوبي، وتقترح استخدام إخفاء المعلومات باستخدام نظام "يونيكود" كاستراتيجية مضادة عدائية لحماية هوية المستخدم في الاتصالات العامة.

Robert Dilworth2026-04-24
🤖 machine learning

CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning

تقدم هذه الورقة البحثية خوارزمية CE-GPPO، وهي خوارزمية تعلم تعزيزي جديدة تعمل على تثبيت إنتروبيا السياسة وتحسين أداء الاستنتاج في النماذج اللغوية الكبيرة من خلال إعادة إدخال التدرجات المحدودة من الرموز المقصوصة التي يتم تجاهلها عادةً في خوارزمية PPO القياسية.

Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou2026-04-24
💬 NLP

ReFACT: A Benchmark for Scientific Confabulation Detection with Positional Error Annotations

تقدم الورقة البحثية ReFACT، وهو معيار مرجعي مستمد من r/AskScience على منصة Reddit، والذي يكشف أن النماذج اللغوية الكبيرة تعاني من عجز جوهري في التجذر الدلالي يتسبب في أخطاء "المشتتات البارزة" وتواجه صعوبة في الأحكام المقارنة، مما يتحدى موثوقية نماذج "النموذج اللغوي الكبير كحَكَم" (LLM-as-Judge) فيما يتعلق بالحقائق العلمية.

Yindong Wang, Martin Preiß, Margarita Bugueño, Jan Vincent Hoffbauer, Abdullatif Ghajar, Tolga Buz, Gerard de Melo2026-04-24
💬 NLP

Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling

تقترح هذه الورقة طريقة معايرة فعالة ومؤسسة نظرياً لتجميع إشارات النماذج اللغوية الكبيرة (LLM) ونماذج المكافأة (PRM) بشكل أمثل باستخدام أوزان متعلمة —بما في ذلك الأوزان السالبة— لتعزيز كفاءة وأداء التوسع في وقت الاختبار بشكل كبير، مع استخدام جزء ضئيل فقط من الحوسبة المطلوبة من النهج القياسية.

Peng Kuang, Yanli Wang, Xiaoyu Han, Yaowenqi Liu, Kaidi Xu, Haohan Wang2026-04-24
💬 NLP

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

يحتوي النص المقدم على عدم تطابق بين العنوان ("SlideAgent") والملخص (الذي يصف إطار عمل باسم "SARA" للـ RAG الهجين)، ولكن بناءً على محتوى الملخص، تقترح الورقة البحثية SARA، وهو إطار عمل هجين لتوليد المخرقات المعززة بالاسترجاع يجمع بين مقتطفات اللغة الطبيعية ومتجهات الضغط الدلالي لتحسين صلة الإجابة وصحتها والتشابه الدلالي بشكل كبير عبر مجموعات بيانات متعددة ونماذج لغوية كبيرة مفتوحة المصدر تحت ميزانيات ثابتة لعدد الرموز (tokens).

Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar2026-04-24