🤖 AI

GRPO is Secretly a Process Reward Model

تثبت هذه الورقة نظرياً أن تحسين السياسة النسبي للمجموعات (GRPO) مع نموذج مكافأة المخرجات يكافئ نموذج مكافأة العملية، وتحدد خللاً في تعامله مع الخطوات غير المتوازنة، وتقترح تعديلاً بسيطاً (λ\lambda-GRPO) يحسن أداء الاستدلال وكفاءة التدريب بشكل كبير دون الحاجة إلى نماذج مكافأة عملية صريحة.

Michael Sullivan, Alexander Koller2026-05-29
🤖 AI

Estimating the Empowerment of Language Model Agents

تقدم هذه الورقة البحثية EELMA، وهو إطار عمل قائم على نظرية المعلومات لتقدير تمكين وكيل النموذج اللغوي من خلال تفاعلات نصية متعددة الأدوار، مما يثبت أن هذا المقياس غير المرتبط بهدف محدد يرتبط بفعالية بالأداء في المهام ويحدد اللحظات المحورية للقدرات العامة عبر بيئات متنوعة.

Jinyeop Song, Jeff Gore, Max Kleiman-Weiner2026-05-29
📊 statistics

SpeedCP: Fast Kernel-based Conditional Conformal Prediction

تُعد SpeedCP خوارزمية سريعة ومستقرة تسد الفجوة بين الوعد النظري والتكلفة الحسابية الباهظة للتنبؤ الشرطي القائم على فضاءات ريج (RKHS) من خلال حساب مسار الحل الكامل بكفاءة ودمج التضمينات منخفضة الرتبة، محققةً تسريعاً بمقدار 40 ضعفاً وفترات زمنية أقصر بنسبة 30% مقارنة بالطرق السابقة.

Yating Liu, Yeo Jin Jung, Zixuan Wu, So Won Jeong, Claire Donnat2026-05-29
🤖 machine learning

Towards Understanding the Shape of Representations in Protein Language Models

تتقصى هذه الورقة البنية الهندسية لتمثيلات نماذج لغة البروتين باستخدام سرعة الجذر التربيعي وترشيحات الرسم البياني، كاشفةً أن النماذج تشفر السمات الهيكلية بشكل غير خطي عبر الطبقات مع بلوغ الدقة المثلى قبيل الطبقة الأخيرة، بينما تواجه صعوبة في الحفاظ على العلاقات السياقية بعيدة المدى.

Kosio Beshkov, Anders Malthe-Sørenssen2026-05-29
🤖 machine learning

In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration

تقترح هذه الورقة البحثية "التغذية الراجعة في الموقع"، وهي نموذج تعاوني يقوم فيه المستخدمون بتعديل استجابات النماذج اللغوية الكبيرة مباشرةً لتوجيه عمليات التحسين، مما يثبت من خلال الاختبارات المعيارية والدراسات الخبيرة أن هذا النهج يحقق تصحيحاً للأخطاء أكثر موثوقية، ورضا أعلى للمستخدمين، وإجهاداً أقل مقارنة بالتغذية الراجعة التقليدية متعددة الجولات.

Youngbin Choi, Minjong Lee, Saemi Moon, Seunghyuk Cho, Chaehyeon Chung, MoonJeong Park, Dongwoo Kim2026-05-29
🤖 machine learning

Contrastive Representation Regularization for Vision-Language-Action Models

تقدم هذه الورقة البحثية فقدان التباين المدرك لحالة الروبوت (RS-CL)، وهو تقنية خفيفة الوزن لتنظيم التمثيل تعمل على محاذاة تمثيلات نماذج الرؤية واللغة والعمل مع حالات الاستقبال الحسي الخاص بالروبوت، مما يحسن الأداء بشكل كبير في كل من معايير الاختبار للمناولة في البيئات المحاكية والواقعية.

Taeyoung Kim, Jimin Lee, Myungkyu Koo, Dongyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin2026-05-29
🤖 AI

Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting

تقترح هذه الورقة نهجاً مبتكراً يجمع بين التحكم في المخاطر الخالي من التوزيع والإنهاء المبكر الديناميكي لمنع السياقات الضارة من خفض أداء النماذج اللغوية الكبيرة إلى ما دون خط الأساس لتعلم الصفر، مع تحسين الكفاءة والدقة في آن واحد على المدخلات المفيدة.

Andrea Wynn, Metod Jazbec, Charith Peris, Rinat Khaziev, Anqi Liu, Daniel Khashabi, Eric Nalisnick2026-05-29
🤖 machine learning

The Impact of Semantic Pairs on Self-Supervised Representation Learning

تقدم هذه الورقة دراسة تجريبية منضبطة تُظهر أن استخدام أزواج دلالية إيجابية منسقة يدويًا (نماذج مختلفة من الفئة نفسها) للتدريب المسبق ذاتي الإشراف يحسن باستمرار من القدرة على التعميم ويستحث ثباتات أوسع مقارنة بالأزواج الإيجابية المعززة قياسيًا، مع استفادة طرق التعلم التبايني مثل SimCLR بشكل أكبر.

Mohammad Alkhalefi, Georgios Leontidis, Mingjun Zhong2026-05-29
🧬 biology

Calibrating Generative Models to Distributional Constraints

تتناول هذه الورقة البحثية مشكلة عدم المعايرة في النماذج التوليدية من خلال صياغة المعايرة كمسألة تحسين مقيدة، وتقديم هدفين قابلين للتنفيذ لضبط المعلمات الدقيقة — وهما خسارة الاسترخاء وخسارة المكافأة — اللذين يعملان بفعالية على مواءمة توزيعات أخذ العينات مع القيود الإحصائية المرغوبة عبر تطبيقات متنوعة ونماذج واسعة النطاق.

Henry D. Smith, Nathaniel L. Diamant, Brian L. Trippe2026-05-29
🤖 machine learning

Offline Reinforcement Learning with Generative Trajectory Policies

تقدم هذه الورقة سياسات المسار التوليدية (GTPs)، وهي إطار عمل موحد للتعلم المعزز غير المتصل يسد الفجوة بين نماذج الانتشار البطيئة ونماذج الاتساق السريعة من خلال تعلم خرائط حل المسار القائمة على المعادلات التفاضلية العادية ذات الزمن المستمر، محققةً أداءً هو الأفضل في فئته على معايير D4RL بما في ذلك درجات كاملة في مهام AntMaze الصعبة.

Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen2026-05-29