🤖 AI

Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

تقترح هذه الورقة إطار عمل جديد لتقييم السياسة غير المتصلة (offline policy evaluation) للمناولة الروبوتية، والذي يستخدم مؤثر بلمان القائم على الحيوية المخصومة (discounted liveness-based Bellman operator) للتعامل بفعالية مع المكافآت الشحيحة، والتقدم غير الرتيب للمهام، وتحيز قطع الأفق المحدود، مما يؤدي إلى التفوق على الطرق الكلاسيكية في عكس تقدم المهمة بدقة.

Hao Wang, Joshua Bowden, Colton Crosby, Somil Bansal2026-05-13
🤖 AI

Engagement Process: Rethinking the Temporal Interface of Action and Observation

تقدم هذه الورقة "عملية الانخراط" (EP)، وهي صياغة تفاعلية جديدة تفصل الأفعال والملاحظات إلى تدفقات أحداث مستمرة لنمذجة الديناميكيات الزمنية المعقدة صراحةً، مثل زمن تأخير التداول والتغذية الراجعة المتأخرة، مما يتغلب بذلك على قيود الواجهات ذات الخطوات الثابتة التقليدية في كل من سيناريوهات الوكيل المنفرد والأنظمة المتعددة.

Jialian Li, Yuchen Cao, Junhong Liu, Weiran Guo, Xutao Wang, Jiaming Song, Jiahao Zhang, Jie Chen2026-05-13
🤖 AI

The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

تقدم هذه الورقة مفهوم "التفاوت التقييمي" لمعالجة مشكلة الصلاحية الناتجة عن إدراك نماذج الذكاء الاصطناعي لسلوكها وتغييره أثناء الاختبار، مقترحةً بروتوكول TRACE لضمان أن تكون ادعاءات السلامة مشروطة صراحةً بسياق تقييم محدد بدلاً من افتراض الأداء القابل للتعميم.

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais2026-05-13
🤖 AI

Decaf: Improving Neural Decompilation with Automatic Feedback and Search

تقدم الورقة البحثية نظام Decaf، الذي يستفيد من التغذية الراجعة للمترجم والبحث لتحسين الصحة الدلالية لمخرجات إلغاء التجميع العصبية بشكل كبير، مما يرفع معدل النجاح في مجموعة Real -O2 من 26.0% إلى 83.9% دون المساس بالتشابه مع الكود المصدري الأصلي.

Alexander Shypula, Osbert Bastani, Edward Schwartz2026-05-13
🤖 AI

Selective Off-Policy Reference Tuning with Plan Guidance

تقدم الورقة البحثية طريقة "الضبط المرجعي الانتقائي خارج السياسة" (SORT)، وهي طريقة تستفيد من توجيه المخطط لاستخلاص تحديثات الإصلاح من الحلول المرجعية، مما يحول عمليات التدفق الفاشلة إلى إشارات تعلم مدركة للبنية تعمل على تحسين أداء الاستدلال بشكل كبير، لا سيما في النماذج الأضعف، مقارنة بنهج GRPO القياسي.

Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen, Linh Ngo Van, Trung Le2026-05-13
💬 NLP

A Study on Hidden Layer Distillation for Large Language Model Pre-Training

تقارن هذه الدراسة بين تقنية تقطير الطبقة الخفية (Hidden Layer Distillation) والأساليب القائمة على اللوجيت (logit-based methods) في مرحلة ما قبل التدريب للنماذج اللغوية الكبيرة، وتجد أنه بينما تعمل باستمرار على تحسين مستوى الحيرة (perplexity)، إلا أنها لا تتفوق بشكل موثوق على التقطير المعرفي القياسي في المهام اللاحقة، مما يشير إلى الحاجة إلى مزيد من الاختراقات للاستفادة الكاملة من إشارات التمثيل الوسيط.

Maxime Guigon, Lucas Dixon, Michaël E. Sander2026-05-13
🤖 AI

Controllable User Simulation

تحدد هذه الورقة أن الضبط الدقيق الخاضع للإشراف القياسي لمحاكيات المستخدم يؤدي إلى انحياز الاستشراف المسبق ويتسبب في "انهيار القدرة على التحكم" تحت تأثير تحولات السياسة، وتقترح إطار عمل للاستدلال السببي مع تدابير تخفيف تدريبية محددة لاستعادة الاتساق السببي وتمكين التقييم القوي وغير المنحاز للوكلاء الحواريين.

Guy Tennenholtz, Ofer Meshi, Amir Globerson, Uri Shalit, Jihwan Jeong, Craig Boutilier2026-05-13
💬 NLP

Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

تقدم هذه الورقة البحثية طريقة "Covariance-Aware GRPO"، وهي طريقة خالية من المعلمات الفائقة تعمل على استقرار التدريب وتحسين أداء الاستنتاج من خلال تقليل وزن تحديثات الرموز (tokens) المتطرفة ديناميكيًا عبر إعادة وزن الميزة باستخدام نواة غاوسية بناءً على التباين بين احتمالات الرموز والمزايا.

Cheng Wang, Qin Liu, Wenxuan Zhou, Muhao Chen2026-05-13
🤖 machine learning

Sharpen Your Flow: Sharpness-Aware Sampling for Flow Matching

تقدم هذه الورقة SharpEuler، وهو أداة عينات لمطابقة التدفق (flow matching) لا تتطلب تدريباً، تعمل على تحسين كفاءة الاستدلال من خلال تخصيص خطوات التكامل بشكل تكيفي للمناطق ذات الحدة العالية في حقل السرعة، مما يؤدي إلى تحسين جودة العينات وتغطية الأنماط دون زيادة عدد تقييمات النموذج.

Aditi Gupta, Soon Hoe Lim, Annan Yu, N. Benjamin Erichson2026-05-13
💬 NLP

Three Regimes of Context-Parametric Conflict: A Predictive Framework and Empirical Validation

تحل هذه الورقة التناقضات في النتائج التجريبية حول كيفية تعامل النماذج اللغوية الكبيرة مع التناقضات بين معرفة التدريب والمستندات المقدمة من خلال اقتراح والتحقق من إطار عمل ثلاثي الأنظمة يميز بين التحديث أحادي المصدر، والتكامل التنافسي، والاختيار المناسب للمهمة، مبرهنةً على أن سلوك النموذج محكوم بشكل يمكن التنبؤ به باتساق الأدلة، واليقين البارامتري، ومتطلبات صياغة المهمة.

Pruthvinath Jeripity Venkata2026-05-13