🤖 AI

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

تجادل هذه الورقة بأن مقاييس تقييم النصوص القائمة على المراجع يجب أن تكون مرتبطة إحصائياً بالتقييمات البشرية ومتينة استراتيجياً ضد التلاعب، مقترحةً إطاراً موحداً قائماً على المعلومات المتبادلة يحقق مقاومة فائقة للتلاعب مع الحفاظ في الوقت ذاته على ارتباط تنافسي مع الأحكام البشرية.

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck2026-08-04
🤖 machine learning

When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents

تقدم هذه الورقة إطار عمل BRACE، وهو إطار تحكم بميزانية مقترن بطريقة تقليم الرموز (E-RECAP)، والذي يخفف من اختناقات زمن الاستجابة الناتجة عن إعادة التخطيط المتكرر القائم على النماذج اللغوية الكبيرة في الوكلاء المجسدين، وذلك عبر تخصيص ميزانيات الرموز وتقليم السياقات ديناميكياً لتقليل انتهاكات أهداف مستوى الخدمة بشكل كبير مع الحفاظ على معدلات نجاح عالية للمهام.

Shuaijun Liu, Feiyang You, Xingwei Chen, Ningxin Su2026-08-04
🤖 machine learning

Plasticity of Growing and Elastic Neural Networks in Online Continual Learning

تتقصى هذه الورقة البحثية مرونة الشبكات العصبية النامية والمرنة في التعلم المستمر عبر الإنترنت، حيث تُثبت أن النهج التكيفية التي تضيف وحدات جديدة تدريجياً مع الاحتفاظ بالروابط القائمة أو تقليم الروابط الميتة يمكنها الحفاظ على دقة تنبؤ عالية ومنع فقدان المرونة دون حدوث نسيان كارثي.

Jeong Min Kong, Richard S. Sutton2026-08-04
🤖 machine learning

Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics

تقدم هذه الورقة البحثية "السؤال يولد سؤالاً" (QbQ)، وهو منهج تعليمي ذاتي التطور يعمل بشكل تكراري على توليد متغيرات للمسائل من نقاط القوة الحالية للنموذج للتغلب على ندرة البيانات ومحدودية مسارات الاستدلال، مما نجح في كسر مستويات الأداء الثابتة في الضبط الدقيق للرياضيات التنافسية عبر تحقيق درجة 16.5% في مقياس pass@1 على اختبار AIME.

Longtian Bao, Jianyou Wang, Yang Zhang, Youze Zheng, Ramamohan Paturi2026-08-04
🤖 machine learning

Gram-Space: Structure-Preserving Codebook Compression for Memory-Efficient Neuro-Symbolic AI

تقدم هذه الورقة "Gram-Space"، وهو إطار ضغط يستخدم عملية تعامد "غرام-شميدت" لتمثيل مجموعات الأكواد الخاصة ببنية الرموز المتجهة في نظام متعامد ومتراص، مما يحافظ على هياكل الضرب النقطي الجوهرية مع تقليل استهلاك ذاكرة وحدة معالجة الرسومات بشكل كبير وتحسين زمن انتقال الاستدلال للذكاء الاصطناًعي العصبي-الرمزي.

Weilun Wang, Wantong Li2026-08-04
🤖 AI

Does the Competitive Component of Adversarial Self-Play Improve Legal Reasoning? A Controlled Negative Result

تفيد هذه الورقة بتقرير نتيجة سلبية منضبطة تُظهر أن إضافة مكون اللعب الذاتي التنافسي العدائي إلى تدريب الاستدلال القانوني لا يحقق أي تحسن في الأداء مقارنة بالنماذج المرجعية غير التنافسية، مما يشير إلى أن قيمة نهج تعدد المعلمين هذا تنبع من بناء بيئات قابلة للتحقق بدلاً من الديناميكية التنافسية نفسها.

Miseog Shawn Kim2026-08-04
🤖 machine learning

Meganeura: Portable GPU Training and Inference through Vulkan and Metal

تُظهر Meganeura أن مترجماً أصلياً مدمجاً يستخدم Vulkan وMetal يمكنه بفعالية تغطية مرحلتي التدريب والاستدلال عبر مختلف وحدات معالجة الرسومات الاستهلاكية، محققاً أداءً تنافسياً وأوقات تجميع أسرع بكثير مقارنة بـ PyTorch، مع تحديد تغطية النواة وجدولة المهام كعقبات رئيسية متبقية.

Dzmitry Malyshau2026-08-04
🤖 machine learning

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

تقدم هذه الورقة البحثية F-ICL، وهو معيار مرجعي يستخدم معيارًا مثاليًا بايزيًّا دقيقًا مستمدًا من آلة كاملة تورينج، ليكشف أنه على الرغم من الدقة العالية، تفشل النماذج اللغوية الكبيرة في أداء الاستدلال الخوارزمي الحقيقي، وتعتمد بدلاً من ذلك على الإحصاءات منخفضة الرتبة وتُظهر سلوكيات تحديث غير رتيبة تبتعد بشكل كبير عن الحد الأمثل النظري.

Hector Zenil, Luan Ozelim2026-08-04
🤖 machine learning

Statistical comparisons of time-series feature sets on classification tasks

تقارن هذه الدراسة بين ست مجموعات من ميزات السلاسل الزمنية مفتوحة المصدر وثلاثة خطوط أساس، عبر 124 مشكلة تصنيف، لتكشف أنه في حين تؤدي معظم المجموعات بشكل مماثل إجمالاً، فإن مكتبة tsfresh الشاملة تحقق أعلى معدل فوز، ومع ذلك غالباً ما تفضل خصائص مشكلات معينة ميزات الخطوط الأساسية الأكثر بساطة.

Trent Henderson, Ben D. Fulcher2026-08-04
🤖 machine learning

HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning

تقدم HindSearch إجراءً للتقطير الذاتي القائم على التبصر في التفكير (hindsight self-distillation) لتعلم التعزيز المعزز بالبحث، والذي يستفيد من انتقادات حَكَمٍ مُجمّد للمسارات الفاشلة لتوفير إشارات مساعدة داخل السياسة (on-policy signals)، مما يحسن الأداء بشكل كبير مقارنة بالنماذج المرجعية السابقة عبر استخدام الإجابة النموذجية لتشخيص إخفاقات البحث.

Haowei Liu, Jiamian Wang, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang2026-08-04