🤖 machine learning

Agentic Reinforcement Learning with Self-Distilled Reward Shaping

تقدم هذه الورقة "التعلم التعزيزي الوكيل مع تشكيل المكافأة بالتقطير الذاتي" (ADRS)، وهو إطار عمل يعزز أداء وكلاء اللغة في المهام طويلة الأمد من خلال توليد ائتمان على مستوى الرمز المرتبط بالعائد عبر إشارات مهارة مميزة ومقطرة ذاتياً، يتم معايرتها وحجبها بشكل مشترك بواسطة ثقة المعلم والعوائد المحققة.

Ranxu Zhang, Guinan Chen, Chenshaodong, Jinghao Lin, Xiaozhou Xu, Sunzhe, Yanyong Zhang, Chao Wang2026-08-05
🤖 machine learning

SAKI: Score-Aware Low-Rank Key Indexing for Long-Context KV Retrieval

تُعد SAKI طريقةً لترتيب مفاتيح (key indexing) منخفضة الرتبة، واعية بالدرجات، ولا تتطلب تدريباً، تعمل على تحسين ضغط ذاكرة التخزين المؤقت لـ KV عبر تقليل تشوه درجات الانتباه مباشرةً من خلال تحليل عاملي غير متماثل ذي صيغة مغلقة، مما يجعلها تتفوق بشكل كبير على الأساليب الحالية القائمة على إعادة بناء المفاتيح مثل PCA في استدعاء السياق الطويل عبر نماذج لغوية كبيرة متعددة.

Lin Zhang2026-08-05
🤖 machine learning

The Ignition Is Real, and It Lives at the Readout: Latent composition, difficulty-clocked ignition, and the interface-constituted commit in a recurrent-depth reasoner

تؤكد هذه الورقة أن "الاشتعال التركيبي" في المستنتج ذي العمق المتكرر هو ظاهرة حوسبية حقيقية تحدث عند مخرجات المفردات، وتتميز بقفزة حادة تعتمد على العمق في هامش القرار، وانقباض وتجميد هندسي في الحالات الخفية، مع التراجع عن الادعاءات السابقة بشأن اتجاهية الحالة الخفية وانخفاضات السرعة باعتبارها آثاراً تعتمد على الإحداثيات.

Simon Lam-Muir2026-08-05
🤖 machine learning

The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics

تُثبت هذه الورقة أن تحليل الديناميكيات الهيكلية لتتبعات "سلسلة الأفك‏ر" (Chain-of-Thought)، بدلاً من محتواها الدلالي، يمكن أن يكشف بفعالية عن إخفاقات الاستدلال ويصححها في النماذج اللغوية الكبيرة في مهام القابلية للإرضاء البوليانية (Boolean satisfiability)، كما يتضح من تدخل مستهدف رفع دقة نموذج Llama3-70B من 13.3% إلى 85%.

Shashwat Sourav, Aishwarya Balwani2026-08-05
🤖 machine learning

Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging

يقدم Any-OPD إطار عمل مبتكر للتقطير على السياسة (on-policy distillation) غير المتجانس بين نماذج مطابقة التدفق الكامنة (latent flow-matching models) التعسفية عبر الربط بينها من خلال تمثيل رؤية مجمد ومستقل عن النموذج ومطابقة مستمرة لمستوى الضجيج، مما يمكّن طالباً بحجم 2.5 مليار من منافسة أداء معلم بحجم 12 مليار حيث يفشل الانحدار الكامن التقليدي.

Siming Fu, Zheming Fu, Ruizhe He, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Haoju (…)2026-08-05
📊 statistics

A Direct Route to Markov Chain Convergence via Asymptotic Equivalence with the Target

تقدم هذه الورقة معياراً ذاتي الاحتواء، وضرورياً وكافياً لتقارب سلاسل ماركوف بناءً على التكافؤ التقاربي مع المقياس المستهدف، مما يقدم برهاناً مبسطاً يتجنب الافتراضات التقليدية مثل عدم القابلية للاختزال، أو عدم الدورية، أو تقنيات الاقتران، مع إثبات القانون القوي للأعداد الكبيرة لمختلف الخوارزميات بما في ذلك عينات جيبس والتدريب المتوازي.

Patrick Forré2026-08-05
🤖 machine learning

Benign interpolation and Occam's razor

تجادل هذه الورقة بأن المحاولات الأخيرة لتفسير نجاح التعميم في نماذج التعلم العميق الاستيفائية عبر الاستناد إلى مبدأ "نصل أوكام" تخلق فجوة تفسيرية من خلال الخلط بين الخصائص غير المثبتة للنماذج الفردية وبين الارتباط الصارم، المدعوم بالبراهين النظرية، بين بساطة فئة النموذج والتعميم الموجود في نظرية التعلم الكلاسيكية.

Tom F. Sterkenburg, Daniel A. Herrmann, Jan-Willem Romeijn2026-08-05
🤖 machine learning

TimeRLM: Recursive Language Models Enable Precise Anomaly Localization in Long-Context Time-Series

تقدم الورقة البحثية TimeRLM، وهو إطار عمل لنموذج لغوي تكراري يستفيد من قدرات البرمجة والرؤية لتحقيق دقة متطورة في تحديد مواقع الشذوذ ضمن بيانات السلاسل الزمنية ذات السياق الطويل، متفوقاً على النماذج الحالية في كل من معيار قياسي اصطناائي جديد (AnomalyXL) وتسجيلات من العالم الحقيقي.

Nicolas Zumarraga, Lorenzo Steno, Ning Wang, Max Rosenblattl, Thomas Kaar, Maxwell A. Xu, Kevin O'Sullivan, Markus Kreft (…)2026-08-05
🤖 machine learning

AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction

تقدم هذه الورقة البحثية معيار "كأس العالم للذكاء الاصطناعي"، وهو تقييم معياري حيث قامت عشرة نماذج لغوية كبيرة بالتنبؤ بكأس العالم 2026 بالكامل تحت ظروف متطابقة، مما كشف أن نموذج GPT-5.5 Thinking تفوق على الآخرين بشكل أساسسب بسبب تفوق تنبؤاته في الأدوار الإقصائية، وأن نجاح التنبؤ على مستوى البطولة يختلف اختلافاً جوهرياً عن الدقة على مستوى المباريات الفردية.

Jonaid Shianifar, Iias Faiud2026-08-05
🤖 machine learning

Dual-domain U-Nets with embedded back projection operators for motion-resolved 4D CBCT reconstruction

تقترح هذه الورقة بنية U-Net ثنائية النطاق مزودة بمعاملات إسقاط خلفي مدمجة تعمل على إعادة بناء أحجام التصوير المقطعي المحوسب بالحزمة المخروطية (CBCT) رباعية الأبعاد والمحللة للحركة وحقول إزاحة التنفس من مسوحات فردية حرة التنفس دون الحاجة إلى إشارات تنفس أو تقسيم الإسقاط، مما يظهر رؤية فائقة للورم والمريء مقارنة بالطرق التقليدية في كل من التقييمات المحاكاتية والسريرية.

Ivo Herzig, Pascal Paysan, Daniel Barco, Marc André Stadelmann, Frank-Peter Schilling, Igor Peterlik, Michal Walczak, Li (…)2026-08-05