🤖 machine learning

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks

تقدم هذه الورقة مفهوم "دين التماسك" (coherence debt) لتوضيح أن نجاح وكلاء البرمجة على مستوى المستودعات يعتمد بشكل أساسي على التوافر الفوري للحقائق السياقية المطلوبة بدلاً من المسافة أو الذاكرة البارامترية للوكيل، مما يكشف أن الوكلاء غالباً ما يختلقون حلولاً عند فقدان الحقائق، وأن أطر التقييم الحالية قد تشخص الإخفاقات بشكل خاطئ عبر التركيز على عمليات القراءة بدلاً من اتساق المخرجات المولدة.

Bardia Mohammadi, Lars Klein, Aman Chadha, Akhil Arora, Laurent Bindschaedler2026-08-18
🤖 machine learning

Toward Better Assessment of LLMs' Performance in Clinical Error Detection

تُظهر هذه الورقة أن المقاييس التجميعية القياسية مثل درجات F1 يمكن أن تكون مضللة في الكشف عن الأخطاء السريرية، حيث إنها غالبًا ما تحجب ضعف أداء التمييز الزوجي والتحيزات اللغوية في النماذج اللغوية الكبيرة، مما يستلزم اعتماد طرق تقييم زوجية من أجل تطبيقات سريرية أكثر أمانًا.

Yifan Zhang, Rahmatollah Beheshti2026-08-18
🤖 machine learning

Hoeffding adaptive splitting trees for data stream classification with concept drift and ensemble learning

تقترح هذه الورقة أشجار هوفدينج للتجزئة التكيفية (Hoeffding Adaptive Splitting Trees)، وهي نموذج جديد لأشجار القرار يجمع بين التجزئة الدورية وكشف التغير التكيفي للتغلب على قيود التنوع في المجموعات وتدقيق أداء رائد في تصنيف تدفق البيانات تحت ظروف تغير المفاهيم.

Daniel Nowak Assis, Jean Paul Barddal, Fabrício Enembreck2026-08-18
📊 statistics

Hide&Seek: Learning to Explain in an End-to-End Differentiable Network

تقدم هذه الورقة Hide&Seek، وهو إطار عمل قابل للتفاضل من البداية إلى النهاية لاختيار الميزات على مستوى الحالة، والذي يتعلم بشكل مشترك اختيار الميزات والتنبؤ دون تسرب للمعلومات من خلال إعادة صياغة إزالة الميزات كعملية قابلة للتفاضل وتثبيت التدريب عبر التلدين بوزن الاقتصاد في الموارد.

Tal Ellinson, Hadi Mohasel Afshar, Sally Cripps2026-08-18
🤖 machine learning

Learning to Unlearn: Machine Unlearning via Learning the Unlearning Behaviors

تقدم هذه الورقة البحثية "التعلم من أجل عدم التعلم" (L2UL)، وهو نهج جديد غير مرتبط بنموذج محدد يتعلم سلوكيات عدم التعلم من منظور التوزيع لاستبدال وظائف عدم التعلم المعقدة والمصممة يدويًا بآلية بسيطة وفعالة تحقق دقة تضاهي دقة إعادة التدريب بتكاليف حوسبة أقل بكثير، لا سيما بالنسبة لمجموعات البيانات والنماذج واسعة النطاق.

Hang Zhang, Kaifeng Zhang, Yixiao Ma, Weijie Xu, Ye Zhu, Kai Ming Ting2026-08-18
🤖 machine learning

MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter

يقترح النموذج الأولي MIRROR نظاماً لتقارير الأشعة متعدد الوسائط يربط بين مصنف ومحدد مواقع ومولد نصوص لضمان نتائج قابلة للتدقيق ومستندة إلى احتمالات النموذج، مع تسليط الضوء على أنه على الرغم من تحقيق تمييز أفضل من الصدفة في مجموعة بيانات ChestMNIST، إلا أن الفائدة العملية للنموذج محدودة للغاية بسبب عدم توازن الفئات مما يجعله يفشل في تقديم تنبؤات إيجابية لمعظم الحالات.

Vignesh Nagarajan, Sriram Venkatapathy2026-08-18
🤖 machine learning

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

تقدم هذه الورقة "رأس القرار الأخلاقي" (Ethical Decision Head)، وهو إطار عمل للتعلم التعزيزي يستخدم التغذية الراجعة البشرية لتدريب المركبات ذاتية القيادة، مما يكشف عن تباين حرج حيث تتعلم الوكلاء إعطاء الأولوية لتفضيل المقيمين البشريين للتضحية بالذات على الهدف النفعي النظري المتمثل في تقليل إجمالي الضحايا.

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi2026-08-18
🤖 machine learning

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

تقدم الورقة البحثية "Le Critique"، وهو إطار عمل يعزز التعلم المعزز للنماذج اللغوية الكبيرة من خلال الجمع بين دوال القيمة المتميزة (PVF) لحقن الإشارات ذات الصلة بالمهمة على مستوى الرمز (token-level)، وتقنية TETHER للاستيفاء التكيفي بين المراجع النسبية للمجموعة ومراجع القيمة، مما يحقق أداءً فائقاً مقارنة بمراجع دالة القيمة القياسية ونتائج تنافسية مع GRPO مع التخفيف من مشكلات مثل عمليات التدحرج المتأخرة (straggler rollouts) والتباين العالي.

Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison2026-08-18
🤖 machine learning

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

تقدم هذه الورقة CHIVE، وهو مسار عمل وكيل (agentic pipeline) يعمل على تقييم وتحسين طرق تفسير النماذج اللغوية الكبيرة (LLM) من خلال استخدام تجارب مضادة للواقع لتقييم ما إذا كانت التفسيرات يمكنها التنبؤ بدقة بسلوك النموذج على مدخلات ذات صلة، مما يكشف أن تقنيات التفسير الحالية لا تقدم أي ميزة تنبؤية مع إثبات أن التدريب على البيانات المولدة بواسطة CHIVE يعزز القدرة على التعميم.

Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks2026-08-18
🤖 machine learning

On the Principles Behind Neural Network Optimizers

تقدم هذه الورقة أساساً نظرياً رصيناً لمُحسِّن "آدم" (Adam) عبر حل الجدل حول تقاربه، وتفسير تفوقه على "النزول الاشتقاقي العشوائي" (SGD) في نماذج "ترانسفورمر" (Transformers) من خلال هياكل "هيسيان" (Hessian) المتطورة، والاستفادة من هذه الرؤى لتقديم "آدم-ميني" (Adam-mini)، وهو مُحسِّن جديد يقلل استهلاك الذاكرة إلى النصف مع الحفاظ على الأداء.

Yushun Zhang2026-08-18