🤖 AI

Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing

تُثبت هذه الورقة أنه في اختبار سلامة الذكاء الاصطناعي في مجال الصحة النفسية، يُظهر تعليق الخبراء البشري اختلافاً منهجياً ومبنياً على أسس بدلاً من كونه خطأً عشوائياً، مما يتحدى افتراض وجود حقيقة مرجعية صالحة ويشير إلى أن تقييم الذكاء الاصطناعي في الحالات الحرجة للسلامة يجب أن ينتقل من التجميع القائم على الإجماع إلى الأساليب التي تحافظ على تنوع وجهات النظر المهنية.

Kiana Jafari, Paul Ulrich Nikolaus Rust, Duncan Eddy, Robbie Fraser, Nina Vasan, Darja Djordjevic, Akanksha Dadlani, Max (…)2026-05-12
🤖 machine learning

The Geometric Reasoner: Manifold-Informed Latent Foresight Search for Long-Context Reasoning

يُعد المستنتج الهندسي (TGR) إطار عمل لا يتطلب تدريباً، يعمل على تعزيز الاستنتاج طويل السياق تحت قيود صارمة للذاكرة من خلال إجراء بحث استشرافي كامن مستنير بالمتشعبات مع إعادة ضبط ذاكرة التخزين المؤقت لـ (KV) على مستوى الأجزاء، محققاً تحسينات كبيرة في تغطية المسارات في اختبارات الرياضيات والبرمجة مع تكلفة حسابية ضئيلة.

Ren Zhuang, Ben Wang, Shuifa Sun2026-05-12
🤖 AI

Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments

تقدم هذه الورقة DiGiT-TC، وهي طريقة مبتكرة لتوليد البيانات تقوم بتخليق محادثات استدعاء أدوات متعددة الأدوار ومعقدة لبيئات التنفيذ عديمة الحالة من خلال التمثيل الضمني لاستدعاءات الأدوات ضمن طلبات المستخدم، مما يتيح ضبط النماذج اللغوية الأصغر حجمًا بفعالية دون الاعتماد على التحقق من الحالة.

Maxwell Crouse, Ibrahim Abdelaziz, Kshitij Fadnis, Siva Sankalp Patel, Kinjal Basu, Chulaka Gunasekara, Sadhana Kumarave (…)2026-05-12
🤖 machine learning

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

تقدم هذه الورقة تقنيات بسيطة وقابلة للتوسع لإثبات أن التخطيط الضمني —وهو آلية تقوم من خلالها النماذج اللغوية بتوجيه الرموز الوسيطة نحو أهداف مستقبلية مثل القوافي أو الإجابات— هو قدرة عالمية موجودة حتى في النماذج الصغيرة التي يصل حجمها إلى مليار معلمة، مما يقدم رؤى جديدة للسلامة والتحكم في الذكاء الاصطناعي.

Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda2026-05-12
🤖 machine learning

Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning

تقترح هذه الورقة "التكييف بالبادئات الفاشلة"، وهي طريقة تعزز تدريب نماذج الاستدلال على المسائل المشبعة عبر التكييف على بادئات لمسارات خاطئة نادرة لدفع الاستكشاف نحو الحالات المعرضة للفشل، مما يساهم في استخراج إشارات تعلم قيمة دون الحاجة إلى جمع بيانات جديدة مكلفة.

Minwu Kim, Safal Shrestha, Anubhav Shrestha, Keith Ross2026-05-12
🤖 machine learning

Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics

تُظهر هذه الدراسة أن المناهج الدراسية ذات الدوافع اللغوية في مرحلة ما قبل التدريب للنماذج اللغوية الكبيرة تعزز بشكل أساسي استقرار التدريب وتقلل من ضجيج التدرج في النماذج الأصغر من خلال تغيير مدة مراحل التعلم الكامن المشتركة، بدلاً من إنشاء مراحل جديدة، مع تضاؤل هذه الفوائد عند مقاييس النماذج الأكبر.

Mohamed Elgaar, Hadi Amiri2026-05-12
📊 statistics

Why Adam Works Better with β1=β2\beta_1 = \beta_2: The Missing Gradient Scale Invariance Principle

تكشف هذه الورقة أن ضبط β1=β2\beta_1 = \beta_2 في مُحسِّن "آدم" (Adam) هو الخيار الأمثل لأنه يضمن بشكل فريد عدم التغير في مقياس التدرج من الدرجة الأولى، وهي خاصية هيكلية تفسر التحسينات الملحوظة تجريبياً في استقرار التدريب والأداء عبر المهام المتنوعة.

Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí2026-05-12
🤖 AI

Supervised Mixture-of-Experts for Surgical Grasping and Retraction

تقدم هذه الورقة بنية "خليط من الخبراء" (Mixture-of-Experts) خاضعة للإشراف تُمكّن سياسات التعلم بالتقليد خفيفة الوزن من تحقيق إمساك وسحب جراحي قوي وفعال من حيث البيانات على الأنسجة القابلة للتشوه باستخدام الصور التنظيرية ثلاثية الأبعاد فقط وأقل من 150 عرضاً توضيحياً، متفوقة بشكل كبير على النماذج القياسية في كل من سيناريوهات التوزيع الداخلي وسيناريوهات التوزيع الخارجي الصعبة، مع إثبات نقل ناجح لصفر من الأمثلة (zero-shot transfer) إلى عمليات جراحية على أنسجة خارج الجسم وعمليات أولية على الخنازير.

Lorenzo Mazza, Ariel Rodriguez, Rayan Younis, Martin Lelis, Ortrun Hellig, Chenpan Li, Sebastian Bodenstedt, Martin Wagn (…)2026-05-12
🤖 AI

Emergence of Physical Intelligence via Controllable Information Production

تقدم هذه الورقة إنتاج المعلومات القابل للتحكم (CIP)، وهو إطار عمل جديد للدافع الجوهري يرتكز على الأنظمة الديناميكية والتحكم الأمثل، يوحد الذكاء الفيزيائي مع إنتاج المعلومات، مما يمكن الوكلاء من إتقان مهام معقدة مثل الاعتدال الذاتي للبشر الآليين عبر دفع الأنظمة نحو حافة الفوضى القابلة للتحكم.

Tristan Shah, Stas Tiomkin2026-05-12
🤖 AI

ScholarPeer: A Context-Aware Multi-Agent Framework for Automated Peer Review

يُعد ScholarPeer إطار عمل متعدد الوكلاء مدركاً للسياق يعمل على تعزيز عملية مراجعة النظراء من خلال محاكاة سير عمل باحث أقدم لتقديم التوجيه قبل التقديم والتحقق بعد التقديم، مُظهراً أداءً فائقاً في تدقيق السلامة التقنية وتحديد المقارنات المغفلة على مجموعة بيانات واسعة النطاق من أوراق مؤتمر ICLR المقدمة.

Palash Goyal, Mihir Parmar, Yiwen Song, Hamid Palangi, Tomas Pfister, Jinsung Yoon2026-05-12