💬 NLP

ORCA-bench: How Ready Are Language Model Agents for Oncall?

تقدم الورقة البحثية ORCA-bench، وهو معيار قياس ذو دقة إنتاجية لتقييم وكلاء النماذج اللغوية في مهام تحليل الأسباب الجذرية أثناء المناوبات، كاشفةً أن أكثر النماذج المتطورة حالياً تحقق دقة منخفضة (25.3% في الصعوبة المتوسطة) وتواجه صعوبة في الهلوسة، مما يشير إلى وجود فجوة كبيرة قبل إمكانية الوثوق بها بأمان في موثوقية الإنتاج في العالم الحقيقي.

Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi2026-07-31
💬 NLP

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

تقدم هذه الورقة OpenMLE، وهو نظام مفتوح متكامل (full-stack) للتحسين الذاتي المتكرر في هندسة تعلم الآلة، وتقدم Frontis-MA1، وهو وكيل تطور ميتا (meta-evolution agent) بحجم 35 مليار معلمة يستفيد من التدريب المرتكز على التنفيذ والبحث طويل الأمد ليتفوق بشكل كبير على النماذج الرائدة في معايير هندسة تعلم الآلة (MLE) مع إظهار قدرة قوية على الانتقال إلى المهام غير المختبرة مسبقاً.

Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen (…)2026-07-31
💬 NLP

Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

تُثبت هذه الورقة أنه عبر مختلف النماذج مفتوحة المصدر (من 1.5 إلى 7 مليارات معلمة) واختبارات الرياضيات المرجعية، يتفوق أخذ العينات المتكرر باستمرار على أساليب الصقل الذاتي والتفكير المعقد أو يضاهيها عند تقييمها بتكلفة رموز متساوية، مما يكشف أن المكاسب الظاهرية للأخيرة تنبع غالباً من زيادة حجم التوليد بدلاً من استراتيجيات التفكير المتفوقة.

Iliya Mirzaei2026-07-31
💬 NLP

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

تقدم هذه الورقة تقنية "تقطير العزو البصري" (VAD)، وهي خوارزمية مضادة للواقع تعمل على عزل التصحيحات المنسوبة بصرياً من إشارات المعلم المختلطة في عملية التقطير متعدد الوسائط القائمة على السياسة، وذلك لإعادة بناء أهداف تدريبية أكثر فعالية ومتوافقة مع الأدلة، والتي تتفوق على الأساليب الحالية في معايير الاختبار البصرية دقيقة التفاصيل.

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen (…)2026-07-31
💬 NLP

Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

تقدم الورقة البحثية Change2Task، وهو نظام يقوم تلقائياً بتحويل طلبات السحب المدمجة إلى مهام لوكلاء برمجيين تم التحقق منها وقابلة للتنفيذ عن طريق إعادة بناء حالات المستودعات التاريخية والتحقق من صحتها على قواعد برمجية حديثة، مما يزيد بشكل كبير من عرض بيانات التدريب مع تقليل تكاليف الإعداد وتحسين معدلات استرداد المهام مقارنة بالنماذج المرجعية الحالية.

Haomin Qi, Xingliang Wang, Xuanqi Gao, Baihui Sang, Xin Zhang, Minghua Ma, Pengfei Gao, Yu Kang, Qingwei Lin, Saravan Ra (…)2026-07-31
💬 NLP

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

تقدم هذه الورقة البحثية OSReward، وهو معيار شامل يكشف عن أوجه القصور في نماذج الرؤية واللغة الحالية كحكام للوكلاء المستخدمين للحاسوب، وتعالج هذه الفجوة من خلال إطلاق OS-Shepherd، وهي عائلة من نماذج المكافأة المفتوحة ومنخفضة التكلفة والمدربة على مجموعة بيانات جديدة موسومة بالاستدلال تضاهي الأداء التجاري بجزء بسيط من التكلفة.

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, X (…)2026-07-31
💬 NLP

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

تقدم هذه الورقة AISPA، وهو إطار عمل متمحور حول المستخدم لتدقيق مطالبات الأنظمة في تطبيقات الذكاء الاصطناعي التجارية، والذي يكشف عن تباين كبير في جودة التصميم، وانتشار التدابير الوقائية الضحلة، والتعايش المستمر للتعليمات الإشكالية التي تقوض مصالح المستخدم رغم الجهود المتزايدة نحو السلامة.

Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zha (…)2026-07-31
💬 NLP

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

تُعد AskChem بنية تحتية جديدة تُحدث تحولاً في تركيب الأدبيات الكيميائية عبر نقل عملية الاسترجاع من الوثائق الكاملة إلى ادعاءات ذرية حاملة للمصدر، مما يُمكّن من بحث واكتشاف أكثر دقة وقابلية للتحقق والوصول عبر الذكاء الاصطناعي بين الأوراق البحثية المختلفة.

Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho2026-07-31
💬 NLP

Testing network clustering algorithms with Natural Language Processing

تقترح هذه الورقة منهجية هجينة تجمع بين خوارزميات كشف المجتمعات ومعالجة اللغات الطبيعية لتحديد والتحقق من صحة المجموعات الاجتماعية عبر الإنترنت القائمة على الثقافة، مما يتيح تقييم خوارزميات التجميع بناءً على التوافق النصي وتحقيق دقة تزيد عن 85% في التنبؤ بآراء المستخدمين.

Ixandra Achitouv, David Chavalarias, Bruno Gaume2026-07-30
🤖 AI

MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications

تقدم الورقة البحثية MEDIC، وهو إطار تقييم شامل يتجاوز المعايسات الثابتة المشبعة لتقييم النماذج اللغوية الكبيرة السريرية عبر خمسة أبعاد، مما يكشف عن فجوات حرجة بين استرجاع المعرفة والتنفيذ التشغيلي مع إثبات ضرورة نهج المحفظة المتنوع من أجل نشر النماذج بشكل آمن وفعال.

Praveenkumar Kanithi, Clément Christophe, Marco AF Pimentel, Tathagata Raha, Prateek Munjal, Nada Saadi, Hamza A Javed (…)2026-07-30