💬 NLP

Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

تستخدم هذه الورقة التحليل السيكومتري لتوضيح أن "امتحان البشرية الأخير" (HLE) يقيس في المقام الأول عامل استدلال عام واحد بدلاً من قدرات متميزة خاصة بمجالات محددة، وأن دقة قياسه غير كافية للتمييز بفعالية بين النماذج اللغوية الرائدة.

Mayank Sharma, Savira Nadela, Tyler Matteson2026-07-31
🔬 physics

Rethinking Artificial Intelligence in Medical Imaging: Assumptions, Reality, and Reframing

تجادل هذه الرؤية بأن التأثير السريري المحدود للذكاء الاصطنا_في التصوير الطبي لا ينبع من عيوب تقنية، بل من عدم توافق هيكلي بين تصميم الذكاء الاصطناعي الحالي وسير العمل السريري، مقترحةً تحولاً نحو أنظمة وكيلة متعددة الوسائط، وشفافة، ومتوافقة مع الأطباء لسد هذه الفجوة.

Arman Rahmim, Nourhan Bayasi, Xiaoxiao Li, Babak Saboury, Fereshteh Yousefirizi2026-07-31
🤖 machine learning

SE(3)-MeanFlow: Few-Step Protein Backbone Generation on Lie Groups

تقدم الورقة البحثية SE(3)-MeanFlow، وهو إطار توليدي من خطوات معدودة يوسع نطاق MeanFlow ليشمل هندسة زمرة Lie لتصميم الهيكل العظمي للبروتين، محققاً توليداً عالي الجودة بعدد خطوات أخذ عينات أقل بكثير من نماذج الانتشار أو مطابقة التدفق الحالية عبر استخدام أهداف تدريب ذات صيغة مغلقة وهدف α\alpha-Flow متخصص لـ SE(3).

Yikun Bai, Binghang Lu, Yikai Liu, Elaheh Akbari, Soheil Kolouri, Linxuan Wang, Ping He, Shuchan Wang, Ruqi Zhang, Guang (…)2026-07-31
💻 computer science

Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

تقترح الورقة البحثية "Trajectory Graph Copilot"، وهو إطار عمل يستفيد من الشبكة العصبية الرسومية لنمذجة المسارات التاريخية كرسوم بيانية احتمالية، مما يمكّن وكلاء النماذج اللغوية الكبيرة من تشخيص وتصحيح أخطاء الإجراءات المحتملة ذاتياً قبل التنفيذ، وبالتالي تحسين معدلات النجاح بشكل كبير في المهام المعقدة طويلة الأمد.

Xu Zheng, Zhuomin Chen, Chaohao Lin, Hua Wei, Haifeng Chen, Wei Cheng, Dongsheng Luo2026-07-31
💻 computer science

VAmoS Bench: Voice Agent Simulation Bench

تقدم الورقة البحثية VAmoS Bench، وهو إطار تقييم جديد يقيس الأداء الشامل لوكلاء الصوت في سيناريوهات دعم العملاء المالية ذات الحالة المستمرة، وذلك عبر محاكاة مكالمات هاتفية واقعية تحتوي على عناصر عدائية، وتقييم الوكلاء بناءً على قدرتهم على إنجاز المهام بشكل صحيح، وتحديث قواعد البيانات، والحفاظ على الأمن دون تدخل بشري.

Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi2026-07-31
🤖 machine learning

Latent States in Neural Networks: Recovering the Temporal Structure of Drifting Data from Model Weights

تُثبت هذه الورقة أن ملاءمة نموذج ماركوف الخفي للأوزان المرتبة زمنياً للمصنفات المدربة على تدفقات بيانات متغيرة يمكن أن يستعيد الأنظمة الزمنية الكامنة التي تتنبأ بأداء التعميم بشكل أكثر فعالية من التقارب الزمني البسيط أو التقسيمات الساذجة، مما يكشف أن أوزان النموذج تشفر تحولات هيكلية ذات معنى في توزيع البيانات الأساسي.

Kevin Guan2026-07-31
💻 computer science

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

تقدم هذه الورقة إطار عمل BACKTRACE ومقياس BACKROOMBench للكشف عن "غرفة خلفية للاستنتاج" (Reasoning Backroom) متفشية في الوكلاء اللغويين المعززين بالمهارات، مما يكشف أن عزو المهارات الملحوظة وآثار النصوص هي مؤشرات غير موثوقة للاعتماد السببي الفعلي، والذي لا يمكن قياسه بدقة إلا من خلال تدخلات مضادة للواقع ومنظمة.

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang2026-07-31
💻 computer science

INCLAIR: Inception-Based Longitudinal Clinical Anomaly Detection with Informed Reasoning

يُعد INCLAIR إطار عمل مبتكرًا يستفيد من البنى القائمة على نموذج Inception ونظرية الإحصاء-U للكشف عن الشذوذ في الملفات السريرية الطولية وتوليد تفسيرات لغوية طبيعية مستندة إلى أسس واقعية، محققًا أداءً فائقًا وأهمية سريرية حتى في ظل إشراف الخبراء المحدود.

Maxx Richard Rahman, Wolfgang Maass2026-07-31
💻 computer science

MedLLM: An Open Medical Language Model at the Sub-Billion Scale

تقدم هذه الورقة MedLLM، وهو نموذج لغوي طبي مفتوح بـ 0.1 مليار معلمة تم تدريبه عبر مسار ثلاثي المراحل مفتوح بالكامل، والذي يكشف أن النماذج ذات المقياس الأقل من مليار معلمة تظهر تفككاً فريداً في الكفاءة الطبية — حيث تتفوق في المهام القائمة على السياق بينما تعاني في استرجاع المعرفة بسبب قيود السعة بدلاً من مشكلات التكيف.

Maxx Richard Rahman, Asim Ahmed, Mihan Mohagheghzadeh, Wolfgang Maass2026-07-31
💻 computer science

A dataset of rated conceptual arguments

تقدم هذه الورقة مجموعة بيانات تضم 951 نقدًا من تقييم الخبراء لـ 442 نصًا موقفيًا حول أسئلة مفاهيمية (مثل سلامة وأخلاقيات الذكاء الاصطناعي) لتقييم قدرة النماذج اللغوية الكبيرة على تقييم الحجج الفردية، حيث وجدت أن الأداء في هذه المهام يرتبط بتصنيفات القدرة العامة للنماذج.

Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen, Alexander Kastner, Ethan Perez2026-07-31