🤖 AI

DeepInsight II: One Trace from Benchmark to Robot

يمدّد DeepInsight II إطار التقييم الموحد لسلفه ليشمل طبقة الذكاء الاصطناي المجسد عبر قياس أداء الملاحة، والتلاعب، والتحكم في كامل الجسم عبر تجارب المحاكاة والروبوتات الحقيقية، مما يؤسس مسار تشخيص مستمر وموجه للإصلاح يجسّر الفجوة بين المحاكاة والواقع من خلال هويات تتبع مشتركة.

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen2026-08-18
🤖 AI

CUBICS: Situation-aware performance estimation for safety-relevant ML components

تقدم هذه الورقة CUBICS، وهو إطار عمل سياقي معياري يستفيد من المنطق الذاتي لتقسيم النطاقات التشغيلية إلى مواقف وتحديث الضمانات الاحتمالية الخاصة بكل موقف، مما يمكّن مكونات تعلم الآلة ذات الصلة بالسلامة من استخلاص تقديرات المخاطر الإجمالية من بيانات ميدانية دون الاعتماد على نماذج إحصائية أحادية متجانسة غير كافية.

Benjamin Herd, Jessica Kelly, Mario Trapp2026-08-18
🤖 AI

Probabilistic Circuits as Reasoning Machines in Artificial Intelligence (Part I)

تُدافع هذه الجزئية الأولى من أطروحة التأهيل التراكمي عن الدوائر الاحتمالية كإطار عمل قابل للمعالجة للاستدلال والتعلم في الذكاء الاصطناعي تحت ظروف عدم اليقين، حيث تجمع بين عقد من الأبحاث حول نظرياتها التأسيسية، وخوارزميات التعلم الخاصة بها، وتطبيقاتها القابلة للتوسع، وتكاملها مع نماذج التعلم العميق والرمزي.

Robert Peharz2026-08-18
🤖 AI

Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents

تُثبت هذه الورقة أن السلوك الجماعي لأكثر من 10,000 وكيل ذكاء اصطنا-عي متفاعل عبر مجتمعات متنوعة يمكن التنبؤ به وتفسيره بدقة من خلال صياغة الميكانيكا الإحصائية، مما يكشف عن ثلاثة أنظمة ديناميكية متميزة (اللامبالاة، والاستقطاب، والإجماع) مدفوعة بميل الوكلاء لتقليل الضغط الاجتماعي.

Batu El, Jinhee Paeng, Fatih Dinc, Shiye Su, Mete Erdogan, Aneesh Pappu, Haotian Ye, Wanjia Zhao, Surya Ganguli, James Z (…)2026-08-18
🤖 machine learning

Degradation-Aligned Self-Supervised Learning for State of Health Estimation of Lithium-Ion Batteries under Label Sparsity

تقترح هذه الورقة إطار عمل للتعلم ذاتي الإشراف متوافق مع التدهور باستخدام نموذج CNN-GRU ومهمة تمهيدية لترتيب الدورة، وذلك لتمكين التقدير الدقيق والقوي لحالة صحة بطارية ليثيوم أيون حتى عند التدريب على بيانات مصنفة شحيحة للغاية وغير موزعة بانتظام.

Jiaqi Yao, Julia Kowal2026-08-18
🤖 AI

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

تُعد Palmyra x6 نموذجاً لغوياً وكيلياً موجهاً للمؤسسات، يحقق أداءً هو الأفضل في فئته على معايير استخدام الأدوات من خلال نهج تدريب لاحق محافظ ومنضبط باستخدام الضبط الدقيق الخاضع للإشراف والمثبّت على مجموعة بيانات مدمجة ومحققة.

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel2026-08-18
🤖 AI

A Shop Floor Production Scheduling Case based on RFID-supported Smart Factory

تقترح هذه الورقة إطار عمل لجدولة الإنتاج الديناميكي في أرضية المصنع لمصنع ذكي مدعوم بتقنية تحديد الهوية بموجات الراديو (RFID)، والذي يستفيد من البيانات الآنية لقياس حالات عدم اليقين التشغيلية ويستخدم نهج التعلم التعزيزي العميق، حيث أظهرت نتائج المحاكاة تفوقه على طرق التوزيع التقليدية مثل "الوارد أولاً يُصرف أولاً" (FIFO)، و"الوارد أخيراً يُصرف أولاً" (LIFO)، وخوارزمية (DQN) القياسية في تقليل زمن إنجاز العمل (makespan).

Zhihui Chen, Yize Sun, Yuhao Dong, Zeyu Xiao, Ray Y. Zhong2026-08-18
🤖 AI

When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness

تقدم هذه الورقة دراسة مقارنة عبر ستة معايير وأربعة نماذج تُظهر أنه في حين أن التفسيرات باللغة الطبيعية تعزز بشكل عام أداء التعلم داخل السياق، إلا أن فعاليتها تتباين بشكل كبير بناءً على مصدر التفسير (حيث تضاهي النماذج اللغوية الكبيرة الخارجية غالباً المبررات البشرية) واستراتيجية الاختيار، ولا سيما كشفها عن أن التصفية القائمة على الإخلاص تؤدي إلى نتائج غير متسقة وأن مقاييس الإخلاص المختلفة يمكن أن تؤدي إلى استنتاجات متباينة.

Mahdi Dhaini, Adam Dejl, Juraj Vladika, Volkan Özer, Barbara Plank, Gjergji Kasneci2026-08-18
🤖 machine learning

Toward Better Assessment of LLMs' Performance in Clinical Error Detection

تُظهر هذه الورقة أن المقاييس التجميعية القياسية مثل درجات F1 يمكن أن تكون مضللة في الكشف عن الأخطاء السريرية، حيث إنها غالبًا ما تحجب ضعف أداء التمييز الزوجي والتحيزات اللغوية في النماذج اللغوية الكبيرة، مما يستلزم اعتماد طرق تقييم زوجية من أجل تطبيقات سريرية أكثر أمانًا.

Yifan Zhang, Rahmatollah Beheshti2026-08-18
🤖 AI

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

تقدم هذه الورقة البحثية "Reconstruction" (إعادة البناء)، وهو معيار تقييم أعمى صُمم لاختبار ما إذا كان بإمكان النماذج اللغوية استعادة الأفكار البحثية الجوهرية للأوراق المنشورة باستخدام مراجعها السابقة للنشر فقط، مما يكشف أنه في حين تحقق النماذج الفردية نجاحًا متواضعًا، فإن خط إنتاج متعدد الوكلاء يجمع بين المراجعة عبر النماذج واختيار البطولة يحسن معدلات الاستعادة بشكل كبير لتصل إلى 23-42%.

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das2026-08-18