💻 computer science

CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning

تقدم الورقة البحثية CAREBench، وهو معيار مرجعي مبتكر قائم على نظرية التقييم يقيم فهم النماذج اللغوية الكبيرة للعواطف من خلال سلاسل الاستدلال المعرفي بدلاً من مجرد التنبؤ بالتسميات، مما يكشف أن النماذج الحالية تعاني في استدلال التقييم والتعرف على العواطف الإيجابية رغم مطابقتها للأداء البشري في مهام معينة.

Zhaoyue Sun, Hainiu Xu, Andero Uusberg, James J. Gross, Petr Slovak, Yulan He2026-05-19
💻 computer science

MusicSynth: An Automated Pipeline for Generating Violin Fingerboard Animations from Sheet Music Using Optical Music Recognition

إن MusicSynth هو خط معالجة مفتوح المصدر ويعمل عبر المتصفح، يقوم تلقائياً بتوليد دروس رسوم متحركة للوحة أصابع الكمان من صور النوتة الموسيقية أو الملفات الرقمية عبر دمج التعرف البصري على الموسيقى، وتحليل ملفات MusicXML، وجدول بحث مخصص للربط بين النوتة والموضع.

Abhimanyu Kaushik2026-05-19✓ Author reviewed
💻 computer science

CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

تقدم هذه الورقة CAM-Bench، وهو معيار مرجعي جديد للغة Lean 4 يضم 1,000 مسألة تمت صياغتها في الرياضيات الحسابية والتطبيقية، يعالج نقص التمثيل لهذه المجالات في التقييمات الحالية من خلال استخدام خط معالجة لاستعادة التبعية لتكييف تمارين الكتب المدرسية وتحليل أداء النماذج اللغوية الكبيرة في المهام التي تتطلب تتبع السياق المحلي وتطبيق النظريات الأولية.

Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen2026-05-19
⚡ electrical engineering

Latency-Aware Deep Learning Benchmark for Real-Time Cyber-Physical Attack and Fault Classification in Inverter-Dominated Power Grids

تقدم هذه الورقة إطار عمل لتقييم الأداء يراعي زمن الاستجابة، حيث يقوم بتقييم ثماني بنيات للتعلم العميق لتصنيف الأعطال والهجمات السيبرانية في الوقت الفعلي في الشبكات الكهربائية التي تهيمن عليها العواكس، كاشفةً أنه بينما تحقق النماذج أزمنة اتخاذ قرار في أقل من دورة واحدة، فإن زمن استجابة الاستدلال من البداية إلى النهاية (50-90 مللي ثانية) يتجاوز حالياً متطلبات درجة الحماية، مما يسلط الضوء على فجوة حرجة بين الأداء الخوارزمي والحلول العتادية القابلة للنشر.

Emad Abukhousa, Saman Zonouz, A. P. Sakis Meliopoulos2026-05-19
💻 computer science

State-of-the-Art Claims Require State-of-the-Art Evidence

تجادل هذه الورقة بأن الادعاءات المتعلقة بالوصول إلى "أحدث ما توصل إليه العلم" في أبحاث الذكاء الاصطناعي غالباً ما تفتقر إلى أدلة من الاختبارات المعيارية، حيث تعتمد التحسينات في الدرجات الإجمالية بشكل متكرر على القيم المتطرفة بدلاً من التفوق المستمر والقوي، مما يستوجب تقريراً أكثر صدقاً ودقة لأداء النماذج.

YongKyung Oh2026-05-19
💻 computer science

How Do Electrocardiogram Models Scale?

تستقصي هذه الورقة بشكل منهجي قوانين القياس لنماذج تخطيط كهربائية القلب (ECG) من خلال تدريب 120 نموذجاً عبر أحجام ونماذج معرفية متنوعة، كاشفةً أنه في حين يوفر التعلم الخاضع للإشراف الذاتي كفاءة فائقة في البيانات والنقل، فإن المسار الأمثل للوصول إلى نماذج تأسيسية فعالة لتخطيط كهربائية القلب يعتمد على المواءمة الاستراتيجية بين البنية (ResNet مقابل Transformer) ونموذج ما قبل التدريب بدلاً من الاعتماد فقط على التوسع بالقوة الغاشمة.

Jiawei Li, Fabio Bonassi, Ming Jin, Stefan Gustafsson, Johan Sundström, Thomas B. Schön, Antônio H. Ribeiro2026-05-19
💻 computer science

A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation

تقدم هذه الورقة A2RBench، وهو مسار مؤتمت لإنشاء اختبارات قياس للاستدلال التجريدي قابلة للتحقق رسميًا باستخدام اتساق الدورة لضمان الحلول الفريدة، مما يكشف أن النماذج اللغوية الكبيرة الحالية تقصر بشكل كبير عن البشر في الاستدلال التجريدي وتواجه صعوبة في المهام عالية الأبعاد.

Qingchuan Ma, Yuexiao Ma, Yongkang Xie, Tianyu Xie, Xiawu Zheng, Rongrong Ji2026-05-19
💻 computer science

Rover: Context-aware Conflict Resolution with LLM

يُعد Rover نظاماً مبتكراً لحل النزاعات يعمل على تعزيز النماذج اللغوية الكبيرة من خلال دمج تحليل البرامج مع مخطط خصائص الكود متعدد الطبقات لتوليد مطالبات مدركة للسياق، مما يجعله يتفوق على الأدوات الحالية في حل نزاعات دمج الكود المعقدة بدقة.

Qingyu Zhang, Junzhe Li, Jiayi Lin, Changhua Luo, Chenxiong Qian2026-05-19
💻 computer science

ContractBench: Can LLM Agents Preserve Observation Contracts?

تقدم هذه الورقة البحثية ContractBench، وهو معيار حتمي يكشف أن وكلاء النماذج اللغوية الكبيرة المتطورة حالياً يفشلون تكراراً في الحفاظ على الصلاحية الزمنية وسلامة مستوى البايت لعقود الملاحظة (مثل رموز الجلسات وعناوين URL)، وهي قدرة لا تتوسع بشكل رتيب مع حجم النموذج وتتطلب تدريباً خاصاً واعياً بالفشل لتحسينها.

Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen2026-05-19
💬 NLP

OProver: A Unified Framework for Agentic Formal Theorem Proving

يُعد OProver إطار عمل موحداً لإثبات النظريات الصورية الوكيلية في لغة Lean 4، حيث يدمج المراجعة التكرارية للإثبات مع تغذية المترجم الراجعة والاسترجاع، محققاً أداءً هو الأفضل حالياً عبر عدة معايير من خلال مسار تدريب مبتكر يجمع بين التدريب المسبق المستمر، والضبط الدقيق الخاضع للإشراف على مسارات الإصلاح، والتعلم المعزز على الحالات الصعبة.

David Ma, Kaijing Ma, Shawn Guo, Yunfeng Shi, Enduo Zhao, Jiajun Shi, Zhaoxiang Zhang, Gavin Cheung, Jiaheng Liu, Zili W (…)2026-05-19