💻 computer science

MADP: A Multi-Agent Pipeline for Sustainable Document Processing with Human-in-the-Loop

تقدم الورقة البحثية MADP، وهو مسار متعدد الوكلاء يجمع بين التعلم العميق، والنماذج اللغوية الكبيرة، والتحقق من جانب العنصر البشري لتحقيق أتمتة بنسبة 97% ودقة بنسبة 98.5% في معالجة مستندات المؤسسات، مما أدى إلى خفض العمالة بنسبة 70% وانخفاض الأثر البيئي بنسبة 69% مقارنة بالطرق اليدوية التقليدية.

Diego Gosmar, Giovanni Zenezini2026-05-19
💻 computer science

When Bits Break Recourse: Counterfactual-Faithful Quantization

تقدم هذه الورقة البحثية طريقة "الكمية المتوافقة مع الواقع المضاد" (CFQ)، وهي طريقة تحافظ على استقرار التراجع القابل للتنفيذ في النماذج ذات البتات المنخفضة من خلال تحسين تخصيص البتات ومعلمات المكمم للحفاظ على صلاحية وتكلفة الواقع المضاد، مما يعالج نمط فشل حرج حيث يؤدي التكميم القياسي إلى تدهور التراجع رغم الحفاظ على الدقة التنبؤية.

Chaymae Yahyati, Ismail Lamaakal, Khalid El Makkaoui, Ibrahim Ouahbi2026-05-19
💻 computer science

Responsible Agentic AI Requires Explicit Provenance

تجادل هذه الورقة بأن إرساء أصلٍ صريح، وقابل للقياس، وقابل للتتبع عبر دورة حياة الذكاء الاصطناجي الوكيل الكاملة هو المتطلب الأساسي لجعل المسؤولية قابلة للحوسبة والتنفيذ، مما يعالج عجز الثقة الحالي الناجم عن عدم القدرة على تحديد المساءلة عن الأضرار في التكوينات الوكيلية المعقدة متعددة الأطراف.

Jinwei Hu, Xinmiao Huang, Qisong He, Youcheng Sun, Yi Dong, Xiaowei Huang2026-05-19
💻 computer science

OpenJarvis: Personal AI, On Personal Devices

يقدم OpenJarvis بنية ذكاء اصطناعي شخصي مفككة ومعرفة بالأنواع، تستفيد من البحث الموجه بنماذج اللغات الكبيرة (LLM) في المواصفات لتحسين خمسة عناصر أولية مستقلة، مما يمكّن الأنظمة التي تعمل على الأجهزة من مضاهاة دقة مستوى السحابة مع تقليل تكاليف واجهة برمجة التطبيقات وزمن الاستجابة بشكل جذري.

Jon Saad-Falcon, Avanika Narayan, Robby Manihani, Tanvir Bhathal, Herumb Shandilya, Hakki Orhun Akengin, Gabriel Bo, And (…)2026-05-19
💬 NLP

Why Do Safety Guardrails Degrade Across Languages?

تقدم هذه الورقة إطار عمل لنظرية الاستجابة للمفردات متعدد المجموعات لفك الارتباط وتحليل العوامل المتميزة التي تدفع تدهور السلامة في النماذج اللغوية الكبيرة عبر اللغات، كاشفةً أن إخفاقات السلامة هي في الأساس أحادية البعد، وغالباً ما تكون أكثر شدة في اللغة الإنجليزية منها في اللغات ذات الموارد المنخفضة، وتتأثر بشكل كبير بالفجوات العابرة للغات والخاصة بالنماذج التحفيزية والمتعلقة بالأذى الجسدي والتفاوتات الثقافية بدلاً من مجرد جودة الترجمة.

Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo2026-05-19
💻 computer science

CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning

تقدم الورقة البحثية CAREBench، وهو معيار مرجعي مبتكر قائم على نظرية التقييم يقيم فهم النماذج اللغوية الكبيرة للعواطف من خلال سلاسل الاستدلال المعرفي بدلاً من مجرد التنبؤ بالتسميات، مما يكشف أن النماذج الحالية تعاني في استدلال التقييم والتعرف على العواطف الإيجابية رغم مطابقتها للأداء البشري في مهام معينة.

Zhaoyue Sun, Hainiu Xu, Andero Uusberg, James J. Gross, Petr Slovak, Yulan He2026-05-19
💻 computer science

MusicSynth: An Automated Pipeline for Generating Violin Fingerboard Animations from Sheet Music Using Optical Music Recognition

إن MusicSynth هو خط معالجة مفتوح المصدر ويعمل عبر المتصفح، يقوم تلقائياً بتوليد دروس رسوم متحركة للوحة أصابع الكمان من صور النوتة الموسيقية أو الملفات الرقمية عبر دمج التعرف البصري على الموسيقى، وتحليل ملفات MusicXML، وجدول بحث مخصص للربط بين النوتة والموضع.

Abhimanyu Kaushik2026-05-19✓ Author reviewed
💻 computer science

CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

تقدم هذه الورقة CAM-Bench، وهو معيار مرجعي جديد للغة Lean 4 يضم 1,000 مسألة تمت صياغتها في الرياضيات الحسابية والتطبيقية، يعالج نقص التمثيل لهذه المجالات في التقييمات الحالية من خلال استخدام خط معالجة لاستعادة التبعية لتكييف تمارين الكتب المدرسية وتحليل أداء النماذج اللغوية الكبيرة في المهام التي تتطلب تتبع السياق المحلي وتطبيق النظريات الأولية.

Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen2026-05-19
⚡ electrical engineering

Latency-Aware Deep Learning Benchmark for Real-Time Cyber-Physical Attack and Fault Classification in Inverter-Dominated Power Grids

تقدم هذه الورقة إطار عمل لتقييم الأداء يراعي زمن الاستجابة، حيث يقوم بتقييم ثماني بنيات للتعلم العميق لتصنيف الأعطال والهجمات السيبرانية في الوقت الفعلي في الشبكات الكهربائية التي تهيمن عليها العواكس، كاشفةً أنه بينما تحقق النماذج أزمنة اتخاذ قرار في أقل من دورة واحدة، فإن زمن استجابة الاستدلال من البداية إلى النهاية (50-90 مللي ثانية) يتجاوز حالياً متطلبات درجة الحماية، مما يسلط الضوء على فجوة حرجة بين الأداء الخوارزمي والحلول العتادية القابلة للنشر.

Emad Abukhousa, Saman Zonouz, A. P. Sakis Meliopoulos2026-05-19
💻 computer science

State-of-the-Art Claims Require State-of-the-Art Evidence

تجادل هذه الورقة بأن الادعاءات المتعلقة بالوصول إلى "أحدث ما توصل إليه العلم" في أبحاث الذكاء الاصطناعي غالباً ما تفتقر إلى أدلة من الاختبارات المعيارية، حيث تعتمد التحسينات في الدرجات الإجمالية بشكل متكرر على القيم المتطرفة بدلاً من التفوق المستمر والقوي، مما يستوجب تقريراً أكثر صدقاً ودقة لأداء النماذج.

YongKyung Oh2026-05-19