🤖 AI

DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat

تقدم الورقة البحثية DungeonBench، وهو معيار شامل لتقييم التفكير التكتيكي في قتال "Dungeons & Dragons" يتحدى النماذج اللغوية الرائدة للتنقل عبر القواعد المعقدة، والهندسة، وإدارة الموارد عبر كل من المواجهات الفردية وأيام المواجهات المتعددة، مما يكشف عن فجوات كبيرة في قدرتها على الموازنة بين المزايا التكتيكية الفورية والاستدامة الاستراتيجية طويلة الأمد.

Ismayil Ismayilov, Atakan Kara, Kaan Oktay2026-08-03
💬 NLP

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

تقدم الورقة البحثية "FriendBench"، وهو معيار لقياس مدى القدرة على استنتاج الألفة الثنائية من مقاطع فيديو لكسر الجليد مدتها 20 ثانية، والتي كشفت أنه في حين تضاهي النماذج متعددة الوسائط الرائدة دقة البشر، إلا أنها تعتمد على إشارات مختلفة وتظهر انحيازاً لتصنيف الأزواج كغرباء، بينما يستفيد البشر بشكل فريد من الإشارات السلوكية المرئية التي تتجاوز الكلام.

Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin2026-08-03
🤖 machine learning

A Human-Centered Validation of the Explainability-Performance Coefficient

تقدم هذه الورقة درجة EPC، وهي مقياس غير مرتبط بنموذج محدد يحدد جودة التفسير من خلال الموازنة بين ندرة الميزات والحفاظ على الأداء، وتثبت فعاليتها عبر أنماط متعددة من البيانات من خلال إظهار توافقها القوي مع الفهم المتمحور حول الإنسان.

Christian Oliva, Luis F. Lago-Fernández2026-08-03
🤖 machine learning

CENDRe: Concept Extraction with Natural Domain Representations

تُعد CENDRe طريقة مبتكرة لاستخراج المفاهيم للشبكات العصبية الالتفافية (CNNs) تتغلب على القيود الحالية من خلال الاكتشاف التلقائي للعدد الأمثل لمفاهيم الزمن والتردد عبر التجميع الموجه بمعامل السيلويت والتحديد القائم على التدرج، مما يوفر أدلة قابلة للتفسير لمهام تصنيف السلاسل الزمنية الحرجة مثل تشخيص الأعطال.

Antonia Holzapfel, Andres Felipe Posada Moreno, Sebastian Trimpe2026-08-03
🤖 AI

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

تقدم هذه الورقة ExtractBench، وهو معيار شامل لتقييم استخراج المستندات في المؤسسات الموجه بالمخططات عبر 370 مستنداً و67 نوعاً، والذي يكشف أن LlamaExtract Agentic Plus يحقق دقة وتأصيلاً في أعلى مستوياتهما بتكلفة أقل بكثير مقارنة بوكلاء البرمجة.

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo2026-08-03
📊 statistics

MSGNN: A Spectral Graph Neural Network Based on a Novel Magnetic Signed Laplacian

تقدم هذه الورقة البحثية MSGNN، وهي بنية جديدة لشبكة عصبية رسومية طيفية تعتمد على مصفوفة لابلاسيان مغناطيسية مُوقعة جديدة تدمج بفعالية كلاً من المعلومات الموقعة والاتجاهية لتحقيق أداء رائد في مهام تجميع العقد وتنبؤ الروابط عبر مجموعات متنوعة من البيانات الواقعية والاصطناعية.

Yixuan He, Michael Permultter, Gesine Reinert, Mihai Cucuringu2026-07-31
🤖 AI

A Novel Skip Orthogonal List for Dynamic Optimal Transport Problem

تقترح هذه الورقة خوارزمية مبتكرة تستخدم قائمة "تخطي متعامدة" ثنائية الأبعاد وتقنيات الأشجار الديناميكية لتحديث خطط النقل الأمثل بكفاءة في السيناريوهات الديناميكية من خلال الاستفادة من طريقة السيمبلكس، مما يتفوق بشكل كبير على النهج الحالية التي تتطلب إعادة حساب كاملة.

Xiaoyang Xu, Hu Ding2026-07-31
💻 computer science

A Review on Building Blocks of Decentralized Artificial Intelligence

تقدم هذه الورقة مراجعة منهجية للأدبيات تشمل 71 دراسة لتحديد اللبنات الأساسية لحلول الذكاء الاصطناجعي اللامركزي (DEAI) من خلال تحليل من الأسفل إلى الأعلى، مع اقتراح توجهات بحثية مستقبلية ومعالجة المشكلات المفتوحة المتعلقة بالخصوصية والملكية والتحكم.

Vid Kersic, Muhamed Turkanovic2026-07-31
💬 NLP

LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints

تقدم هذه الورقة RealInstruct، وهو معيار لتقييم النماذج اللغوية الكبيرة على التعليمات الواقعية متعددة القيود، وتقترح DeCRIM، وهو مسار تصحيح ذاتي يُمكّن النماذج مفتوحة المصدر من التفوق على GPT-4 من خلال تفكيك التعليمات، ونقد الاستجابات، وتحسين المخرجات.

Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagy (…)2026-07-31
💬 NLP

Hallucinations and Truth: A Comprehensive Accuracy Evaluation of RAG, LoRA and DoRA

تقدم هذه الورقة تقييماً تجريبياً واسع النطاق لكل من RAG وLoRA وDoRA على 20,000 استعلام، مما يثبت أن DoRA يتفوق على كلتا الطريقتين في الدقة والارتباط وزمن الاستجابة لتطبيقات الذكاء الاصطنا_التوليدي المتخصصة في مجالات معينة.

Mohammad Baqar, Rajat Khanda2026-07-31