🤖 AI

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

تقدم هذه الورقة FinProBench، وهو معيار لتقييم وكلاء الذكاء الاصطناعي المالي، وبناء المعايير القائم على الدور (RGRC)، وهو مسار عمل يستمد معايير التقييم من المخرجات المهنية لالتقاط المعايير الضمنية بفعالية والتفوق بشكل كبير على الأساليب القائمة على التلقين في المهام المالية المتخصصة في الأدوار.

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang2026-08-06
🤖 machine learning

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

تقدم الورقة البحثية SpecDrop، وهي آلية توجيه خالية من المعلمات تُظهر أن مكاسب الأداء في بنيات "خليط الخبراء" (Mixture-of-Experts) تنبع أساساً من مواءمة دقة إشارة التدريب مع الفئات المستهدفة بدلاً من خوارزميات التوجيه المتعلمة، كما يتضح من نجاحها في مهام التصنيف دقيق التفاصيل وفشلها في التفوق على النماذج المرجعية في البيانات الضبابية متعددة الفئات.

Boyao Wang, Zhihan Lei2026-08-06
🤖 AI

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

تقدم الورقة البحثية FinPerMA، وهو معيار مرجعي مستند إلى نظرية يستخدم مسارات المستثمرين الطولية المجمدة لتقييم قدرة وكلاء النماذج اللغوية الكبيرة على الحفاظ على الذاكرة الشخصية، مما يكشف أن النماذج الرائدة الحالية وتكوينات الذاكرة تعاني بشكل كبير من التكيف مع التفضيلات المدفوعة بالأحداث وغالباً ما تفشل في التفوق على طرق الاسترجاع البسيطة.

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang2026-08-06
🤖 machine learning

Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap

تُبين هذه الورقة أن سقف عدد الرموز المخرجة (output-tokens) الثابت يعمل كمتغير تجريبي خفي يؤدي إلى تضخيم أو عكس فجوات الاستدلال متعدد اللغات المقاسة بشكل مصطنع، وتجادل بأن التقييمات يجب أن تبلغ عن الدقة عبر طيف من ميزانيات المخرجات بدلاً من الاكتفاء بسقف واحد للتمييز بين العجز الحقيقي في الاستدلال وبين آثار الاقتطاع.

Ankit Goyal, Jaideep Ray2026-08-06
💬 NLP

Test, then Route: How Language Models Execute In-Context Conditional Rules Across Models and Languages

تُثبت هذه الورقة، من خلال الترقيع التنشيطي (activation patching)، أنه بينما تقوم النماذج اللغوية بتشفير قيم صدق المحمول الشرطي بشكل معياري في نطاق متبقٍ متوسط الطبقات، فإن آلية توجيه الإجابات بناءً على هذه الشروط ليست وحدة مجردة وقابلة للنقل، بل هي عملية مرتبطة بالرموز (token-bound) ومحددة بالأزواج تختلف باختلاف النماذج واللغات.

Luxshan Thavarasa, Sivasuthan Sukumar2026-08-06
🤖 AI

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

تقدم هذه الورقة ACT-Eval، وهو إطار تقييم معزز بالأدوات يقوم بتفكيك التعليق على الشطرنج إلى ادعاءات ذرية لتقييم الصحة الواقعية والتغطية الاستراتيجية، كاشفاً أنه بينما يقلل دمج الأدوات من الهلوسة في النماذج اللغوية الكبيرة، لا تزال هناك فجوات كبيرة في التفسير الاستراتيجي على مستوى الخبراء عبر كل من النماذج المملوكة والنماذج مفتوحة الأوزان.

S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath2026-08-06
💬 NLP

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

تقدم هذه الورقة البحثية SIGNPOST-Bench، وهو معيار مرجعي مضاد للواقع ومنضبط يتكون من 25,555 متغيراً صورياً لتقييم كيفية حل النماذج اللغوية الكبيرة متعددة الوسائط للتعارضات بين الإشارات البصرية والنصية، مما يكشف أن التدخلات النصية العدائية تضعف دقة تحديد الموقع الجغرافي بشكل كبير وتكشف عن سلوكيات تحكيم متميزة عبر 20 نموذجاً تم تقييمها.

Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang2026-08-06
💬 NLP

The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

تحدد هذه الورقة وتبرهن على ظاهرة "انهيار العدالة"، وهي ظاهرة تظهر في النماذج اللغوية المدربة على بيانات اصطناعية، حيث تضخم التحيزات الاجتماعية وتتدهور مقاييس العدالة لديها بشكل ملحوظ في وقت أبكر بكثير من تراجع أدائها في مهام النمذجة اللغوية القياسية.

Irina Proskurina, Antoine Gourru, Julien Velcin2026-08-06
🤖 machine learning

Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks

تقدم هذه الورقة إطار عمل يستخدم هجمات عدائية متكافئة دلالياً لتوضيح أن النماذج اللغوية الكبيرة ذات الحالة المتطورة لا تزال عرضة بشدة للهلوسة الجوهرية، حيث تؤدي اضطرابات الاستعلام التي تحافظ على المعنى إلى تدهور قدرتها بشكل كبير على الاستخدام الأمين للأدلة المسترجعة.

Atri Vivek Sharma, Brian Formento, Alessio Lomuscio2026-08-06
💬 NLP

Searching for Sound-Meaning Collisions: Graph-Based Affordance Retrieval and Multi-Evaluator Ranking for Pun Translation at CLEF 2026 JOKER Task 2

تقدم هذه الورقة نظاماً قائماً على الرسوم البيانية للاسترجاع والترتيب متعدد المقيمين لترجمة التورية، والذي يثبت نظرياً نظرية "لو" (Low) من خلال إظهار أن الترجمة الناجحة تعتمد على اكتشاف تصادمات صوتية-معنوية جديدة في اللغة الهدف بدلاً من الحفاظ على كلمات المصدر، مع تحديد الاسترجاع كعقبة رئيسية حالية.

Russell Taylor, Adam Brikman, Prateek Awate2026-08-06