🤖 AI

The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation

تقدم هذه الورقة RiDiC، وهو مجموعة بيانات متعددة اللغات وقابلة للضبط تضم 3,000 كيان عبر مستويات شعبية متفاوتة، مصممة لتقييم وكشف الهلوسة في توليد الحقائق طويلة التنسيق بواسطة النماذج اللغوية الكبيرة الرائدة.

Pavel Braslavski, Dmitrii Iarosh, Nikita Sushko, Andrey Sakhovskiy, Vasily Konovalov, Elena Tutubalina, Alexander Panche (…)2026-04-02
🤖 AI

How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models

تكشف هذه الدراسة، من خلال محاكاة متعددة الوكلاء عبر أربعة نماذج لغوية، أن معالجة التعليمات الأخلاقية تتباين باختلاف القدرة والنمط الخاص بكل نموذج، حيث حددت أربعة أنواع متميزة للمعالجة الأخلاقية وأثبتت أن الامتثال اللفظي لتعليمات السلامة لا يعكس بالضرورة مداولة أخلاقية داخلية حقيقية.

Hiroki Fukui2026-04-02
🤖 AI

Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce

تُظهر هذه الدراسة أن صلاحية المعيار لتقييمات "النموذج اللغوي الكبير كحَكَم" (LLM-as-Judge) في مجال التجارة الحوارية تعتمد على التباين النوعي للأبعاد، حيث يكشف البحث أن معايير التقييم ذات الأوزان المتساوية تضعف القوة التنبؤية، بينما يؤدي إعادة توزيع الأوزان بناءً على نتائج الأعمال المتحقق منها ومعالجة المتغيرات المربكة المتعلقة بنوع الوكيل إلى تحسين الارتباط بشكل كبير بين درجات جودة الحوار ومعدلات التحويل.

Liang Chen, Qi Liu, Wenhuan Lin, Feng Liang2026-04-02
🤖 AI

WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics

تقدم الورقة البحثية WHBench، وهو معيار مرجعي متخصص يتكون من 47 سيناريو صاغها خبراء عبر 10 موضوعات في صحة المرأة، والذي يقيم 22 نموذجاً لغوياً كبيراً من النماذج الرائدة ويكشف أن حتى أفضل النماذج أداءً تفشل في تجاوز دقة قدرها 72.1%، مما يسلط الض الضوء على فجوات كبيرة في السلامة السريرية والعدالة والالتزام بالإرشادات التوجيهية التي تستوجتن إشرافاً من الخبراء قبل النشر.

Sneha Maurya, Pragya Saboo, Girish Kumar2026-04-02
🤖 AI

Brevity Constraints Reverse Performance Hierarchies in Language Models

تكشف هذه الورقة أن تقييد النماذج اللغوية الكبيرة لإنتاج استجابات موجزة يعكس التراتبية في الأداء عبر القضاء على أخطاء الإطناب المرتبطة بالحجم، مما يطلق القدرات الكامنة المتفوقة في الاستدلال الرياضي والعلمي التي تحجبها بروتوكولات التقييم القياسية.

MD Azizul Hakim2026-04-02
🤖 AI

"Who Am I, and Who Else Is Here?" Behavioral Differentiation Without Role Assignment in Multi-Agent LLM Systems

تُظهر هذه الدراسة أن أنظمة النماذج اللغوية الكبيرة متعددة الوكلاء غير المتجانسة تطور تلقائياً أدواراً اجتماعية متباينة وسلوكيات تعويضية من خلال التفاعلات المهيكلة، بينما يحدث التقارب السلوكي عندما يكون الوكلاء معزولين، أو متجانسين، أو محددين صراحةً بأسماء نماذجهم الحقيقية.

Houssam EL Kandoussi2026-04-02
🤖 AI

Terminal Agents Suffice for Enterprise Automation

تجادل الورقة البحثية بأن وكلاء البرمجة البسيطين القائمين على الطرفية، والذين يتفاعلون مباشرة مع واجهات برمجة تطبيقات المنصات عبر نظام الملفات، كافون لمضاهاة أو التفوق على الوكلاء الأكثر تعقيداً المعززين بالأدوات أو القائمين على الويب في مهام أتمتة المؤسسات المتنوعة.

Patrice Bechard, Orlando Marquez Ayala, Emily Chen, Jordan Skelton, Sagar Davasam, Srinivas Sunkara, Vikas Yadav, Sai Ra (…)2026-04-02
🤖 machine learning

ParetoBandit: Budget-Paced Adaptive Routing for Non-Stationary LLM Serving

يُعد ParetoBandit نظام توجيه تكيفي مفتوح المصدر لخدمة النماذج اللغوية الكبيرة غير المستقرة، والذي يستخدم خوارزميات "بانديت" سياقية واعية بالتكلفة مع تنظيم وتيرة ثنائي أولي عبر الإنترنت ونسيان هندسي لفرض ميزانيات مقومة بالدولار ديناميكيًا، مع التكيف السريع مع تغيرات أسعار وجودة النماذج أو دمج نماذج جديدة أثناء وقت التشغيل بأقل زمن انتقال ممكن.

Annette Taberner-Miller2026-04-02
🤖 AI

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

يُعد REM-CTX نظاماً آلياً لمراجعة النظراء يعتمد على التعلم المعزز، حيث يستفيد من تحسين السياسة النسبية للمجموعة ودوال مكافأة مدركة للمراسلات لدمج سياق إضافي مثل الأشكال والإشارات الخارجية، محققاً جودة مراجعة وتأصيلاً سياقياً متفوقاً مقارنة بكل من النماذج التجارية الأكبر والنماذج المرجعية الأخرى عبر تخصصات علمية متعددة.

Pawin Taechoyotin, Daniel E. Acuna2026-04-02
📊 statistics

Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning

يُعد Agent Q-Mix إطار عمل للتعلم التعزيزي يعمل على تحسين التنسيق بين الوكلاء المتعددين عبر تعلم طوبولوجيا الاتصال اللامركزي من خلال تحليل قيمة QMIX، محققاً دقة وكفاءة في الرموز ومتانة فائقة عبر مختلف معايير الاستدلال والبرمجة مقارنة بالأساليب الحالية.

Eric Hanchen Jiang, Levina Li, Rui Sun, Xiao Liang, Yubei Li, Yuchen Wu, Haozheng Luo, Hengli Li, Zhi Zhang, Zhaolu Kang (…)2026-04-02