🤖 AI

Why Specialist Models Still Matter: A Heterogeneous Multi-Agent Paradigm for Medical Artificial Intelligence

تقترح هذه الورقة البحثية HetMedAgent، وهو إطار عمل متعدد الوكلاء غير متجانس ينظم التعاون بين النماذج اللغوية الكبيرة العامة، والنماذج المتخصصة في مجالات محددة، والأطباء، لإثبات أن النماذج المتخصصة تظل لا غنى عنها لتحقيق اتخاذ قرارات طبية فائقة من خلال دمج الأدلة والإدارة التكيفية لعدم اليقين.

Yanan Wang, Shuaicong Hu, Jian Liu, Guohui Zhou, Aiguo Wang, Cuiwei Yang2026-05-29
💻 computer science

DySem: Uncovering Dynamic Semantic Components via Multilingual Consensus for Calculating Semantic Textual Similarity

يُعد DySem إطار عمل مبتكرًا لا يتطلب تدريبًا، يعمل على تحسين التشابه النصي الدلالي من خلال تحديد مكونات دلالية ديناميكية خاصة بكل عينة داخل النماذج اللغوية الكبيرة عبر الإجماع متعدد اللغات، وبذلك يتغلب على قيود استخدام التمثيلات ثابتة الأبعاد وعالية الأبعاد للطبقة الأخيرة.

Kaijie Zheng, Weiqin Wang, Yile Wang, Hui Huang2026-05-29
🤖 machine learning

Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

تتناول هذه الورقة تحدي عدم دقة تقدير قيمة الحالة في التعلم التعزيزي للنماذج اللغوية الكبيرة من خلال تقديم معيار تقدير قيمة الحالة (SVEB) واقتراح تقنيتين جديدتين، Numca وHista، اللتين تعملان على تحسين استقرار الأداء وكفاءته بشكل كبير دون إضافة عبء حوسبي كبير.

Zizhe Chen, Jiqian Dong, Yizhou Tian, Garry Yang, Yongqiang Chen, Zhitang Chen, James Cheng2026-05-29
💻 computer science

ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation

تقدم الورقة البحثية ActTraitBench، وهو إطار عمل قائم على العنصر البشري يحدد كمياً فجوة "المعرفة-القرار" المنتشرة في النماذج اللغوية الكبيرة حيث غالباً ما تتباين النماذج القادرة في القرارات السلوكية رغم اتساق تقاريرها الذاتية، وتقترح "سلسلة المحاذاة المعرفية" (CoCA) للتخفيف من حدة هذا التباين.

Yutong Yang, Chenxi Miao, Weikang Li, Yunfang Wu2026-05-29
🤖 AI

SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

تقدم هذه الورقة البحثية إطار عمل SAAS، وهو إطار تعلم تعزيزي ذاتي الوعي يخفف من حدة الإفراط في البحث في أنظمة البحث الوكيلية عبر النمذجة الديناميكية لحدود المعرفة وتطبيق التحسين المرحلي لتقليل التكاليف الحسابية دون التضحية بالدقة.

Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang Zhang, Jinsong Su2026-05-29
🤖 machine learning

Data filtering methods for training language models

تقدم هذه الورقة تحليلاً مقارناً بين التعلم الواثق (Confident Learning) ورسم خرائط مجموعة البيانات (Dataset Cartography) للكشف عن أخطاء التصنيف في مجموعات بيانات تصنيف النصوص الروسية، مما يوضح أنه بينما يتفوق كلا الأسلوبين على الإزالة العشوائية، فإن فعاليتهما في تحسين أداء النموذج تعتمد بشكل كبير على حجم مجموعة البيانات ومستويات الضجيج، حيث يحقق التعلم الواثق مكاسب كبيرة في مجموعات البيانات الصغيرة والمشوبة بالضجيج.

Egor Shevchenko, Elena Bruches2026-05-29
🤖 AI

PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing

تقدم هذه الورقة PRAIB، وهو إطار عمل مرجعي مبتكر ودراسة تجريبية واسعة النطاق تحلل 11,000 مراجعة مُنشأة آلياً مقابل ملاحظات بشرية للكشف عن تباينات سلوكية جوهرية — مثل الانحياز الإيجابي، والثقة المفرطة، وإغفال نقاط الضعف الذرية — مما يوفر أداة تشخيصية لتحديد الموثوقية الحالية والقيود التي تواجهها النماذج اللغوية الكبيرة في عملية مراجعة الأقران.

Krzysztof Żurawicki, Julia Farganus, Arkadiusz Gaweł, Mateusz Bystroński, Tomasz Jan Kajdanowicz2026-05-29
🤖 AI

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

تقدم هذه الورقة إطار عمل \textsc{Ptah}، وهو إطار عمل متعدد الوكلاء ينظم التخطيط، وجمع الأدلة مع ذاكرة عمل بصرية، وتوليد التقارير بفرض التحقق لإنتاج تقارير بحث عميق متعددة الوسائط موثوقة، ومخلصة للاقتباسات، ومتداخلة بصرياً.

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Zhicheng Dou2026-05-29
💻 computer science

ExCAM: Explainable Cultural Awareness Metrics

تقدم هذه الورقة ExCAM، وهو أول مقياس مخصص لتحديد وتقييم وتفسير الأخطاء الثقافية في مخرجات النماذج اللغوية الكبيرة، إلى جانب مجموعة بيانات ExCAM40k، محققةً دقة تصل إلى 80% في اكتشاف عدم الدقة الثقافية مقارنة بالنماذج المرجعية الحالية.

Christoph Leiter, Haiyue Song, Hour Kaing, Jin Tei, Hideki Tanaka, Masao Utiyama, Steffen Eger2026-05-29
🤖 machine learning

Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents

يقدم هذا البحث إطار عمل PlanAhead لبيان تجريبي أن كلاً من اختيار تمثيل خطة اللغة الطبيعية (مثل الأهداف الفرعية المتسلسلة، أو السرد، أو الكود الزائف، أو قائمة التحقق) والنموذج اللغوي الكبير الأساسي يؤثران بشكل كبير على متانة ومعدلات نجاح الوكلاء الويب متعددي الوسائط في مهام WebArena الصعبة.

Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim2026-05-29