💬 NLP

LUMI: Unsupervised Intent Clustering with Multiple Pseudo-Labels

تقترح الورقة البحثية LUMI، وهي طريقة خالية من التدريب وخالية من الملصقات لتجميع النوايا غير الخاضعة للإشراف في البحث الحواري، والتي تُحسن الأساليب الحالية من خلال الاستفادة من ملصقات وهمية مشتركة متعددة لالتقاط درجات مستمرة من التشابه بين النصوص، مما يحقق أداءً هو الأفضل في فئته دون الحاجة إلى تقدير عدد المجموعات.

I-Fan Lin, Faegheh Hasibi, Suzan Verberne2026-02-26
💬 NLP

A Multi-faceted Analysis of Cognitive Abilities: Evaluating Prompt Methods with Large Language Models on the CONSORT Checklist

تقيم هذه الدراسة القدرات المعرفية ومعايرة اليقين للنماذج اللغوية الكبيرة العامة والمتخصصة في مجال معين عند تقييم الإبلاغ عن التجارب السريرية وفقًا لمعايير "كونسورت" (CONSORT)، مما يكشف عن ثقة مفرطة وعدم معايرة ملحوظين يسلطان الضوء على الحاجة الملحة لتحسين المعايرة والشفافية وهندسة الأوامر في الذكاء الاصطناي الطبي.

Sohyeon Jeon, Hyung-Chul Lee2026-02-26
💬 NLP

Robust Preference Alignment via Directional Neighborhood Consensus

تقدم هذه الورقة البحثية طريقة "اختيار التفضيل القوي" (RPS)، وهي طريقة لا تتطلب تدريباً وتُطبق في مرحلة ما بعد التدريب، تستفيد من إجماع الجوار الاتجاهي لعيننة واختيار الاستجابات المتفوقة، مما يساهم بفعالية في سد فجوة تغطية التفضيلات وتعزيز متانة النموذج عبر مختلف الاحتياجات البشرية دون الحاجة إلى إعادة التدريب.

Ruochen Mao, Yuling Shi, Xiaodong Gu, Jiaheng Wei2026-02-26
📊 statistics

A Proof of Learning Rate Transfer under μμP

تقدم هذه الورقة أول برهان نظري على أن μ\muP يتيح نقل معدل التعلم إلى الشبكات العصبية الخطية (MLPs) ذات العرض اللانهائي من خلال ضمان تقارب معدل التعلم الأمثل إلى ثابت غير صفري، وهي خاصية تفشل في ظل معلمات التقييس القياسية ومعلمات مماس الأعصاب (NTK).

Soufiane Hayou2026-02-26
💬 NLP

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

تقدم هذه الورقة البحثية "درجة شجرة عملية الاستدلال" (RPTS)، وهي مقياس ذو بنية شجرية لتقييم مدى دقة خطوات الاستدلال متعدد الوسائط، وتتحقق من صحتها من خلال معيار جديد (RPTS-Eval) يكشف عن أوجه القصور في النماذج اللغوية البصرية الكبيرة الحالية فيما يتعلق بالعلاقات بين الوسائط وعيوب الاستدلال التي تحجبها الإجابات الصحيحة.

Haofeng Wang, Yu Zhang2026-02-26
💬 NLP

Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

تقترح هذه الورقة إطار عمل SORL، الذي يقدم أخذ عينات الأهمية على مستوى الدور والتقييس المحفز بالقص لاستقرار التعلم المعزز خارج السياسة لوكلاء النماذج اللغوية الكبيرة ذوي الأفق الطويل، مما يمنع انهيار التدريب بفعالية ويحسن الأداء في المهام متعددة الأدوار من خلال خوارزميات SO-PPO وSO-GRPO الخاصة به.

Chenliang Li, Adel Elmahdy, Alex Boyd, Zhongruo Wang, Siliang Zeng, Alfredo Garcia, Parminder Bhatia, Taha Kass-Hout, Ca (…)2026-02-26
💬 NLP

Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models

تقدم هذه الورقة إطار تقييم مبتكر ثلاثي المستويات يسد الفجوة في تقييم الكفاءة الثقافية لنماذج الرؤية واللغة من خلال تشغيل المفاهيم النظرية الفنية عبر خمسة مستويات وستة تقاليد، كاشفةً أن النماذج الحالية تتفوق في الوصف البصري لكنها تتدهور بشكل كبير في التفسير الثقافي مع إظهار انحياز غربي.

Haorui Yu, Xuehang Wen, Fengrui Zhang, Qiufeng Yi2026-02-26
💬 NLP

VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding

تقدم هذه الورقة VULCA-Bench، وهو معيار مرجعي متعدد الثقافات للرؤية واللغة يضم 7,410 زوجًا ثنائي اللغة من الصور والنقد عبر ثمانية تقاليد ثقافية وإطار تقييم خماسي الطبقات لتقييم وكشف قصور النماذج الحالية في الفهم الثقافي رفيع المستوى بما يتجاوز الإدراك البصري الأساسي.

Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi2026-02-26
💬 NLP

HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue

تقدم الورقة البحثية HEART، وهو معيار موحد يقارن بشكل مباشر بين البشر والنماذج اللغوية الكبيرة في حوارات الدعم العاطفي باستخدام مقياس قائم على أسس علمية، ويكشف أن النماذج الرائدة تقترب من المستويات البشرية في التعاطف والاتساق، بينما لا يزال البشر يتفوقون في إعادة الصياغة التكيفية وتحولات النبرة الدقيقة، كل ذلك مع إظهار توافق قوي بين معايير التقييم البشرية والآلية.

Laya Iyer, Kriti Aggarwal, Sanmi Koyejo, Gail Heyman, Desmond C. Ong, Subhabrata Mukherjee2026-02-26
💬 NLP

Embodied Task Planning via Graph-Informed Action Generation with Large Language Model

تقترح الورقة البحثية إطار عمل GiG، وهو إطار عمل جديد لتخطيط المهام المتجسدة يجمع بين الشبكات العصبية الرسومية لهيكلة ذاكرة الخبرة ووحدة استشراف محدودة لتعزيز الاستدلال طويل المدى والتفوق بشكل كبير على النماذج المرجعية الحالية في عدة معايير قياسية.

Xiang Li, Ning Yan, Masood Mortazavi2026-02-26