💬 NLP

Reward Is Enough: LLMs Are In-Context Reinforcement Learners

تُظهر هذه الورقة أن النماذج اللغوية الكبيرة يمكنها أداء التعلم التعزيزي داخل السياق أثناء الاستدلال من خلال تحسين استجاباتها بشكل تكراري بناءً على إشارات المكافأة المتراكمة، مما يؤدي إلى تحسينات كبيرة في الأداء عبر مهام متنوعة دون الحاجة إلى تدريب إضافي.

Kefan Song, Amir Moeini, Peng Wang, Lei Gong, Rohan Chandra, Shangtong Zhang, Yanjun Qi2026-03-26
💬 NLP

From Guidelines to Guarantees: A Graph-Based Evaluation Harness for Domain-Specific Evaluation of LLMs

تقدم هذه الورقة نظام تقييم قائمًا على الرسوم البيانية يقوم بتوليد معايير مرجعية مقاومة للتلوث ومستندة إلى أسس سريرية بشكل ديناميكي من إرشادات مهيكلة، مما يكشف عن فجوات منهجية في قدرات النماذج اللغوية فيما يتعلق ببروتوكولات العلاج وقرارات الإدارة السريرية.

Jessica M. Lundin, Usman Nasir Nakakana, Guillaume Chabot-Couture2026-03-26
💬 NLP

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

تقدم هذه الورقة البحثية نموذج "Text-to-Talk" (TtT)، وهو نموذج صوتي-لغوي موحد يجمع بين توليد النصوص التوليدي الذاتي وتوليد الصوت بالانتشار غير التوليدي الذاتي ضمن محول (Transformer) واحد باستخدام انتباه مدرك للنمط واستراتيجيات تدريب متخصصة للتفوق على النماذج المرجعية التوليدية الذاتية وغير التوليدية الذاتية الحالية عبر معايير متعددة للنصوص والكلام.

Tianqiao Liu, Xueyi Li, Hao Wang, Haoxuan Li, Zhichao Chen, Weiqi Luo, Zitao Liu2026-03-26
💬 NLP

Quantification and object perception in Multimodal Large Language Models and human linguistic cognition

تستقصي هذه الورقة البحثية كيفية ترميز النماذج اللغوية الكبيرة متعددة الوسائط لسمات التكميم الشبيهة بالبشر — وتحديداً مقاييس المكممات، والنموذجية، وتحيزات الأعداد التقريبية — كاشفةً أنه في حين تتفوق نماذج "التفكير" في تقدير العدد والمقياس، إلا أنها لا تزال تتباعد بشكل كبير عن الإدراك البشري في نطاقات الاستخدام والنموذجية عبر مختلف اللغات وأنواع النماذج.

Raquel Montero, Natalia Moskvina, Paolo Morosi, Tamara Serrano, Elena Pagliarini, Evelina Leivada2026-03-26
💬 NLP

Collaborative Causal Sensemaking: Closing the Complementarity Gap in Human-AI Decision Support

تقترح هذه الورقة "الإدراك السببي التعاوني" (CCS) كأجندة بحثية لسد فجوة التكامل بين الإنسان والذكاء الاصطناعي عبر تحويل تطوير الذكاء الاصطناعي من محركات للإجابات إلى شركاء يشاركون في استنباط البنى السببية، وإظهار أوجه عدم اليقين، وتكييف الأهداف جنباً إلى جنب مع الخبراء البشر في اتخاذ القرارات عالية المخاطر.

Raunak Jain2026-03-26
💬 NLP

ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

تقدم هذه الورقة البحثية "ChartAttack"، وهو إطار عمل يكشف عن الثغرات الأمنية في النماذج اللغوية الكبيرة متعددة الوسائط من خلال حقن عناصر تصميم مضللة في إنشاء الرسوم البيانية، وتقدم مجموعة بيانات "AttackViz" لتقييم هذه المخاطر وإثبات أن الضبط الدقيق يمكن أن يحسن بشكل كبير من متانة النموذج ضد مثل هذا التحفيز الخبيث.

Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta, Iryna Gurevych2026-03-26
💬 NLP

From Sycophancy to Sensemaking: Premise Governance for Human-AI Decision Making

تقترح هذه الورقة تحويل عملية اتخاذ القرار بين الإنسان والذكاء الاصطناعي من توليد الإجابات المتملقة إلى إطار عمل "حوكمة المقدمات" المهيكل، والذي يستخدم حلقات تحكم قائمة على التباين وبوابات الالتزام لضمان تعاون موثوق وقابل للتدقيق في البيئات عالية المخاطر وغير اليقينية.

Raunak Jain2026-03-26
💬 NLP

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

تقدم الورقة البحثية Agent-Diff، وهو إطار عمل مرجعي مبتكر لتقييم النماذج اللغوية الكبيرة الوكيلة (agentic LLMs) في مهام واجهة برمجة التطبيقات (API) الواقعية للمؤسسات، وذلك عبر الجمع بين بيئات تجريبية (sandboxes) معزولة ومحتواة لواجهات برمجة التطبيقات وبين مقياس تقييم يعتمد على فرق الحالة (state-diff) لتقدير نجاح المهمة من خلال التغيرات في حالة البيئة بدلاً من مطابقة المسار.

Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson2026-03-26
💬 NLP

Team of Thoughts: Efficient Test-time Scaling of Agentic Systems through Orchestrated Tool Calling

تقدم الورقة البحثية "فريق الأفكار" (Team-of-Thoughts)، وهو إطار عمل متعدد الوكلاء غير متجانس يستفيد من معايرة المنسق والتقييم الذاتي للوكيل لاختيار نماذج متخصصة كأدوات بشكل ديناميكي، مما يتفوق بشكل كبير على الأنظمة المتجانسة الحالية في معايير الاستدلال الرياضي وتوليد الكود البرمجي.

Jeffrey T. H. Wong, Zixi Zhang, Junyi Liu, Yiren Zhao2026-03-26
💬 NLP

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

تقدم هذه الورقة نماذج لغوية تعتمد على انتشار الحذف والإدراج (DID)، والتي تستبدل نموذج إخفاء الرموز (token masking) بعمليات حذف وإدراج دقيقة لتحقيق كفاءة حوسبية فائقة، ودعم أصيل للأطوال المتغيرة، وقدرات تصحيح ذاتي جوهرية مقارنة بنماذج الانتشار اللغوية القائمة على الإخفاء.

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jia (…)2026-03-26