💬 NLP

Beyond Accuracy: Risk-Sensitive Evaluation of Hallucinated Medical Advice

تقترح هذه الورقة إطار تقييم حساس للمخاطر ينقل التركيز من الصحة الواقعية إلى الضرر المحتمل للنصائح الطبية المهلوسة عبر قياس اللغة الحاملة للمخاطر، مما يكشف أن المقاييس القياسية تفشل في رصد الفروق الجوهرية المتعلقة بالسلامة بين النماذج.

Savan Doshi2026-03-02
💬 NLP

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

تقدم هذه الورقة HLE-Verified، وهي نسخة مراجعة ومنقحة بشكل منهجي من معيار Humanity's Last Exam، تستخدم سير عمل ثنائي المرحلة للتحقق والإصلاح من قبل الخبراء للقضاء على العناصر المشوشة، مما يؤدي إلى تحسين دقة وموثوقية تقييمات النماذج اللغوية الرائدة بشكل كبير.

Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li (…)2026-03-02
💬 NLP

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

تقدم هذه الورقة نظام "Open Rubric System" (OpenRS)، وهو إطار عمل يستبدل المكافآت القياسية الغامضة بمعايير تقييم صريحة، وتكيفية، وقابلة للفحص لتحسين المتانة والتعميم في محاذاة التعلم التعزيزي مفتوح النهايات.

Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang2026-03-02
💬 NLP

Modeling Distinct Human Interaction in Web Agents

تقدم هذه الورقة إطار عمل لنمذجة أنماط التدخل البشري المتميزة في وكلاء الويب باستخدام مجموعة بيانات CowCorpus التي جُمعت حديثاً، مما يثبت أن تدريب النماذج اللغوية على توقع مشاركة المستخدم يحسن بشكل كبير كلاً من دقة التنبؤ بالتدخل وفائدة الوكيل وفق تقييم المستخدم.

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jef (…)2026-03-02
💰 quantitative finance

Forecasting Future Language: Context Design for Mention Markets

تستقصي هذه الورقة كيفية تحسين سياق المدخلات للنماذج اللغوية الكبيرة في أسواق الإشارات عبر تقديم "التلقين المشروط بالسوق" (MCP) ومتغيره الخليطي (MixMCP)، مما يثبت أن المعلومات السياقية الأكثر ثراءً ومعاملة احتمالات السوق كاحتمالات سابقة يحسنان بشكل كبير من دقة ومعايرة توقعات الكلمات المفتاحية والإشارات.

Sumin Kim, Jihoon Kwon, Yoon Kim, Nicole Kagan, Raffi Khatchadourian, Wonbin Ahn, Alejandro Lopez-Lira, Jaewon Lee, Yoon (…)2026-03-02
💬 NLP

Bridging Latent Reasoning and Target-Language Generation via Retrieval-Transition Heads

تقدم هذه الورقة "رؤوس الانتقال الاسترجاعي" (Retrieval-Transition Heads - RTHs) كآليات انتباه متميزة في النماذج اللغوية الكبيرة متعددة اللغات، وهي الآليات التي تحكم الانتقال إلى مخرجات اللغة المستهدفة وتعد أكثر أهمية من رؤوس الاسترجاع في عمليات الاستنتاج عبر اللغات باستخدام "سلسلة الأفك " (Chain-of-Thought)، كما يتضح من الانخفاض الكبير في الأداء عند حجبها عبر اختبارات عيارية وعائلات نماذج متعددة.

Shaswat Patel, Vishvesh Trivedi, Yue Han, Yihuai Hong, Eunsol Choi2026-03-02
💬 NLP

Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?

تجادل هذه الورقة بأن انتشار فك التشفير الشبيه بالنماذج ذات الترتيب الذاتي (autoregressive-like decoding) في نماذج اللغة الانتشارية (Diffusion Language Models) ينبع من عدم توافق بين أهدافها وبيانات التدريب المتسلسلة، وتقترح منهجية NAP، وهي نهج قائم على البيانات يعمل على تنسيق مسارات استدلال مستقلة لتمكين توليد متوازٍ غير ذاتي الترتيب بشكل حقيقي مع تحسين الأداء في اختبارات معايير الاستدلال الرياضي.

Pengxiang Li, Dilxat Muhtar, Tianlong Chen, Lu Yin, Shiwei Liu2026-03-02
💬 NLP

Serendipity with Generative AI: Repurposing knowledge components during polycrisis with a Viable Systems Model approach

توضح هذه الورقة كيف يمكن للذكاء الاصطناعي التوليدي أن يعمل كمحرك للمصادفات السعيدة لاستخراج وتنظيم مكونات المعرفة القابلة لإعادة الاستخدام من الأدبيات القائمة في مستودع متوافق مع نموذج الأنظمة الحيوية، مما يقدم إطاراً استراتيجياً للمؤسسات للتنقل عبر عدم اليقين الناتج عن تعدد الأزمات من خلال إعادة توظيف المعرفة بشكل منهجي بدلاً من الاعتماد فقط على الابتكار الجذري.

Gordon Fletcher, Saomai Vu Khan2026-03-02
💬 NLP

Reason to Contrast: A Cascaded Multimodal Retrieval Framework

تقدم هذه الورقة البحثية TTE-v2، وهو إطار عمل استرجاع متعدد الوسائط متتالي يستفيد من توسيع الرموز القائم على الاستدلال وحلقة تغذية راجعة بين إعادة التصنيف والاسترجاع لتحقيق أداء هو الأفضل في فئته على معيار MMEB-V2، مما يوفر بديلاً فعالاً من حيث عدد الرموز لتوسيع حجم النماذج التقليدي.

Xuanming Cui, Hong-You Chen, Hao Yu, Hao Yuan, Zihao Wang, Shlok Kumar Mishra, Hanchao Yu, Yonghuan Yang, Jun Xiao, Ser- (…)2026-03-02
💬 NLP

An Agentic LLM Framework for Adverse Media Screening in AML Compliance

تقدم هذه الورقة إطار عمل لنماذج لغوية كبيرة وكيلية (agentic LLM) يستخدم تقنية التوليد المعزز بالاسترجاع (RAG) لأتمتة فحص الوسائط السلبية للامتثال لمكافحة غسل الأموال، مما يميز بفعالية بين الأفراد عالي المخاطر والأسماء النظيفة من خلال إنشاء مؤشر للوسائط السلبية لتقليل النتائج الإيجابية الكاذبة وجهود المراجعة اليدوية.

Pavel Chernakov, Sasan Jafarnejad, Raphaël Frank2026-03-02