💬 NLP

HORIZON: A Benchmark for In-the-wild User Behaviour Modeling

تقدم الورقة البحثية HORIZON، وهو معيار مرجعي جديد واسع النطاق ومتعدد المجالات مبني من 54 مليون مستخدم و35 مليون عنصر، والذي يعيد صياغة نمذجة سلوك المستخدم من خلال مهام ومقاييس تقييم مبتكرة لمعالجة أوجه القصور في المعايير المرجعية الضيقة الحالية ولتعكس سيناريوهات النشر في العالم الحقيقي بشكل أفضل.

Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma2026-04-21
💬 NLP

MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning

تقدم هذه الورقة MedPRMBench، وهو أول معيار مرجعي دقيق لنماذج مكافأة العمليات في المجال الطبي، والذي يستخدم نظام تصنيف شدة جديداً مكوناً من أربعة مستويات وتسميات واسعة النطاق على مستوى الخطوات لتقييم وتحسين اكتشاف الأخطاء في الاستدلال السريري، مما يعزز في النهاية دقة الإجابة على الأسئلة الطبية في المهام اللاحقة.

Lingyan Wu, Xiang Zheng, Weiqi Zhai, Wei Wang, Xuan Ren, Zifan Zhang, Hu Wei, Bing Zhao2026-04-21
💬 NLP

HorizonBench: Long-Horizon Personalization with Evolving Preferences

تقدم هذه الورقة HorizonBench، وهو معيار مرجعي جديد يتميز بمحادثات مستخدم محاكية لمدة 6 أشهر مع مصدر حقيقي للتفضيلات المتطورة، والذي يكشف أن النماذج الرائدة الحالية تعاني بشكل كبير من صعوبة في التخصيص طويل الأمد، ويرجع ذلك أساساً إلى الفشل في تتبع وتحديث حالات المستخدم بمرور الوقت.

Shuyue Stella Li, Bhargavi Paranjape, Kerem Oktar, Zhongyao Ma, Gelin Zhou, Lin Guan, Na Zhang, Sem Park, Lin Chen, Diyi (…)2026-04-21
💬 NLP

Probabilistic Programs of Thought

تقدم هذه الورقة البحثية "البرامج الاحتمالية للفكر"، وهو إطار عمل في وقت الاختبار يستفيد من احتمالات الرمز التالي (next-token probabilities) من توليد نموذج لغوي كبير واحد لبناء برامج احتمالية مدمجة تمثل عددًا هائلاً من النتائج الحتمية، مما يتيح أخذ عينات فعالة لحلول متنوعة لمهام البرمجة والاستدلال دون الحاجة إلى قدرات حوسبة إضافية من وحدة معالجة الرسومات.

Poorva Garg, Renato Lui Geh, Daniel Israel, Todd Millstein, Kyle Richardson, Guy Van den Broeck2026-04-21
💬 NLP

Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty

تقدم هذه الورقة البحثية UA-Bench، وهو معيار لتقييم قدرة النماذج اللغوية الكبيرة على التمييز بين عدم اليقين الناتج عن البيانات وعدم اليقين الناتج عن النموذج، مما يكشف أن النماذج الحالية المتطورة تواجه صعوبة في هذا التمييز، وتُظهر أن استراتيجية مقترحة لتخليق البيانات خفيفة الوزن والتعلم المعزز يمكنها تحسين عزاء عدم اليقين بفعالية مع الحفاظ على دقة الإجابة.

Jingyi Ren, Ante Wang, Yunghwei Lai, Xiaolong Wang, Linlu Gong, Weitao Li, Weizhi Ma, Yang Liu2026-04-21
💬 NLP

CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning

تقدم الورقة البحثية إطار عمل CRISP، الذي يستفيد من أنماط الانتباه الجوهرية لنماذج الاستدلال — وتحديداً باستخدام رمز الإنهاء كمرتكز للمعلومات — لتقليص خطوات سلسلة الأفكـات (Chain-of-Thought) الزائدة، محققاً خفضاً بنسبة 50-60% في عدد الرموز (tokens) مع الحفاظ على التماسك المنطقي والدقة.

Yangsong Lan, Hongliang Dai, Piji Li2026-04-21
💬 NLP

Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA

تكشف هذه الورقة أن مؤشرات الهوية الاجتماعية، ولا سيال التوجه الجنسي والانتماء الديني، تشوه بشكل كبير كلاً من دقة ومعايرة عدم اليقين في النماذج اللغوية الكبيرة الطبية، مما يخلق "أزمة معايرة" تشكل مخاطر جسيمة على النشر السريري الآمن والعادل.

Alberto Testoni, Iacer Calixto2026-04-21
💬 NLP

A Universal Avoidance Method for Diverse Multi-branch Generation

تقدم الورقة البحثية استراتيجية UAG (التوليد الشامل للتجنب)، وهي استراتيجية مستقلة عن النموذج وفعالة حاسوبياً تعزز بشكل كبير تنوع المسارات المتعددة في كل من نماذج الانتشار والنماذج المحولة عبر معاقبة تشابه المخرجات، محققةً تنوعاً أعلى بمقدار يصل إلى 1.9 مرة مع تكاليف حاسوبية أقل بكثير مقارنة بالأساليب الرائدة.

Kyeongman Park, Minha Jhang, Kyomin Jung2026-04-21
💬 NLP

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

تقدم هذه الورقة إطار عمل "معيار التصحيح الدقيق" (PDB) للكشف عن أن النماذج اللغوية الكبيرة الرائدة، على الرغم من تحقيقها معدلات نجاح عالية في اختبارات الوحدة، تعاني من صعوبة في التصحيح الدقيق بسبب الإفراط المتكرر في تعديل الكود، وهو قصور يستمر حتى مع استخدام الاستراتيجيات التكرارية، مما يستدعي إعادة التفكير في مسارات التدريب اللاحق لنماذج البرمجة.

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia2026-04-21
💬 NLP

Neuro-Symbolic Resolution of Recommendation Conflicts in Multimorbidity Clinical Guidelines

تقدم هذه الورقة إطار عمل عصبياً-رمزياً يقوم بترجمة الإرشادات السريرية غير المهيكلة إلى منطق رمزي والتحقق منها باستخدام برنامج حل مشكلات الـ SAT للكشف بفعالية عن "التضاربات المحلية" الناشئة عن تعدد الأمراض ومعالجتها، محققةً درجة F1 تبلغ 0.861 ومتفوقةً على النماذج اللغوية الكبيرة الحديثة في ضمان موثوقية توصيات الذكاء الاصطناعي الطبي.

Shiyao Xie, Jian Du2026-04-21