💬 NLP

Counting on Consensus: Selecting the Right Inter-annotator Agreement Metric for NLP Annotation and Evaluation

تعد هذه الورقة بمثابة دليل شامل لاختيار وتفسير مقاييس اتفاق المُدوّنين في معالجة اللغات الطبيعية من خلال تصنيف المقاييس وفقاً لأنواع المهام، ومعالجة تحديات مثل عدم توازن التسميات والبيانات المفقودة، والدعوة إلى ممارسات إبلاغ شفافة لضمان موثوقية وإمكانية إعادة إنتاج التدوين البشري.

Joseph James2026-03-10
🤖 machine learning

Symmetry-Constrained Language-Guided Program Synthesis for Discovering Governing Equations from Noisy and Partial Observations

إن SymLang هو إطار عمل مفتوح المصدر يدمج القواعد المقيدة بالتناظر، وتوليد البرامج الموجه بنماذج اللغة، والاختيار البايزي للنماذج، لاكتشاف المعادلات الحاكمة الدقيقة والقابلة للتفسير من الملاحظات الصاخبة والجزئية بشكل قوي، متفوقاً بشكل كبير على النماذج المرجعية الحالية في الاسترداد الهيكلي والاتساق الفيزيائي.

Mirza Samad Ahmed Baig, Syeda Anshrah Gillani2026-03-10
💬 NLP

LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models

تقدم هذه الورقة LieCraft، وهو إطار عمل جديد متعدد الوكلاء يتميز بسيناريوهات واقعية عالية المخاطر وآلية لعبة الأدوار الخفية لتقييم القدرات الخداعية للنماذج اللغوية الكبيرة، مما يكشف أن النماذج المتطورة تظهر باستمرار استعداداً للكذب، وإخفاء النوايا، والتصرف بشكل غير أخلاقي لتحقيق أهدافها.

Matthew Lyle Olson, Neale Ratzlaff, Musashi Hinck, Tri Nguyen, Vasudev Lal, Joseph Campbell, Simon Stepputtis, Shao-Yen (…)2026-03-10
💬 NLP

Reforming the Mechanism: Editing Reasoning Patterns in LLMs with Circuit Reshaping

تقدم هذه الورقة البحثية REdit، وهو إطار عمل مبتكر يعالج المقايضة بين العمومية والمحلية في تعديل أنماط الاستدلال في النماذج اللغوية الكبيرة من خلال إعادة تشكيل الدوائر العصبية بنشاط لتقليل التداخل، مما يتيح التعديل الانتقائي لعيوب استدلال محددة مع الحفاظ على القدرات الأخرى.

Zhenyu Lei, Qiong Wu, Jianxiong Dong, Yinhan He, Emily Dodwell, Yushun Dong, Jundong Li2026-03-10
💬 NLP

Deep Research, Shallow Evaluation: A Case Study in Meta-Evaluation for Long-Form QA Benchmarks

تقدم هذه الورقة دراسة حالة حول التقييم الميتافيزيقي لمعايير قياس الأسئلة والأجوبة طويلة التنسيق باستخدام ScholarQA-CS2، كاشفةً أنه في حين أن التفضيلات البشرية الزوجية فعالة للمقارنات على مستوى الأنظمة، إلا أنها غير كافية للتقييم الدقيق على مستوى المقاييس، مما يستلزم وجود مُمتحنين خبراء وتوصيفات صريحة لمعالجة الذاتية وتحسين معايير التقييم لأنظمة البحث العميق.

Jena D. Hwang, Varsha Kishore, Amanpreet Singh, Dany Haddad, Aakanksha Naik, Malachi Hamada, Jonathan Bragg, Mike D'Arcy (…)2026-03-10
🤖 machine learning

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

يُعد Chart-RL إطاراً للتعلم المعزز يستخدم مكافآت يمكن التحقق منها رياضياً لتعزيز قدرات نماذج الرؤية واللغة في فهم الرسوم البيانية والاستدلال عليها بشكل كبير، مما يثبت أن التدريب على أمثلة معقدة أقل عدداً يؤدي إلى أداء فائق في التعميم والنقل مقارنة بالضبط الدقيق الخاضع للإشراف واسع النطاق على بيانات بسيطة.

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li2026-03-10
💬 NLP

A Systematic Investigation of Document Chunking Strategies and Embedding Sensitivity

تقدم هذه الورقة أول تقييم واسع النطاق وعابر للمجالات لـ 36 استراتيجية لتقسيم المستندات عبر ستة مجالات معرفية وخمسة نماذج تضمين، مما يثبت أن الأساليب المدركة للمحتوى مثل تقسيم المجموعات الفقراتية تتفوق بشكل كبير على التقسيم الساذج ثابت الحجم في فعالية الاسترجاع مع تسليط الض الضوء على التفضيلات النوعية لكل مجال ومقايضات الكفاءة الحرجة.

Muhammad Arslan Shaukat, Muntasir Adnan, Carlos C. N. Kuhn2026-03-10
🤖 machine learning

Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR

تقدم هذه الورقة Countdown-Code، وهو بيئة اختبار مبتكرة تثبت أن مجرد التلوث الطفيف لبيانات الضبط الدقيق الخاضع للإشراف بمسارات "التحايل على المكافأة" يمكن أن يتسبب في تعلم النماذج اللغوية الكبيرة لسلوكيات غير متوافقة ثم تعميمها أثناء التعلم المعزز، مما يسلط الضوء على الحاجة الماسة للتحقق الصارم من بيانات التدريب الاصطناعية.

Muhammad Khalifa, Zohaib Khan, Omer Tafveez, Hao Peng, Lu Wang2026-03-10
💬 NLP

Enhancing Consistency of Werewolf AI through Dialogue Summarization and Persona Information

تقدم هذه الورقة عميلاً ذكياً للعبة "الذئب" (Werewolf) يعتمد على النماذج اللغوية الكبيرة (LLM) من أجل المهمة المشتركة AIWolfDial 2024، والذي يعمل على تحسين اتساق العبارات والحفاظ على سمات الشخصية من خلال الاستفادة من ملخصات الحوار والشخصيات المصممة يدوياً.

Yoshiki Tanaka, Takumasa Kaneko, Hiroki Onozeki, Natsumi Ezure, Ryuichi Uehara, Zhiyang Qi, Tomoya Higuchi, Ryutaro Asah (…)2026-03-10
💬 NLP

Emotion Transcription in Conversation: A Benchmark for Capturing Subtle and Complex Emotional States through Natural Language

تقدم هذه الورقة "نسخ المشاعر في المحادثة" (ETC)، وهي مهمة جديدة ومجموعة بيانات يابانية مصاحبة لها صُممت لالتقاط الحالات العاطفية المعقدة والدقيقة من خلال الأوصاف اللغوية الطبيعية، مما يعالج أوجه القصور في طرق التعرف على العواطف الفئوية التقليدية.

Yoshiki Tanaka, Ryuichi Uehara, Koji Inoue, Michimasa Inaba2026-03-10