💬 NLP

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

تُقيّم هذه الورقة كيف توازن النماذج اللغوية المضبوطة تعليمياً بين ضغوط المواءمة مع المستخدم وبين الأمانة للأدلة السياقية باستخدام إطار تقييم مناخي، كاشفةً أن وفرة الأدلة وحدها لا تمنع الانقلابات التملقية، وأن النماذج تُظهر أنماط فشل متميزة تشمل التفاعلات السلبية مع الدقة المعرفية، وعدم رتابة توسع المتانة، وتشتتاً توزيعياً متفاوتاً في حالات التعارض.

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer2026-03-23
💬 NLP

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

تُثبت هذه الورقة أن مقاييس الأمانة المُبلغ عنها لاستنتاج سلسلة الأفكار في النماذج اللغوية الكبيرة ليست خصائص موضوعية، بل هي حساسة للغاية لاختيار المصنف التقييمي، مما يؤدي إلى تباينات ذات دلالة إحصائية في المعدلات، والتصنيفات، والاستنتاجات التي تستوجب الإبلاغ عن نطاقات الحساسية بدلاً من تقديرات النقطة الواحدة.

Richard J. Young2026-03-23
💬 NLP

DAVIS: Planning Agent with Knowledge Graph-Powered Inner Monologue

تقدم الورقة البحثية DAVIS، وهو وكيل تخطيط علمي مبتكر يستفيد من مونولوج داخلي مدعوم برسم بياني معرفي وذاكرة زمنية مهيكلة لتحقيق أداء متفوق في المهام المختبرية المعقدة والإجابة على الأسئلة متعددة الخطوات مقارنة بنهج التوليد المعزز بالاسترجاع الحالية.

Minh Pham Dinh, Munira Syed, Michael G Yankoski, Trenton W. Ford2026-03-20
💬 NLP

LLMs Faithfully and Iteratively Compute Answers During CoT: A Systematic Analysis With Multi-step Arithmetics

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تحسب الإجابات بأمانة بشكل تكراري أثناء عملية التفكير عبر سلسلة الأفك "chain-of-thought" بدلاً من تحديدها مسبقاً، مما يؤكد أن سلاسل الاستدلال التي تولدها تعكس بدقة عمليتها الحسابية الداخلية.

Keito Kudo, Yoichi Aoki, Tatsuki Kuribayashi, Shusaku Sone, Masaya Taniguchi, Ana Brassard, Keisuke Sakaguchi, Kentaro I (…)2026-03-20
💬 NLP

Enhancing Lexicon-Based Text Embeddings with Large Language Models

تقدم هذه الورقة البحثية LENS، وهي طريقة تمثيل (embedding) جديدة قائمة على المعجم تستفيد من النماذج اللغوية الكبيرة وتجميع الرموز (token clustering) لتحقيق تمثيلات نصية مدمجة وتنافسية تتفوق على التمثيلات الكثيفة (dense embeddings) في اختبار MTEB، وتصل إلى نتائج رائدة عند دمجها معها.

Yibin Lei, Tao Shen, Yu Cao, Andrew Yates2026-03-20
💬 NLP

HiFi-KPI: A Dataset for Hierarchical KPI Extraction from Earnings Filings

تقدم هذه الورقة HiFi-KPI، وهي مجموعة بيانات واسعة النطاق تحتوي على 1.65 مليون فقرة و198,000 تسمية منظمة هرمياً ومرتبطة بتصنيفات iXBRL لتسهيل استخراج وتصنيف مؤشرات الأداء الرئيسية من تقارير الأرباح، إلى جانب مجموعة فرعية مخففة (Lite) منسقة للتقييم السريع وكود مصدري مفتوح المصدر.

Rasmus Aavang, Giovanni Rizzi, Rasmus Bøggild, Alexandre Iolov, Mike Zhang, Johannes Bjerva2026-03-20
💬 NLP

PlainQAFact: Retrieval-augmented Factual Consistency Evaluation Metric for Biomedical Plain Language Summarization

تقدم هذه الورقة PlainQAFact، وهو مقياس تقييم يعتمد على الاسترجاع ومدرك للجمل، تم تدريبه على مجموعة بيانات جديدة مشروحة بشرياً (PlainFact)، والذي يعالج بفعالية أوجه القصور في الطرق الحالية في تقييم الاتساق الواقعي للملخصات اللغوية البسيطة الطبية التي تحتوي على تفسيرات توضيحية.

Zhiwen You, Yue Guo2026-03-20
💬 NLP

Enhancing Multi-Label Emotion Analysis and Corresponding Intensities for Ethiopian Languages

تعمل هذه الورقة على تعزيز مجموعة بيانات EthioEmo متعددة اللغات للغات الإثيوبية عبر إضافة تعليقات توضيحية لشدة العاطفة، وتُظهر أن النماذج الأفريقية المركزية القائمة على المشفر فقط (encoder-only) تتفوق على النماذج اللغوية الكبيرة في تصنيف العواطف متعددة الملصقات عند استخدام ميزات الشدة هذه.

Tadesse Destaw Belay, Dawit Ketema Gete, Abinew Ali Ayele, Olga Kolesnikova, Iqra Ameer, Grigori Sidorov, Seid Muhie Yim (…)2026-03-20
💬 NLP

ELM: A Hybrid Ensemble of Language Models for Automated Tumor Group Classification in Population-Based Cancer Registries

يُعد نظام ELM نظاماً هجيناً مبتكراً من المجموعات، يجمع بين نماذج المشفرات فقط (encoder-only models) التي تم ضبطها بدقة ونموذج مُحكّم من النماذج اللغوية الكبيرة، مما يحسن بشكل كبير من دقة التصنيف الآلي لمجموعات الأورام في سجلات السرطان القائمة على السكان، ويقلل متطلبات المراجعة اليدوية بنسبة 60-70% مع الحفاظ على معايير جودة البيانات العالية.

Lovedeep Gondara, Jonathan Simkin, Shebnum Devji, Gregory Arbour, Raymond Ng2026-03-20
💬 NLP

Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test

تقترح هذه الورقة اختبار تجانس قائم على الرتبة يُمكّن المستخدمين من تدقيق واجهات برمجة تطبيقات النماذج اللغوية الكبيرة (LLM) ذات الصندوق الأسود بدقة وكفاءة للكشف عن عمليات استبدال النماذج غير المصرح بها، مثل التكميم أو الضبط الدقيق الضار، وذلك عبر التحقق من الاتساق السلوكي مع نموذج محلي أصيل دون الكشف عن أنماط الكشف.

Xiaoyuan Zhu, Yaowen Ye, Tianyi Qiu, Hanlin Zhu, Sijun Tan, Ajraf Mannan, Jonathan Michala, Raluca Ada Popa, Willie Neis (…)2026-03-20