💬 NLP

Reasoning Gets Harder for LLMs Inside A Dialogue

تقدم هذه الورقة البحثية BOULDER، وهو معيار مرجعي ديناميكي جديد يوضح أن النماذج اللغوية الكبيرة تظهر فجوة أداء كبيرة ومتسقة في مهام الاستدلال عندما يتم تأطيرها ضمن حوارات موجهة نحو المهام مقارنة بالإعدادات المنعزلة، ويرجع ذلك أساساً إلى تعقيدات التفاعلات متعددة الأدوار، والاشتراط بالدور، ومتطلبات استخدام الأدوات.

Ivan Kartáč, Mateusz Lango, Ondřej Dušek2026-03-23
💬 NLP

Semantic Token Clustering for Efficient Uncertainty Quantification in Large Language Models

تقترح الورقة البحثية "تجميع الرموز الدلالي" (STC)، وهي طريقة فعالة لتقدير عدم اليقين في النماذج اللغوية الكبيرة، تعمل على تجميع الكتلة الاحتمالية عبر مجموعات من الرموز المتسقة دلالياً باستخدام عملية توليد واحدة، مما يحقق أداءً رائدًا دون العبء الحسابي الناتج عن أخذ العينات المتكرر أو النماذج المساعدة.

Qi Cao, Andrew Gambardella, Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa2026-03-23
💬 NLP

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

تُقيّم هذه الورقة كيف توازن النماذج اللغوية المضبوطة تعليمياً بين ضغوط المواءمة مع المستخدم وبين الأمانة للأدلة السياقية باستخدام إطار تقييم مناخي، كاشفةً أن وفرة الأدلة وحدها لا تمنع الانقلابات التملقية، وأن النماذج تُظهر أنماط فشل متميزة تشمل التفاعلات السلبية مع الدقة المعرفية، وعدم رتابة توسع المتانة، وتشتتاً توزيعياً متفاوتاً في حالات التعارض.

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer2026-03-23
💬 NLP

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

تُثبت هذه الورقة أن مقاييس الأمانة المُبلغ عنها لاستنتاج سلسلة الأفكار في النماذج اللغوية الكبيرة ليست خصائص موضوعية، بل هي حساسة للغاية لاختيار المصنف التقييمي، مما يؤدي إلى تباينات ذات دلالة إحصائية في المعدلات، والتصنيفات، والاستنتاجات التي تستوجب الإبلاغ عن نطاقات الحساسية بدلاً من تقديرات النقطة الواحدة.

Richard J. Young2026-03-23
💬 NLP

DAVIS: Planning Agent with Knowledge Graph-Powered Inner Monologue

تقدم الورقة البحثية DAVIS، وهو وكيل تخطيط علمي مبتكر يستفيد من مونولوج داخلي مدعوم برسم بياني معرفي وذاكرة زمنية مهيكلة لتحقيق أداء متفوق في المهام المختبرية المعقدة والإجابة على الأسئلة متعددة الخطوات مقارنة بنهج التوليد المعزز بالاسترجاع الحالية.

Minh Pham Dinh, Munira Syed, Michael G Yankoski, Trenton W. Ford2026-03-20
💬 NLP

LLMs Faithfully and Iteratively Compute Answers During CoT: A Systematic Analysis With Multi-step Arithmetics

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تحسب الإجابات بأمانة بشكل تكراري أثناء عملية التفكير عبر سلسلة الأفك "chain-of-thought" بدلاً من تحديدها مسبقاً، مما يؤكد أن سلاسل الاستدلال التي تولدها تعكس بدقة عمليتها الحسابية الداخلية.

Keito Kudo, Yoichi Aoki, Tatsuki Kuribayashi, Shusaku Sone, Masaya Taniguchi, Ana Brassard, Keisuke Sakaguchi, Kentaro I (…)2026-03-20
💬 NLP

Enhancing Lexicon-Based Text Embeddings with Large Language Models

تقدم هذه الورقة البحثية LENS، وهي طريقة تمثيل (embedding) جديدة قائمة على المعجم تستفيد من النماذج اللغوية الكبيرة وتجميع الرموز (token clustering) لتحقيق تمثيلات نصية مدمجة وتنافسية تتفوق على التمثيلات الكثيفة (dense embeddings) في اختبار MTEB، وتصل إلى نتائج رائدة عند دمجها معها.

Yibin Lei, Tao Shen, Yu Cao, Andrew Yates2026-03-20
💬 NLP

HiFi-KPI: A Dataset for Hierarchical KPI Extraction from Earnings Filings

تقدم هذه الورقة HiFi-KPI، وهي مجموعة بيانات واسعة النطاق تحتوي على 1.65 مليون فقرة و198,000 تسمية منظمة هرمياً ومرتبطة بتصنيفات iXBRL لتسهيل استخراج وتصنيف مؤشرات الأداء الرئيسية من تقارير الأرباح، إلى جانب مجموعة فرعية مخففة (Lite) منسقة للتقييم السريع وكود مصدري مفتوح المصدر.

Rasmus Aavang, Giovanni Rizzi, Rasmus Bøggild, Alexandre Iolov, Mike Zhang, Johannes Bjerva2026-03-20
💬 NLP

PlainQAFact: Retrieval-augmented Factual Consistency Evaluation Metric for Biomedical Plain Language Summarization

تقدم هذه الورقة PlainQAFact، وهو مقياس تقييم يعتمد على الاسترجاع ومدرك للجمل، تم تدريبه على مجموعة بيانات جديدة مشروحة بشرياً (PlainFact)، والذي يعالج بفعالية أوجه القصور في الطرق الحالية في تقييم الاتساق الواقعي للملخصات اللغوية البسيطة الطبية التي تحتوي على تفسيرات توضيحية.

Zhiwen You, Yue Guo2026-03-20
💬 NLP

Enhancing Multi-Label Emotion Analysis and Corresponding Intensities for Ethiopian Languages

تعمل هذه الورقة على تعزيز مجموعة بيانات EthioEmo متعددة اللغات للغات الإثيوبية عبر إضافة تعليقات توضيحية لشدة العاطفة، وتُظهر أن النماذج الأفريقية المركزية القائمة على المشفر فقط (encoder-only) تتفوق على النماذج اللغوية الكبيرة في تصنيف العواطف متعددة الملصقات عند استخدام ميزات الشدة هذه.

Tadesse Destaw Belay, Dawit Ketema Gete, Abinew Ali Ayele, Olga Kolesnikova, Iqra Ameer, Grigori Sidorov, Seid Muhie Yim (…)2026-03-20