💬 NLP

PaperTrail: A Claim-Evidence Interface for Grounding Provenance in LLM-based Scholarly Q&A

تُقدم واجهة PaperTrail آلية ربط دقيقة بين الادعاء والأدلة لتحسين إمكانية تتبع المصدر في أنظمة الإجابة على الأسئلة الأكاديمية القائمة على النماذج اللغوية الكبيرة، إلا أن دراسة مستخدمين كشفت أنه بينما نجحت الواجهة في خفض ثقة الباحثين من خلال كشف الادعاءات غير المدعومة، إلا أنها فشلت في تغيير اعتمادهم على النظام بسبب التكلفة المعرفية العالية لعملية التحقق.

Anna Martin-Boyle, Cara A. C. Leckey, Martha C. Brown, Harmanpreet Kaur2026-02-25
💬 NLP

An Expert Schema for Evaluating Large Language Model Errors in Scholarly Question-Answering Systems

تقدم هذه الورقة وتتحقق من صحة مخطط جديد، قائم على خبرات الخبراء، لتقييم أخطاء النماذج اللغوية الكبيرة في أنظمة الإجابة على الأسئلة الأكاديمية، والذي تم تطويره من خلال التحليل الموضوعي لـ 68 زوجاً من الأسئلة والأجوبة وتم تنقيحه مع علماء متخصصين لالتقاط استراتيجيات التقييم الدقيقة التي تغفلها المقاييس الآلية الحالية.

Anna Martin-Boyle, William Humphreys, Martha Brown, Cara Leckey, Harmanpreet Kaur2026-02-25
💬 NLP

Beyond the Star Rating: A Scalable Framework for Aspect-Based Sentiment Analysis Using LLMs and Text Classification

تقترح هذه الدراسة إطار عمل هجينًا قابلًا للتوسع يستفيد من النماذج اللغوية الكبيرة لتحديد الجوانب ومن تعلم الآلة التقليدي لتصنيف المشاعر لتحليل ملايين مراجعات العملاء بفعالية، مما يثبت أن هذا النهج يمكنه تفسير التباين في تقييمات المطاعم الإجمالية بشكل كبير عبر سياقات متنوعة.

Vishal Patil, Shree Vaishnavi Bacha, Revanth Yamani, Yidan Sun, Mayank Kejriwal2026-02-25
💬 NLP

A Benchmark for Deep Information Synthesis

تقدم الورقة البحثية DEEPSYNTH، وهو معيار مرجعي جديد وتحدٍ يتكون من 120 مهمة من واقع العالم عبر 7 مجالات، يقيم قدرة الوكلاء القائمين على النماذج اللغوية الكبيرة على تركيب المعلومات واستنتاج الرؤى، مما يكشف عن قصور كبير حالي في القدرة على الاستنتاج والتحكم في الهلوسة.

Debjit Paul, Daniel Murphy, Milan Gritta, Ronald Cardenas, Victor Prokhorov, Lena Sophia Bolliger, Aysim Toker, Roy Mile (…)2026-02-25
💬 NLP

PVminer: A Domain-Specific Tool to Detect the Patient Voice in Patient Generated Data

يُعد PVminer إطار عمل لمعالجة اللغات الطبيعية متخصصًا في مجال معين، حيث يستفيد من نماذج BERT المُكيَّفة للمرضى ونمذجة المواضيع غير الخاضعة للإشراف للكشف بكفاءة عن صوت المريض وهيكلته، بما في ذلك المحددات الاجتماعية للصحة، ضمن الاتصالات الآمنة بين المريض ومقدم الرعاية، محققًا أداءً فائقًا على النماذج السريرية المرجعية الحالية.

Samah Fodeh, Linhai Ma, Yan Wang, Srivani Talakokkul, Ganesh Puthiaraju, Afshan Khan, Ashley Hagaman, Sarah Lowe, Aimee (…)2026-02-25
💬 NLP

Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs

تقدم هذه الورقة "التخطيط التأملي أثناء وقت الاختبار" (Reflective Test-Time Planning)، وهو إطار عمل يعزز النماذج اللغوية الكبيرة المتجسدة من خلال دمج "التأمل أثناء الفعل"، و"التأمل في الفعل"، و"التأمل الاسترجاعي" لتحويل التجربة والخطأ المتكررة إلى خبرة تراكمية، مما يؤدي إلى تحسين أداء المهام طويلة المدى وتصحيح السلوك بشكل كبير.

Yining Hong, Huang Huang, Manling Li, Li Fei-Fei, Jiajun Wu, Yejin Choi2026-02-25
💬 NLP

PoTeC: A German Naturalistic Eye-tracking-while-reading Corpus

تُعدُّ مجموعة نصوص بوتسدام لتتبع حركة العين (PoTeC) مجموعة بيانات ألمانية جديدة ومفتوحة الوصول لتتبع حركة العين، تضم 75 مشاركاً (من الخبراء والمتخصصين وغير المتخصصين) يقرؤون 12 نصاً علمياً وفق تصميم عاملي كامل التداخل، مصحوبة بتقييمات للفهم، وتوسيمات لغوية، وكود معالجة مسبقة كامل لتسهيل دراسة استراتيجيات القراءة لدى الخبراء مقابل غير الخبراء.

Deborah N. Jakobi, Thomas Kern, David R. Reich, Patrick Haller, Lena A. Jäger2026-02-24
💬 NLP

MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts

تقدم هذه الورقة MathScape، وهو معيار مرجعي جديد يضم 1,369 مسألة رياضية من واقع الحياة مع صور ملتقطة بشرياً لتقييم النماذج اللغوية الكبيرة متعددة الوسائط، كاشفةً أن حتى النماذج المتطورة تعاني في السيناريوهات الواقعية ومسلطةً الضوء على محدودية الاعتماد فقط على مجموعات البيانات الاصطناعية لتقييم الاستدلال الرياضي.

Hao Liang, Linzhuang Sun, Minxuan Zhou, Zirong Chen, Meiyi Qiang, Mingan Lin, Tianpeng Li, Fan Yang, Zenan Zhou, Wentao (…)2026-02-24
💬 NLP

Personalized Help for Optimizing Low-Skilled Users' Strategy

تُظهر هذه الورقة أن تعزيز وكيل الذكاء الاصطناعي الخارق CICERO لتقديم نصائح مخصصة بشأن التحركات والرسائل في لعبة الدبلوماسية يساعد اللاعبين المبتدئين بشكل كبير على منافسة اللاعبين ذوي الخبرة أو حتى التفوق عليهم، مع كون مجرد وجود مثل هذه النصائح يوفر مزايا استراتيجية بغض النظر عما إذا تم اتباعها أم لا.

Feng Gu, Wichayaporn Wongkamjan, Jonathan K. Kummerfeld, Denis Peskoff, Jonathan May, Jordan Boyd-Graber2026-02-24
💬 NLP

Efficient Context Propagating Perceiver Architectures for Auto-Regressive Language Modeling

تقدم هذه الورقة البحثية "المدرك الفعال لنشر السياق" (ECP)، وهو بنية مبتكرة تُحسّن نموذج PerceiverAR من خلال الاستفادة من كل من تسلسلات السياق والتسلسلات الكامنة بكفاءة تضاهي مستوى LongLoRA لتحقيق أداء فائق في مهام نمذجة اللغة ذات التسلسلات الطويلة.

Kaleel Mahmood, Shaoyi Huang2026-02-24