💬 NLP

DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries

تقدم هذه الورقة DistillNote، وهو إطار تقييم وظيفي يقيس الفائدة السريرية للملخصات التي تولدها النماذج اللغوية الكبيرة من خلال قياس قدرتها على الاحتفاظ بالإشارة التشخيصية في مهام التنبؤ اللاحقة، مما يثبت أن الملخصات عالية الضغط يمكن أن تحافظ على ما يصل إلى 97% من الأداء التشخيصي الأصلي للكشف عن فشل القلب.

Heloisa Oss Boll, Antonio Oss Boll, Leticia Puttlitz Boll, Ameen Abu Hanna, Iacer Calixto2026-02-20
💬 NLP

ππ-CoT: Prolog-Initialized Chain-of-Thought Prompting for Multi-Hop Question-Answering

تقدم الورقة البحثية π\pi-CoT، وهي استراتيجية تحفيز مبتكرة تستفيد من لغة برولوغ (Prolog) لتفكيك الأسئلة المعقدة متعددة الخطوات إلى استعلامات فرعية متسلسلة أحادية الخطوة، مما يؤدي إلى تهيئة تسلسل الأفكد (Chain-of-Thought) لتحسين الأداء بشكل كبير في اختبارات قياس الإجابة على الأسئلة متعددة الخطوات مقارنة بطرق التوليد المعزز بالاسترجاع (RAG) وطرق سلسلة الأفكد في السياق القياسية.

Chao Wan, Albert Gong, Mihir Mishra, Carl-Leander Henneking, Claas Beger, Kilian Q. Weinberger2026-02-20
💬 NLP

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

تقدم هذه الورقة البحثية MCIF، وهو أول معيار مرجعي عابر للغات ومُصنف بشرياً يعتمد على المحادثات العلمية، والذي يقيم بشكل منهجي النماذج اللغوية الكبيرة متعددة الوسائط عبر أربع لغات وثلاث وسائط وأطوال مدخلات متفاوتة لمعالجة الفجوات في التقييمات الحالية لقدرات اتباع التعليمات.

Sara Papi, Maike Züfle, Marco Gaido, Beatrice Savoldi, Danni Liu, Ioannis Douros, Luisa Bentivogli, Jan Niehues2026-02-20
💬 NLP

FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs

تقدم هذه الورقة FinAuditing، وهو معيار مرجعي واسع النطاق ومتوافق مع التصنيفات مستمد من تقارير XBRL حقيقية، يقيم قدرات 13 نموذجاً لغوياً كبيراً من أحدث الطرازات عبر ثلاث مهام تدقيق مالي، مما يكشف عن فجوات كبيرة في قدرتها على إجراء المطابقة الدلالية الواعية بالهيكل، واستخراج العلاقات، والاستدلال الرياضي.

Yan Wang, Keyi Wang, Shanshan Yang, Jaisal Patel, Jeff Zhao, Fengran Mo, Xueqing Peng, Lingfei Qian, Jimin Huang, Guojun (…)2026-02-20
💬 NLP

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

تقدم هذه الورقة البحثية "تحسين المطالبات متعدد الوسائط" (MPO)، وهو إطار عمل موحد يوسع نطاق تحسين المطالبات إلى ما هو أبعد من النصوص ليشمل التحسين المشترك للمدخلات النصية وغير النصية (مثل الصور، والفيديوهات، والجزيئات) باستخدام تحديثات حافظة على المحاذاة واختيار بايزي، مما يتفوق على الأساليب الحالية المقتصرة على النصوص ويطلق العنان للإمكانات الكاملة للنماذج اللغوية الكبيرة متعددة الوسائط.

Yumin Choi, Dongki Kim, Jinheon Baek, Sung Ju Hwang2026-02-20
💬 NLP

Toward LLM-Supported Automated Assessment of Critical Thinking Subskills

تستقصي هذه الورقة مدى جدوى استخدام النماذج اللغوية الكبيرة لتقييم المهارات الفرعية للتفكير النقدي في المقالات الحجاجية للطلاب تلقائياً، حيث وجدت أن الضبط الدقيق الخاضع للإشراف لنموذج Llama 3.1 8B يحقق أفضل النتائج، لا سيما للمهارات الفرعية ذات التمايز الواضح في الكفاءة والبيانات المتوازنة، مع تسليط الضوء على التحديات في اكتشاف الفروق الدقيقة الدقيقة والتعامل مع الملصقات غير المتوازنة.

Marisa C. Peczuh, Nischal Ashok Kumar, Ryan Baker, Blair Lehman, Danielle Eisenberg, Caitlin Mills, Payu Wittawatolarn (…)2026-02-20
💬 NLP

Assessing Web Search Credibility and Response Groundedness in Chat Assistants

تقدم هذه الورقة منهجية جديدة لتقييم مصداقية البحث عبر الويب ومدى استناد استجابات المساعدات الدردشة الرئيسية إلى المصادر، كاشفةً عن فروق أداء جوهرية حيث تُظهر Perplexity أعلى موثوقية في المصادر بينما يُظهر GPT-4o ميلاً أكبر للاستشهاد بمصادر غير موثوقة في المواضيع الحساسة.

Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko2026-02-20
💬 NLP

QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models

تقدم هذه الورقة QSTN، وهو إطار عمل مفتوح المصدر بلغة بايثون ذو واجهة بدون كود مصمم لتوليد استجابات الاستبيانات القائمة على النماذج اللغوية الكبيرة بشكل منهجي وتقييمها بمتانة، مما يثبت أن بنية المطالبة وطرق التوليد تؤثر بشكل كبير على التوافق مع الإجابات البشرية مع تقليل تكاليف الحوسبة.

Maximilian Kreutner, Jens Rupprecht, Georg Ahnert, Ahmed Salem, Markus Strohmaier2026-02-20
💬 NLP

Explanation Bias is a Product: Revealing the Hidden Lexical and Position Preferences in Post-Hoc Feature Attribution

تقدم هذه الورقة إطار عمل مستقلاً عن النموذج والمنهج لتقييم وكشف التحيزات اللفظية والمكانية الخفية في طرق عزو الميزات اللاحقة بشكل منهجي، مما يوضح وجود مقايضة بين هذه التحيزات عبر النماذج المختلفة ويحدد أن التفسيرات الشاذة هي الأكثر عرضة للتحيز.

Jonathan Kamp, Roos Bakker, Dominique Blok2026-02-20
💬 NLP

RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution

تُعد RoPE-LIME إطار عمل مفتوح المصدر وفعال لعزو مخرجات النماذج اللغوية الكبيرة مغلقة المصدر، وهي تجمع بين نوى محلية في فضاء RoPE وأخذ عينات Sparse-K لتوليد تفسيرات مستقرة ومعلوماتية على مستوى الرمز (token) مع تقليل تكاليف واجهة برمجة التطبيقات (API) بشكل كبير مقارنة بالطرق الحالية.

Isaac Picov, Ritesh Goru2026-02-20