💬 NLP

FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs

تقدم هذه الورقة FinAuditing، وهو معيار مرجعي واسع النطاق ومتوافق مع التصنيفات مستمد من تقارير XBRL حقيقية، يقيم قدرات 13 نموذجاً لغوياً كبيراً من أحدث الطرازات عبر ثلاث مهام تدقيق مالي، مما يكشف عن فجوات كبيرة في قدرتها على إجراء المطابقة الدلالية الواعية بالهيكل، واستخراج العلاقات، والاستدلال الرياضي.

Yan Wang, Keyi Wang, Shanshan Yang, Jaisal Patel, Jeff Zhao, Fengran Mo, Xueqing Peng, Lingfei Qian, Jimin Huang, Guojun (…)2026-02-20
💬 NLP

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

تقدم هذه الورقة البحثية "تحسين المطالبات متعدد الوسائط" (MPO)، وهو إطار عمل موحد يوسع نطاق تحسين المطالبات إلى ما هو أبعد من النصوص ليشمل التحسين المشترك للمدخلات النصية وغير النصية (مثل الصور، والفيديوهات، والجزيئات) باستخدام تحديثات حافظة على المحاذاة واختيار بايزي، مما يتفوق على الأساليب الحالية المقتصرة على النصوص ويطلق العنان للإمكانات الكاملة للنماذج اللغوية الكبيرة متعددة الوسائط.

Yumin Choi, Dongki Kim, Jinheon Baek, Sung Ju Hwang2026-02-20
💬 NLP

Toward LLM-Supported Automated Assessment of Critical Thinking Subskills

تستقصي هذه الورقة مدى جدوى استخدام النماذج اللغوية الكبيرة لتقييم المهارات الفرعية للتفكير النقدي في المقالات الحجاجية للطلاب تلقائياً، حيث وجدت أن الضبط الدقيق الخاضع للإشراف لنموذج Llama 3.1 8B يحقق أفضل النتائج، لا سيما للمهارات الفرعية ذات التمايز الواضح في الكفاءة والبيانات المتوازنة، مع تسليط الضوء على التحديات في اكتشاف الفروق الدقيقة الدقيقة والتعامل مع الملصقات غير المتوازنة.

Marisa C. Peczuh, Nischal Ashok Kumar, Ryan Baker, Blair Lehman, Danielle Eisenberg, Caitlin Mills, Payu Wittawatolarn (…)2026-02-20
💬 NLP

Assessing Web Search Credibility and Response Groundedness in Chat Assistants

تقدم هذه الورقة منهجية جديدة لتقييم مصداقية البحث عبر الويب ومدى استناد استجابات المساعدات الدردشة الرئيسية إلى المصادر، كاشفةً عن فروق أداء جوهرية حيث تُظهر Perplexity أعلى موثوقية في المصادر بينما يُظهر GPT-4o ميلاً أكبر للاستشهاد بمصادر غير موثوقة في المواضيع الحساسة.

Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko2026-02-20
💬 NLP

QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models

تقدم هذه الورقة QSTN، وهو إطار عمل مفتوح المصدر بلغة بايثون ذو واجهة بدون كود مصمم لتوليد استجابات الاستبيانات القائمة على النماذج اللغوية الكبيرة بشكل منهجي وتقييمها بمتانة، مما يثبت أن بنية المطالبة وطرق التوليد تؤثر بشكل كبير على التوافق مع الإجابات البشرية مع تقليل تكاليف الحوسبة.

Maximilian Kreutner, Jens Rupprecht, Georg Ahnert, Ahmed Salem, Markus Strohmaier2026-02-20
💬 NLP

Explanation Bias is a Product: Revealing the Hidden Lexical and Position Preferences in Post-Hoc Feature Attribution

تقدم هذه الورقة إطار عمل مستقلاً عن النموذج والمنهج لتقييم وكشف التحيزات اللفظية والمكانية الخفية في طرق عزو الميزات اللاحقة بشكل منهجي، مما يوضح وجود مقايضة بين هذه التحيزات عبر النماذج المختلفة ويحدد أن التفسيرات الشاذة هي الأكثر عرضة للتحيز.

Jonathan Kamp, Roos Bakker, Dominique Blok2026-02-20
💬 NLP

RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution

تُعد RoPE-LIME إطار عمل مفتوح المصدر وفعال لعزو مخرجات النماذج اللغوية الكبيرة مغلقة المصدر، وهي تجمع بين نوى محلية في فضاء RoPE وأخذ عينات Sparse-K لتوليد تفسيرات مستقرة ومعلوماتية على مستوى الرمز (token) مع تقليل تكاليف واجهة برمجة التطبيقات (API) بشكل كبير مقارنة بالطرق الحالية.

Isaac Picov, Ritesh Goru2026-02-20
💬 NLP

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

تقدم الورقة البحثية propella-1، وهي عائلة من النماذج اللغوية الكبيرة متعددة اللغات والصغيرة التي تولد تعليقات توضيحية مهيكلة ومتعددة الخصائص للوثائق النصية عبر 18 بُعداً لتمكين تنقيح البيانات المرن والقابل للتفسير واسع النطاق لتدريب النماذج اللغوية الكبيرة، متجاوزةً بذلك أساليب الدرجة الواحدة التقليدية.

Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries2026-02-20
💬 NLP

Building Safe and Deployable Clinical Natural Language Processing under Temporal Leakage Constraints

تقترح هذه الورقة مسار تدقيق خفيف الوزن يدمج القابلية للتفسير في تطوير معالجة اللغات الطبيعية السريرية للكشف عن التسرب الزمني واللفظي وكبحهما، مما يثبت أن مثل هذه التدابير تؤدي إلى نماذج أكثر أماناً وأفضل معايرة لخطط الخروج من المستشفى تعطي الأولوية للصلاحية الزمنية على مقاييس الأداء المتضخمة.

Ha Na Cho, Sairam Sutari, Alexander Lopez, Hansen Bow, Kai Zheng2026-02-20
💬 NLP

Multi-Objective Alignment of Language Models for Personalized Psychotherapy

تتناول هذه الورقة البحثية أوجه القصور في أنظمة العلاج النفسي الحالية عبر تقديم إطار عمل للمواءمة متعدد الأهداف (MODPO) مُدرب على بيانات تفضيلات المرضى، والذي ينجح في تحقيق التوازن بين السلامة السريرية والتعاطف العلاجي والاستقلالية، متفوقاً بذلك على أساليب المواءمة أحادية الهدف والضبط الدقيق القياسي في كل من المقاييس الآلية والتقييمات العمياء من قبل الأطباء.

Mehrab Beikzadeh, Yasaman Asadollah Salmanpour, Ashima Suvarna, Sriram Sankararaman, Matteo Malgaroli, Majid Sarrafzadeh (…)2026-02-20