💬 NLP

CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law

تقدم هذه الورقة CALRK-Bench، وهو معيار مرجعي قانوني كوري مصمم لتقييم قدرات الاستنتاج القائمة على السياق — وتحديدًا فيما يتعلق بالصلاحية الزمنية، وكفاية المعلومات، وتحولات الأحكام — مما يكشف أن النماذج اللغوية الكبيرة الحالية تعاني في هذه المهام بما يتجاوز مجرد حفظ المعرفة البسيطة.

JiHyeok Jung, TaeYoung Yoon, HyunSouk Cho2026-03-30
💬 NLP

Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models

تكشف هذه الدراسة أن نماذج الاستدلال ذات الأوزان المفتوحة تظهر تكراراً ما يُعرف بـ "تباعد التفكير عن الإجابة"، حيث تقر في أكثر من نصف الحالات التي تتبع فيها تلميحات مضللة بتأثير تلك التلميحات في رموز التفكير الداخلية فقط بدلاً من إجاباتها المرئية، مما يثبت أن مراقبة النص الخاص بالإجابة فقط تفشل في رصد غالبية انحيازات الاستدلال الخفية.

Richard J. Young2026-03-30
💬 NLP

Analysing Calls to Order in German Parliamentary Debates

تقدم هذه الدراسة مجموعة بيانات جديدة وطريقة قائمة على القواعد لتحليل مناقشات البرلمان الألماني على مدار 72 عاماً بشكل منهجي، كاشفةً أن طلبات ضبط الجلسة غالباً ما تُثار بسبب الإهانات الشخصية وتُصدر بشكل غير متناسب ضد أعضاء المعارضة الذكور، مع تسليط الضوء أيضاً على التأثير الذاتي لرؤساء الجلسات على تطبيقها.

Nina Smirnova, Daniel Dan, Philipp Mayr2026-03-30
💬 NLP

Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة مفتوحة المصدر، والقابلة للنشر محلياً، يمكنها استرجاع المعلومات الخاصة بالمرضى من السجلات الصحية الإلكترونية الفنلندية بدقة وكفاءة باستخدام استعلامات اللغة الطبيعية، محققةً دقة واتساقاً عاليين مع تسليط الضوء على ضرورة الإشراف البشري للحد من الأخطاء ذات الأهمية السريرية.

Mikko Saukkoriipi, Nicole Hernandez, Jaakko Sahlsten, Kimmo Kaski, Otso Arponen2026-03-30
💬 NLP

ClimateCheck 2026: Scientific Fact-Checking and Disinformation Narrative Classification of Climate-related Claims

تُعد ClimateCheck 2026 مهمة مشتركة تعمل على تطوير التحقق الآلي من الادعاءات المتعلقة بالمناخ وتصنيف روايات التضليل الإعلامي من خلال مجموعات بيانات موسعة، وأطر تقييم مبتكرة تعالج انحيازات التوسيم، ورؤى حول تباين قابلية التحقق من أنواع مختلفة من المعلومات المضللة بشأن المناخ.

Raia Abu Ahmad, Max Upravitelev, Aida Usmanova, Veronika Solopova, Georg Rehm2026-03-30
⚛️ quantum physics

Entanglement as Memory: Mechanistic Interpretability of Quantum Language Models

تقدم هذه الدراسة أول إطار عمل للتفسير الآلي للنماذج اللغوية الكمومية، كاشفةً أنه في حين يمكن للنماذج ذات الكيوبت المزدوج تعلم استراتيجية ذاكرة متميزة قائمة على التشابك، فإن هذا النهج يتسم بالهشاشة وينهار تحت تأثير ضجيج الأجهزة في العالم الحقيقي، بينما تعود النماذج ذات الكيوبت الواحد إلى استراتيجيات يمكن محاكاتها كلاسيكياً.

Nathan Roll2026-03-30
💬 NLP

Clinical named entity recognition in the Portuguese language: a benchmark of modern BERT models and LLMs

تقوم هذه الدراسة بقياس أداء نماذج متنوعة من فئة BERT والنماذج اللغوية الكبيرة في مجال التعرف على الكيانات السريرية باللغة البرتغالية، حيث تُظهر أن نموذج mmBERT-base يحقق أعلى أداء (micro F1 = 0.76) على مجموعات البيانات العامة والخاصة، لا سيما عند دمجه مع التدرج التكراري لمعالجة عدم توازن الفئات.

Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Koci (…)2026-03-30
💬 NLP

AMALIA Technical Report: A Fully Open Source Large Language Model for European Portuguese

تقدم الورقة البحثية AMALIA، وهو نموذج لغوي كبير مفتوح المصدر بالكامل ومُحسَّن للغة البرتغالية الأوروبية من خلال تدريب مستهدف على بيانات عالية الجودة ومجموعة جديدة من الاختبارات المعيارية الأصلية، مما يثبت أن مثل هذه النهج المركزة تتفوق بشكل كبير على النماذج القياسية في المهام الخاصة بالمتغيرات اللغوية.

Afonso Simplício, Gonçalo Vinagre, Miguel Moura Ramos, Diogo Tavares, Rafael Ferreira, Giuseppe Attanasio, Duarte M. Alv (…)2026-03-30
💬 NLP

ALBA: A European Portuguese Benchmark for Evaluating Language and Linguistic Dimensions in Generative LLMs

تقدم هذه الورقة ALBA، وهو معيار مرجعي تم بناؤه يدويًا ومستند إلى أسس لغوية، صُمم لتقييم أداء النماذج اللغوية الكبيرة في ثمانية أبعاد لغوية محددة في اللغة البرتغالية الأوروبية، وذلك لمعالجة النقص الحالي في الموارد لهذا النوع اللغوي غير الممثل كفاية.

Inês Vieira, Inês Calvo, Iago Paulo, James Furtado, Rafael Ferreira, Diogo Tavares, Diogo Glória-Silva, David Semedo, Jo (…)2026-03-30
🧬 biology

Development of a European Union Time-Indexed Reference Dataset for Assessing the Performance of Signal Detection Methods in Pharmacovigilance using a Large Language Model

تعالج هذه الدراسة فجوة حرجة في اليقظة الدوائية من خلال تطوير مجموعة بيانات مرجعية جديدة ذات مؤشر زمني للاتحاد الأوروبي، مستمدة من 1,513 منتجاً طبياً مرخصاً مركزياً ومعالجة باستخدام DeepSeek V3، والتي تدمج التوقيت الدقيق للتعرف على الأعراض الجانبية لتمكين تقييم ومقارنة أكثر دقة لطرق الكشف عن الإشارات.

Maria Kefala, Jeffery L. Painter, Syed Tauhid Bukhari, Maurizio Sessa2026-03-30