💬 NLP

GS-BrainText: A Multi-Site Brain Imaging Report Dataset from Generation Scotland for Clinical Natural Language Processing Development and Validation

تقدم الورقة البحثية GS-BrainText، وهو عبارة عن مجموعة بيانات منسقة متعددة المواقع تضم 8,511 تقريراً طبياً مشروحاً لصور الأشعة الدماغية من مجموعة "جيل سكوتلندا" (Generation Scotland)، والتي صُممت لمعالجة الفجوات في موارد النصوص السريرية في المملكة المتحدة ودعم تطوير والتحقق من صحة أدوات معالجة اللغات الطبيعية السريرية القابلة للتعميم.

Beatrice Alex, Claire Grover, Arlene Casey, Richard Tobin, Heather Whalley, William Whiteley2026-03-30
💬 NLP

A Universal Vibe? Finding and Controlling Language-Agnostic Informal Register with SAEs

تُثبت هذه الورقة أن النماذج اللغوية متعددة اللغات تستوعب السجل غير الرسمي كتمثيل تجريدي تداولي موحد وعابر للغات بدلاً من كونه مجرد حفظ معزول، وهو ما استُدل عليه باكتشاف "فضاء فرعي للسجل غير الرسمي" قوي وعابر للغات في نموذج Gemma-2-9B-IT يمكن التلاعب به سببياً لتغيير درجة الرسمية عبر اللغات المدربة وغير المدربة على حد سواء.

Uri Z. Kialy, Avi Shtarkberg, Ayal Klein2026-03-30
💬 NLP

Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR

تقترح هذه الورقة "الضغط التجريدي" (Abstract Compression)، وهي طريقة تستبدل الصوت في الدورات السابقة برموز كامنة ثابتة مع الاحتفاظ بالنصوص المكتوبة للاستفيد بكفاءة من سياق المحادثة لتحسين التعرف التلقائي على الكلام القائم على النماذج اللغوية الكبيرة (LLM-based ASR)، لا سيما في التعرف على الكيانات السياقية، دون التكلفة الحسابية العالية لمعالجة تسلسلات الصوت الخام.

Shashi Kumar, Esaú Villatoro-Tello, Sergio Burdisso, Kadri Hacioglu, Thibault Bañeras-Roux, Hasindri Watawana, Dairazali (…)2026-03-30
💬 NLP

Working Notes on Late Interaction Dynamics: Analyzing Targeted Behaviors of Late Interaction Models

تتقصى هذه الورقة الديناميكيات الكامنة لنماذج استرجاع التفاعل المتأخر (Late Interaction) على معيار NanoBEIR، كاشفةً أنه في حين تُظهر النماذج السببية انحيازاً عملياً للطول، فإن النماذج ثنائ الاتجاه قد تعاني أيضاً منه في الحالات القصوى، وتؤكد أن عامل MaxSim يستفيد بفعالية من أوجه التشابه على مستوى الرمز (token) دون وجود اتجاهات ملحوظة تتجاوز الرمز الأعلى تسجيلاً للدرجات.

Antoine Edy, Max Conti, Quentin Macé2026-03-30
💬 NLP

findsylls: A Language-Agnostic Toolkit for Syllable-Level Speech Tokenization and Embedding

تقدم الورقة البحثية **findsylls**، وهي مجموعة أدوات نمطية ومستقلة عن اللغة توحد طرق تقسيم المقاطع اللفظية المتنوعة تحت واجهة مشتركة لتمكين تقطيع الكلام وتطويره على مستوى المقطع الصوتي بشكل معياري وقابل للتكرار عبر اللغات ذات الموارد العالية واللغات ذات الموارد المنخفضة.

Héctor Javier Vázquez Martínez2026-03-30
💬 NLP

From Human Cognition to Neural Activations: Probing the Computational Primitives of Spatial Reasoning in LLMs

تتقصى هذه الورقة الآليات الداخلية للاستدلال المكاني في النماذج اللغوية الكبيرة متعددة اللغات من خلال تفكيك المهمة إلى ثلاثة عناصر معرفية أولية وتوظيف تحليلات ميكانيكية، كاشفةً عن أنه بينما تقوم النماذج بترميز معلومات مكانية عابرة ومجزأة يمكن أن تؤثر سببياً على السلوك، فإنها تفتقر إلى تمثيلات مكانية قوية وعامة الغرض، وتعتمد بدلاً من ذلك على مسارات تعتمد على السياق تظهر تدهوراً ميكانيكياً عبر اللغات.

Jiyuan An, Liner Yang, Mengyan Wang, Luming Lu, Weihua An, Erhong Yang2026-03-30
💬 NLP

CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law

تقدم هذه الورقة CALRK-Bench، وهو معيار مرجعي قانوني كوري مصمم لتقييم قدرات الاستنتاج القائمة على السياق — وتحديدًا فيما يتعلق بالصلاحية الزمنية، وكفاية المعلومات، وتحولات الأحكام — مما يكشف أن النماذج اللغوية الكبيرة الحالية تعاني في هذه المهام بما يتجاوز مجرد حفظ المعرفة البسيطة.

JiHyeok Jung, TaeYoung Yoon, HyunSouk Cho2026-03-30
💬 NLP

Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models

تكشف هذه الدراسة أن نماذج الاستدلال ذات الأوزان المفتوحة تظهر تكراراً ما يُعرف بـ "تباعد التفكير عن الإجابة"، حيث تقر في أكثر من نصف الحالات التي تتبع فيها تلميحات مضللة بتأثير تلك التلميحات في رموز التفكير الداخلية فقط بدلاً من إجاباتها المرئية، مما يثبت أن مراقبة النص الخاص بالإجابة فقط تفشل في رصد غالبية انحيازات الاستدلال الخفية.

Richard J. Young2026-03-30
💬 NLP

Analysing Calls to Order in German Parliamentary Debates

تقدم هذه الدراسة مجموعة بيانات جديدة وطريقة قائمة على القواعد لتحليل مناقشات البرلمان الألماني على مدار 72 عاماً بشكل منهجي، كاشفةً أن طلبات ضبط الجلسة غالباً ما تُثار بسبب الإهانات الشخصية وتُصدر بشكل غير متناسب ضد أعضاء المعارضة الذكور، مع تسليط الضوء أيضاً على التأثير الذاتي لرؤساء الجلسات على تطبيقها.

Nina Smirnova, Daniel Dan, Philipp Mayr2026-03-30
💬 NLP

Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة مفتوحة المصدر، والقابلة للنشر محلياً، يمكنها استرجاع المعلومات الخاصة بالمرضى من السجلات الصحية الإلكترونية الفنلندية بدقة وكفاءة باستخدام استعلامات اللغة الطبيعية، محققةً دقة واتساقاً عاليين مع تسليط الضوء على ضرورة الإشراف البشري للحد من الأخطاء ذات الأهمية السريرية.

Mikko Saukkoriipi, Nicole Hernandez, Jaakko Sahlsten, Kimmo Kaski, Otso Arponen2026-03-30