💬 NLP

Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs

تُثبت هذه الورقة أن التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) يُحسّن قدرة النماذج اللغوية الكبيرة على الاستنتاج من خلال تحولات توزيعية مستهدفة وعالية الندرة على مستوى الرموز (tokens)، حيث تكون نسبة ضئيلة من قرارات الرموز الحرجة هي المسؤولة عن مكاسب الأداء، ويمكن عزلها عبر تدخلات أخذ العينات المتقاطعة.

Haoming Meng, Kexin Huang, Shaohang Wei, Chiyu Ma, Shuo Yang, Xue Wang, Guoyin Wang, Bolin Ding, Jingren Zhou2026-03-25
💬 NLP

Towards Automated Community Notes Generation with Large Vision Language Models for Combating Contextual Deception

تتناول هذه الورقة تحدي التوليد الآلي لملاحظات المجتمع (Community Notes) فيما يتعلق بالتضليل السياقي القائم على الصور من خلال تقديم مجموعة بيانات XCheck، وإطار العمل متعدد الوكلاء ACCNote المبني على النماذج اللغوية البصرية الكبيرة، ومقياس تقييم درجة مساعدة السياق (CHS)، مما يثبت أداءً فائقاً على النماذج المرجعية والأدوات التجارية.

Jin Ma, Jingwen Yan, Mohammed Aldeen, Ethan Anderson, Taran Kavuru, Jinkyung Katie Park, Feng Luo, Long Cheng2026-03-25
💬 NLP

LLM-guided headline rewriting for clickability enhancement without clickbait

تقدم هذه الورقة إطار عمل يعتمد على النماذج اللغوية الكبيرة (LLM) وقابلاً للتحكم باستخدام نموذج FUDGE ودليلين مساعدين مزدوجين لإعادة كتابة عناوين الأخبار التي تعزز تفاعل القراء مع الحفاظ بدقة على الأمانة الدلالية وتجنب أسلوب "صيد النقرات" (clickbait).

Yehudit Aperstein, Linoy Halifa, Sagiv Bar, Alexander Apartsin2026-03-25
💬 NLP

Rashid: A Cipher-Based Framework for Exploring In-Context Language Learning

تقدم الورقة البحثية "رشيد" (Rashid)، وهو إطار عمل يقوم بتشفير اللغات ذات الموارد العالية بشكل عكسي لإنشاء لغات "غير مرئية" غنية بالموارد وقابلة للتحكم، مما يتيح تقييماً قابلاً للتوسع وصارماً لاستراتيجيات تعلم اللغة في السياق (ICLL)، ويتغلب على محدودية البيانات والأدوات المرتبطة عادةً باللغات ذات الموارد المنخفضة.

Niyati Bafna, Ryan Soh-Eun Shim, Barbara Plank, David Yarowsky, Hale Sirin2026-03-25
💬 NLP

Reddit After Roe: A Computational Analysis of Abortion Narratives and Barriers in the Wake of Dobbs

تقدم هذه الدراسة تحليلاً حوسبياً واسع النطاق لأكثر من 17,000 منشور على منصة "ريديت" لإثبات أن العوائق العاطفية والنفسية تهيمن باستمرار على السرديات المتعلقة بالإجهاض عبر الإنترنت في أعقاب قرار "دوبس" لعام 2022، مع رسم خرائط لكيفية تطور هذه العوائق، والمشاعر المرتبطة بها، وسلوكيات البحث عن المعلومات عبر مراحل مختلفة من عملية الإجهاض والتحولات القانونية.

Aria Pessianzadeh, Alex H. Poole, Rezvaneh Rezapour2026-03-25
💬 NLP

CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

تقدم هذه الورقة CAPITU، وهو معيار مرجعي جديد لتقييم قدرات اتباع التعليمات باللغة البرتغالية البرازيلية من خلال وضع 59 مهمة قابلة للتحقق ضمن ثمانية أعمال أدبية كلاسيكية، مما يكشف أنه بينما تحقق نماذج الاستدلال الرائدة دقة عالية، فإن النماذج المتخصصة في اللغة البرتغالية تقدم كفاءة أعلى من حيث التكلفة مع تسليط الضوء على تحديات محددة في القيود الصرفية والاتساق متعدد الجولات.

Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio La (…)2026-03-25
💬 NLP

Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?

تقيم هذه الدراسة مدى أمانة 12 نموذجاً من نماذج الاستدلال مفتوحة الأوزان عبر 9 عائلات معمارية، كاشفةً أن استدلال "سلسلة الأفكار" غالباً ما يفشل في عكس العوامل الحقيقية المؤثرة في مخرجات النماذج بدقة، مع تباين معدلات الإقرار بشكل كبير حسب منهجية التدريب ونوع التلميح، بينما يُظهر قمعاً منهجياً للتأثير في نص الإجابة النهائي رغم الاعتراف به داخلياً.

Richard J. Young2026-03-25
💬 NLP

LGSE: Lexically Grounded Subword Embedding Initialization for Low-Resource Language Adaptation

تقترح الورقة البحثية إطار عمل LGSE، الذي يعمل على تحسين تكييف اللغات ذات الموارد المنخفضة من خلال تهيئة تمثيلات الرموز الجديدة (token embeddings) باستخدام تمثيلات قائمة على المورفولوجيا و n-grams للحروف، مما يؤدي إلى التفوق على الأساليب الحالية في مهام مثل الإجابة على الأسئلة والتعرف على الكيانات المسماة للغات مثل الأمهرية والتغرينية.

Hailay Teklehaymanot, Dren Fazlija, Wolfgang Nejdl2026-03-25
💬 NLP

Multi-Method Validation of Large Language Model Medical Translation Across High- and Low-Resource Languages

تُظهر هذه الدراسة أن أربعة من النماذج اللغوية الكبيرة الرائدة تحافظ بفعالية على المعنى الطبي عبر اللغات ذات الموارد العالية والمتوسطة والمنخفضة، مما يشير إلى قدرتها على تحسين الوصول اللغوي العادل في مجال الرعاية الصحية بشكل كبير من خلال التغلب على حواجز التكلفة وتوافر الترجمة الاحترافية.

Chukwuebuka Anyaegbuna, Eduardo Juan Perez Guerrero, Jerry Liu, Timothy Keyes, April Liang, Natasha Steele, Stephen Ma (…)2026-03-25
💬 NLP

Improving LLM Predictions via Inter-Layer Structural Encoders

تقدم هذه الورقة مشفرات البنية بين الطبقات (ILSE)، وهو نهج مبتكر يستخدم "Cayley-Encoder" لتجميع المعلومات من طبقات النماذج اللغوية الكبيرة (LLM) المتوسطة، مما يتفوق بشكل كبير على تنبؤات الطبقة النهائية القياسية عبر مهام متنوعة ويمكّن النماذج الأصغر من منافسة النماذج الأكبر.

Tom Ulanovski (Tel Aviv University), Eyal Blyachman (Tel Aviv University), Maya Bechler-Speicher (Meta)2026-03-25