💬 NLP

CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models

تقدم الورقة البحثية CxMP، وهو معيار للأزواج الدنيا قائم على قواعد البناء، والذي يكشف أنه بينما تكتسب النماذج اللغوية الكفاءة النحوية بسرعة، فإن قدرتها على تفسير العلاقات الدلالية للبنى القواعدية تتطور بشكل أكثر تدرجاً وتظل محدودة حتى في النماذج الضخمة.

Miyu Oba, Saku Sugawara2026-02-26
⚡ electrical engineering

TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition

تقدم هذه الورقة البحثية إطار عمل TG-ASR، وهو إطار عمل موجه بالترجمة يستخدم آلية انتباه متقاطع بوابي متوازي ومتنًا جديدًا من دراما لغة هوكين التايوانية مدته 30 ساعة (YT-THDC) لتحسين التعرف الآلي على الكلام في الموارد المنخفضة بشكل كبير من خلال الاستفادة من ترجمات الماندرين والتمثيلات المتعددة اللغات، محققًا انخفاضًا نسبيًا بنسبة 14.77% في معدل خطأ الحروف.

Cheng-Yeh Yang, Chien-Chun Wang, Li-Wei Chen, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen2026-02-26
💬 NLP

Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference

تقترح الورقة استراتيجية اختيار نماذج متعددة المقاييس مدفوعة بالثقة، تقوم بتوجيه المهام ديناميكياً إلى نماذج أصغر أو أكبر بناءً على الدقة المقدرة، مما يحقق أداءً مقارناً لأكبر النماذج مع تقليل التكاليف الحسابية واستهلاك رموز الـ API بشكل كبير.

Bo-Wei Chen, Chung-Chi Chen, An-Zi Yen2026-02-26
💬 NLP

IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages

تقدم هذه الورقة IndicIFEval، وهو معيار مرجعي يتكون من 800 مثال تم التحقق منها بشرياً عبر 14 لغة هندية لتقييم قدرات النماذج اللغوية الكبيرة في اتباع التعليمات، مما يكشف أنه بينما تلتزم النماذج جيداً بقيود التنسيق، إلا أنها تتخلف بشكل كبير عن الأداء باللغة الإنجليزية في المهام المعجمية وعبر اللغوية.

Thanmay Jayakumar, Mohammed Safi Ur Rahman Khan, Raj Dabre, Ratish Puduppully, Anoop Kunchukuttan2026-02-26
💬 NLP

When AI Writes, Whose Voice Remains? Quantifying Cultural Marker Erasure Across World English Varieties in Large Language Models

تقدم هذه الدراسة مفهوم "التلاشي الثقافي" (Cultural Ghosting) لقياس كيفية قيام النماذج اللغوية الكبيرة بمحو العلامات اللغوية من تنوعات اللغة الإنجليزية غير الأصلية، مثل الإنجليزية الهندية والسنغافورية والنيجيرية، مما يكشف عن مفارقة حيث يتم الحفاظ على المعنى الدلالي بينما تضيع الهوية الثقافية، رغم أن المطالبات الصريحة يمكن أن تخفف من هذا المحو بشكل كبير.

Satyam Kumar Navneet, Joydeep Chandra, Yong Zhang2026-02-26
💬 NLP

SumTablets: A Transliteration Dataset of Sumerian Tablets

تقدم هذه الورقة البحثية SumTablets، وهي مجموعة بيانات شاملة تزاوج بين 91,606 لوحاً من الكتابة المسمارية السومرية ونصوصها المترجمة من Oracc لتمكين تطبيقات معالجة اللغات الطبيعية الحديثة، مبرهنةً على أن نماذج اللغة ذات التوليد الذاتي والضبط الدقيق يمكنها تحقيق دقة عالية (97.55 chrF) في أتمتة عملية الترجمة الحرفية.

Cole Simmons, Richard Diehl Martinez, Dan Jurafsky2026-02-26
💬 NLP

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

تقدم هذه الورقة البحثية "Recovered in Translation"، وهو إطار عمل مؤتمت يستفيد من استراتيجيات توسيع نطاق الحوسبة في وقت الاختبار مثل التحسين الذاتي الشامل وطريقة T-RANK المبتكرة لإنتاج ترجمات عالية الجودة ومحافظة على المعنى للمعايسات المرجعية إلى ثماني لغات من شرق وجنوب أوروبا، وذلك للتغلب على قيود الموارد الحالية وتمكين تقييم أكثر موثوقية للنماذج اللغوية الكبيرة متعددة اللغات.

Hanna Yukhymenko, Anton Alexandrov, Martin Vechev2026-02-26
💬 NLP

Augmenting Lateral Thinking in Language Models with Humor and Riddle Data for the BRAINTEASER Task

تقدم هذه الورقة نظاماً يعزز أداء نموذج DeBERTaV3 في مهمة SemEval 2024 BRAINTEASER من خلال ضبطه بدقة باستخدام بيانات الفكاهة والألغاز لتحسين التفكير الجانبي، مما يثبت أن هذا التعزيز يرفع الدقة بشكل كبير في ألغاز الجمل، وأن صياغة المهمة كاختيار من متعدد تحقق مكاسب جوهرية مقارنة بتصنيف المتواليات.

Mina Ghashami, Soumya Smruti Mishra2026-02-25
💬 NLP

Causal Claims in Economics

تقدم هذه الورقة رسومًا بيانية للادعاءات مشروحة بالأدلة لرسم العلاقات السببية وغير السببية عبر 44,852 ورقة بحثية في مجال الاقتصاد من عام 1980 إلى عام 2023، مما يكشف عن ارتفاع كبير في الادعاءات السببية بمرور الوقت ويثبت أن الأوراق البحثية ذات البنى السردية السببية الأكثر قوة والجدة هي الأكثر عرضة للنشر في المجلات المرموقة والحصول على استشهادات طويلة الأمد.

Prashant Garg, Thiemo Fetzer2026-02-25