💬 NLP

Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics

تقدم هذه المساهمة مجموعة بيانات LEGIT، وهي مجموعة بيانات واسعة النطاق تضم 24,000 مسار استدلال قانوني بمستوى الخبراء مهيكلة كأشجار مشكلات هرمية، وتعمل كإطار تقييم قوي لتقييم وتوضيح كيف يمكن لتعزيز التوليد باسترجاع المعلومات والتعلم التعزيزي أن يتكاملا لتعزيز شمولية وصحة الاستدلال القانوني في النماذج اللغوية الكبيرة.

Jinu Lee, Kyoung-Woon On, Simeng Han, Arman Cohan, Julia Hockenmaier2026-05-04
💬 NLP

Peek2: Regex-free Byte-level Byte-Pair Encoding Pretokenizer for LLM Inference on Edge Devices

تقدم الورقة البحثية Peek2، وهو محلل أولي (pretokenizer) عالي التحسين وخالٍ من التعبيرات النمطية (regex-free) لتقنية Byte-level BPE، والذي يحقق سرعة إنتاجية في الاختبارات المرجعية الدقيقة تصل إلى 2.48 ضعفاً وسرعة ترميز إجمالية تبلغ 1.14 ضعفاً على الأجهزة الطرفية مع الحفاظ على مخرجات متطابقة مع أدوات الترميز القياسية القائمة على cl100k.

Liu Zai, Iraklis Klampanos2026-05-04
💬 NLP

Short Chains, Deep Thoughts: Balancing Reasoning Efficiency and Intra-Segment Capability via Split-Merge Optimization

تقدم الورقة البحثية CoSMo، وهو إطار عمل يعزز نماذج الاستدلال الكبيرة باستخدام خوارزمية تقسيم ودمج موجهة بالاتساق وتعلم تعزيزي متوافق مع البنية للقضاء على التكرار الهيكلي، مما يؤدي إلى تحسين الدقة بشكل كبير مع تقليل العبء الحسابي.

Runquan Gui, Jie Wang, Zhihai Wang, Chi Ma, Jianye Hao, Feng Wu2026-05-04
💬 NLP

Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection

تقترح هذه الورقة البحثية "انتباه التوكن المتناثر" (Token Sparse Attention)، وهو آلية ديناميكية وعكوسة لتناثر مستوى التوكن تعمل على ضغط وفك ضغط أزواج المفتاح والقيمة (key-value pairs) أثناء عملية الانتباه لتحقيق تسريع كبير في الاستنتاج لنماذج اللغات الكبيرة ذات السياق الطويل مع حد أدنى من التدهور في الدقة.

Dongwon Jo, Beomseok Kang, Jiwon Song, Jae-Joon Kim2026-05-04
💬 NLP

Language Models Struggle to Use Representations Learned In-Context

على الرغم من الأدلة التي تشير إلى أن النماذج اللغوية الكبيرة يمكنها ترميز تمثيلات دلالية جديدة من المعلومات الواردة في السياق، إلا أن هذه الدراسة تكشف أن كلاً من النماذج مفتوحة الأوزان والنماذج المتطورة مغلقة المصدر تواجه صعوبة في الاستفادة بفعالية من هذه التمثيلات المتعلمة لتكييف سلوكها مع المهام اللاحقة.

Michael A. Lepori, Tal Linzen, Ann Yuan, Katja Filippova2026-05-04
💻 computer science

Exploring LLM biases to manipulate AI search overview

تُظهر هذه الورقة أن أنظمة نظرة عامة النماذج اللغوية الكبيرة (LLM) عرضة للتحيز في اختيار المصادر، وهو ما يمكن استغلاله عبر تدريب نموذج تعلم تعزيزي لإعادة كتابة مقتطفات البحث والتلاعب بالنتائج، مع تسليط الضوء أيضاً على مخاطر السلامة المرتبطة بهجمات تسميم السياق.

Roman Smirnov2026-05-04
💬 NLP

Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

تقدم هذه الورقة البحثية معيار HUMANS، وهو إطار تقييم فعال لنماذج الصوت الكبيرة يعتمد على مجموعات فرعية منسقة بعناية تتكون من 50 مثالاً فقط لتحقيق ارتباط عالٍ مع المعايير الكاملة، ومن خلال النمذجة الانحدارية، يتفوق بشكل كبير على كل من المجموعات الفرعية العشوائية والمعايير الكاملة في التنبؤ بتفضيلات المستخدمين البشريين.

Woody Haosheng Gan, William Held, Diyi Yang2026-05-04
💬 NLP

NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus

تقدم الورقة البحثية نموذج NorBERTo، وهو نموذج حديث يعتمد على المشفر فقط (encoder-only) للغة البرتغالية البرازيلية، تم تدريبه على أكبر مجموعة بيانات أحادية اللغة متاحة علنًا (Aurora-PT) وتضم 331 مليار رمز، حيث يحقق أداءً هو الأفضل في مجاله في العديد من الاختبارات المرجعية الدلالية ويقدم حلاً فعالاً وقابلاً للنشر لمهام معالجة اللغات الطبيعية اللاحقة.

Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer (…)2026-05-04
💬 NLP

How Frontier LLMs Adapt to Neurodivergence Context: A Measurement Framework for Surface vs. Structural Change in System-Prompted Responses

تقدم هذه الورقة NDBench، وهو معيار اختبار ذو 576 مخرجاً يوضح أن النماذج اللغوية الكبيرة الرائدة تكيف استجاباتها بشكل كبير لتناسب سياقات التنوع العصبي من خلال إنتاج مخرجات أطول وأكثر هيكلة وتفصيلاً عند توجيهها صراحةً، بينما توفر أيضاً إطار عمل قابلاً لإعادة الإنتاج لتدقيق مثل هذه التكيفات.

Ishan Gupta, Pavlo Buryi2026-05-04
💬 NLP

Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues

تقدم هذه الورقة البحثية ArabCulture-Dialogue، وهي مجموعة بيانات جديدة تغطي 13 دولة ناطقة باللغة العربية بكل من اللغة العربية الفصحى واللهجات المحلية عبر 12 موضوعاً من مواضيع الحياة اليومية، وذلك لتقييم نماذج اللغات الكبيرة في مجالات الاستدلال الثقافي، والترجمة الآلية، وتوليد النصوص الموجهة للهجات، مما يكشف عن ضعف أداء النماذج باستمرار في المهام اللهجوية مقارنة بنظيراتها في اللغة العربية الفصحى.

Muhammad Dehan Al Kautsar, Saeed Almheiri, Momina Ahsan, Bilal Elbouardi, Younes Samih, Sarfraz Ahmad, Amr Keleg, Omar E (…)2026-05-04