💬 NLP

Chunking German Legal Code

تُثبت هذه الورقة البحثية أنه بالنسبة لعمليات التوليد المعزز بالاسترجاع على القانون التشريعي الألماني، فإن استراتيجيات تقسيم النصوص التي تتماشى مع الوحدات الهيكلية المتأصلة في المستند (مثل الأقسام والفقرات الفرعية) تتفوق على الأساليب الدلالية أو الهرمية الأكثر تعقيداً من خلال تحقيق استدعاء أعلى بكفاءة حوسبية أكبر.

Max Prior, Natalia Milanova, Andreas Schultz2026-05-20
💬 NLP

LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation

تقدم هذه الورقة LP-Eval، وهو معيار تقييم ومجموعة بيانات صُمما معاً بالتعاون مع خبراء قانونيين لتقييم جودة المقترحات القانونية التي تولدها النماذج اللغوية الكبيرة من قرارات محكمة الاتحاد الأوروبي، مما يكشف أنه بينما تنتج النماذج مخرجات عالية الجودة بشكل عام، إلا أن أداءها يتفاوت باختلاف عمر القضية، وأن المقيمين من النماذج اللغوية الكبيرة الموجهين بمعايير التقييم، رغم كونهم أفضل من التقييم المباشر، لا يزالون يفتقرون إلى الحساسية الدقيقة التي يتمتع بها الخبراء البشريون.

Shanshan Xu, Johan Lindholm, Amogh Raina, Henrik Palmer Olsen, Daniel Hershcovich2026-05-20
⚡ electrical engineering

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

تقدم الورقة البحثية Mega-ASR، وهو إطار عمل قابل للتوسع يستفيد من مجموعة بيانات Voices-in-the-Wild-2M التي تم إنشاؤها حديثًا واستراتيجيات التدريب التدريجي للتغلب على عقبة المتانة الصوتية، محققًا أداءً فائقًا ومتميزًا في التعرف على الكلام تحت ظروف التشوهات التركيبية المعقدة والواقعية.

Zhifei Xie, Kaiyu Pang, Haobin Zhang, Deheng Ye, Xiaobin Hu, Shuicheng Yan, Chunyan Miao2026-05-20
💬 NLP

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

تقدم هذه الورقة FineBench، وهو معيار واسع النطاق للأنشطة البشرية دقيق التفاصيل مع تعليقات توضيحية كثيفة على مقاطع الفيديو طويلة المدى، وتقترح FineAgent، وهو إطار عمل معياري يعزز بشكل كبير قدرات الاستدلال المكاني وفهم الأفعال في النماذج اللغوية البصرية مفتوحة المصدر.

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu2026-05-20
💬 NLP

Where Does Authorship Signal Emerge in Encoder-Based Language Models?

تُثبت هذه الورقة أنه بينما تتوفر سمات الأسلوب التأليفي في جميع طبقات النماذج القائمة على الترميز، فإن اختيار آلية التسجيل (التجميع المتوسط مقابل التفاعل المتأخر) يحدد سببيًا الطبقة المحددة التي يدمج فيها النموذج هذه الإشارات، مما يفسر الاختلافات الجوهرية في الأداء بين النماذج المتطابقة بخلاف ذلك.

Francis Kulumba, Guillaume Vimont, Laurent Romary, Florian Cafiero2026-05-20
🤖 AI

PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents

إن PEEK هو نظام يعزز وكلاء النماذج اللغوية الكبيرة ذات السياق الطويل من خلال تخزين معرفة التوجيه القابلة لإعادة الاستخدام حول السياقات الخارجية المتكررة في "خريطة سياق" صغيرة ومستمرة، مما يحسن دقة وكفاءة الاستدلال بشكل كبير مع تقليل التكاليف الحسابية مقارنة بالنماذج المرجعية الحالية.

Zhuohan Gu, Qizheng Zhang, Omar Khattab, Samuel Madden2026-05-20
💬 NLP

What Are LLMs Doing to Scientific Communication? Measuring Changes in Writing Practices and Reading Experience

تبحث هذه الورقة في كيفية إعادة تشكيل النماذج اللغوية الكبيرة للتواصل العلمي في مجال معالجة اللغات الطبيعية من خلال تحليل مجموعة من أوراق مؤتمر (ACL) وبيانات اصطناعية للكشف عن تحولات أسلوبية كبيرة نحو لغة أكثر تعقيداً وأقل تنوعاً يجدها الخبراء أكثر وضوحاً ولكنها مثيرة للجدل من الناحية الذاتية.

Filip Miletić, Neele Falk2026-05-20
💬 NLP

GEM: GPU-Variability-Aware Expert to GPU Mapping for MoE Systems

إن GEM هو إطار عمل يعمل على تحسين زمن انتقال الاستدلال لنماذج خليط الخبراء (MoE) من خلال تعيين الخبراء إلى وحدات معالجة الرسومات بناءً على تباين الأجهزة وأنماط تحميل الرموز، مما يقلل من آثار التأخر ويحسن الأداء النهائي بنسبة تصل إلى 16.5%.

Sourish Wawdhane, Avinash Kumar, Poulami Das2026-05-20
💬 NLP

FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration

يُعد FlexDraft إطار عمل لفك التشفير الاستباقي غير الفاقد للبيانات، يعمل على تسريع استنتاج النماذج اللغوية الكبيرة عبر أحجام دفعات متفاوتة من خلال الجمع بين ضبط الانتباه لضمان نشر كتل عالي الجودة، والمعايرة الموجهة بالمكافآت لحل عدم التطابق في التحقق من المسودات، وآلية تبديل ديناميكية تعمل على التحسين بين أوضاع التنفيذ المتوازي والمتسلسل.

Yaojie Zhang, Jianuo Huang, Junlong Ke, Yuhang Han, Yongji Long, Tianchen Zhao, Biqing Qi, Linfeng Zhang2026-05-20
💬 NLP

Language Mutations Sustain the Persistences of Conspiracy Theories on Social Media

تحلل هذه الدراسة مجموعة بيانات من منشورات منصة "إكس" تمتد لثلاث سنوات لتثبت أن الطفرات اللغوية والهيكلية في نظريات المؤامرة، لا سيما من خلال التبسيط والاستيعاب، تطيل عمرها الافتراضي عبر الإنترنت بشكل كبير، مما يشير إلى أن استراتيجيات الإشراف على المحتوى يجب أن تستهدف الادعاءات الجوهرية لمواجهة متغيراتها المستمرة بفعالية.

Calvin Yixiang Cheng, Dorian Quelle, Scott A. Hale2026-05-20