💬 NLP

TQLite: Multi-LLM Jury Guided Distillation for Real-time MQM Translation Quality Evaluation

تقدم هذه الورقة TQLite، وهو إطار عمل تقطير مبتكر يستفيد من هيئة تحكيم متعددة النماذج اللغوية الكبيرة لتوليد بيانات تدريب اصطناعية عالية الجودة، مما يمكّن النماذج اللغوية الصغيرة من تحقيق أداء في تقييم جودة الترجمة يتسم بالسرعة والقابلية للتوسع ويضاهي النماذج اللغوية الكبيرة المكلفة حوسبياً.

Bhavin Jawade, Cameron R. Wolfe2026-08-05
💬 NLP

Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models

تقترح هذه الدراسة إطار تقييم متعدد الأبعاد يتجاوز مقاييس الدقة البسيطة ليكشف كيف تبني 15 نموذجاً من نماذج اللغات الكبيرة وتتواصل في مجال الاستدلال الإحصائي، مما يثبت أنه بينما تتباين الدقة بشكل كبير، تشترك النماذج في هياكل مفاهيمية عامة ولكنها تظهر أساليب تفسيرية متميزة خاصة بكل شركة مصنعة.

Monnie McGee, Mateo Langston Smith, Julian Cabrera2026-08-05
💬 NLP

Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation

تحل هذه الورقة التضارب في النتائج المتعلقة باستخدام النماذج اللغوية الكبيرة لمحاكاة الآراء من خلال التمييز بين "المحاكاة" (توليد استجابات فردية) و"التقدير" (التنبؤ بالتوزيعات)، مظهرةً أن النماذج الأساسية تتفوق في الأولى بينما تتفوق النماذج التي خضعت للتدريب اللاحق في الثانية.

Seth Grief-Albert, Jessica Bo, Difan Jiao, Ashton Anderson2026-08-05
💬 NLP

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

تقدم الورقة البحثية PI-Mem، وهي آلية ذاكرة تكرارية متوازية تعالج جميع قطع السياق في وقت واحد وتعمل بشكل تكراري على تحسين ذاكرة مشتركة باستخدام الإنهاء التكيفي القائم على التعلم التعزيزي، مما يمكّن النماذج اللغوية الكبيرة من تحقيق دقة فائقة وتسريع كبير في الاستدلال في مهام الاستدلال ذات السياق الطويل التي تصل إلى 3.6 مليون رمز.

Dawei Liu, Haixu Song, Shuang Cheng, Shijie Wang, Haozheng Hou, Kaifeng Liu, Ermo Hua, Zhonghang Yuan, Zhijie Zhong, Yuc (…)2026-08-05
💬 NLP

SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay

يُعد SeqLLM إطار عمل مبتكر تم نشره في WeChat Pay، يعمل على تعزيز النماذج اللغوية الكبيرة عبر نمذجة التسلسل السلوكي من خلال مفردات منفصلة مدمجة، وجهاز عرض محاذاة ثنائي المراحل، وحقن قدرات موجه بالبادئة، مما يحقق نتائج رائدة في معايير مراقبة مخاطر التجار والتوصيات مع الحفاظ على القدرات اللغوية الأصلية للنموذج.

Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang2026-08-05
💬 NLP

AI Security Leaderboard: Methodology, Results and Minimal Standard

تقدم هذه الورقة "المعيار الأدنى للضمانات" من FAR.AI، وهو معيار مرجعي لتقييم نماذج الذكاء الاصطناي التوليدي المتقدمة مقابل 67 تقنية لكسر الحماية (jailbreak) ثابتة عبر تهديدات CBRNE والتهديدات السيبرانية، مما يكشف أنه بينما تظل بعض النماذج مثل Claude Fable 5 وGPT-5.6 Sol قوية، فإن نماذج أخرى مثل Grok 4.5 وGemini 3.1 Pro تظهر ثغرات غير متساوية للغاية وقابلة للاستغلال يمكن معالجتها باستخدام استراتيجيات الدفاع المتعدد الطبقات الحالية.

Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Y (…)2026-08-05
🤖 machine learning

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

تقترح الورقة البحثية إطار عمل SMOPD، وهو إطار عمل لتقطير السياسات عبر الإنترنت يعتمد على مرحلتين هما "التخصص والدمج"، حيث يقوم بتدريب نماذج معلمة متخصصة في المكافآت ودمجها في سياسة طالب واحدة لموازنة إشارات المكافآت المتعددة ذات المستويات المتباينة من الكفاءة بفعالية، متفوقاً بذلك على الأساليب الحالية مثل GDPO عبر مختلف هياكل النماذج الأساسية.

Wen Wang, Jiahua Bao, Tu Yongsiqi, Yihao Liu, Haotian Zhou, Haoxuan Ma, Mengyu Zhou, Wenkui Fan, Junwei He, Xiaoxi Jiang (…)2026-08-05
💬 NLP

VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP

تقدم الورقة البحثية VIVID، وهو أول معيار مرجعي قائم على الثقافة للغة المجازية الفيتنامية، والذي يكشف أن النماذج الحالية المتطورة، بما في ذلك النماذج المتخصصة في اللغة الفيتنامية، تعاني بشكل كبير مع الاصطلاحات والأمثال الدقيقة بسبب التفسير الحرفي المفرط والافتقار إلى الكفاءة الثقافية.

Tu Tran Do, Nhat Ngoc Nguyen, Khanh-Tung Tran, Hoang D. Nguyen, Tu Minh Phuong, Long Hoang Dang2026-08-05
💬 NLP

What Language Does and What the Evidence Supports: A Functional Role Taxonomy and Evidence Audit of Language Grounding in Embodied Agents

تقترح هذه الورقة تصنيفاً للأدوار الوظيفية لتدقيق كيفية تجذر اللغة في الوكلاء المتجسدين، مما يكشف عن فجوة متكررة بين المساهمات اللغوية المزعومة والأدلة الفعلية التي تدعمها عبر البنى المختلفة.

Yifan Guo, Chenghao Li, Zhu Wang, Wei Xu, Yu Li, Yulong Zhu, Zhuo Sun, Bin Guo, Zhiwen Yu2026-08-05
💬 NLP

HomoEnsNER: Does Language Alignment Outperform Architectural Complexity in Gujarati Named Entity Recognition?

تقترح الورقة البحثية HomoEnsNER، وهو تجمع متجانس من خمسة نماذج GujaratiBERT يتفوق على كل من النموذج المرجعي المنفرد والبنيات غير المتجانسة المتنوعة، مما يثبت أن التجميع المتوافق لغوياً هو استراتيجية أكثر فعالية ومراعاة للميزانية لتعرّف الكيانات المسماة في اللغة الغوجاراتية من التعقيد البنيوي.

Chandrakant K. Bhogayata2026-08-05