💬 NLP

Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment

تقدم هذه الورقة HyWIA، وهي طريقة تقليم هيكلي تكيفية جديدة للنماذج اللغوية الكبيرة تستفيد من آلية الانتباه لدمج تقييمات أهمية الأوزان دقيقة الحبيبات وخشنة الحبيبات، مما يتفوق بشكل كبير على الأساليب الحالية في الحفاظ على الدقة عبر مختلف المعايير.

Jun Liu, Zhenglun Kong, Pu Zhao, Changdi Yang, Hao Tang, Xuan Shen, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Dong Huan (…)2026-03-12
💬 NLP

Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning

تقترح هذه الورقة مساراً عاماً لتنظيف الرموز (tokens) لعملية الضبط الدقيق الخاضع للإشراف للنماذج اللغوية الكبيرة، يقوم بتصفية الرموز غير المفيدة بناءً على تأثيرها على تحديثات النموذج، مما يؤدي إلى تحسين الأداء في المهام اللاحقة من خلال إعطاء الأولوية لجودة البيانات على كميتها على مستوى الرمز.

Jinlong Pang, Na Di, Zhaowei Zhu, Jiaheng Wei, Hao Cheng, Chen Qian, Yang Liu2026-03-12
💬 NLP

BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models

تقدم هذه الورقة "BiasCause"، وهو إطار عمل ومعيار يتكون من 1,788 سؤالاً تم التحقق منها يدوياً، صُممت لتقييم كيفية توظيف النماذج اللغوية الكبيرة للاستدلال السببي عند معالجة الانحيازات الاجتماعية، مما يكشف أن النماذج تظهر في كثير من الأحيان استدلالاً منحازاً أو "منحازاً خاطئاً"، مع تحديد استراتيجيات محددة تستخدمها لتجنب مثل هذه الانحيازات.

Tian Xie, Tongxin Yin, Vaishakh Keshava, Xueru Zhang, Siddhartha Reddy Jonnalagadda2026-03-12
💬 NLP

QCSE: A Pretrained Quantum Context-Sensitive Word Embedding for Natural Language Processing

تقدم هذه الورقة البحثية نموذج QCSE، وهو نموذج لتمثيل الكلمات حساس للسياق كمي مدرب مسبقاً يستخدم طرقاً مبتكرة لحساب مصفوفة السياق لالتقاط العلاقات اللغوية، ويُظهر فاعليته في كل من مجموعات البيانات باللغة الإنجليزية ولغة الفولاني ذات الموارد المنخفضة، مما يسلط الضوء على إمكانات معالجة اللغات الطبيعية الكمية في مواجهة تحديات ندرة البيانات.

Charles M. Varmantchaonala, Niclas Götting, Nils-Erik Schütte, Jean Louis E. K. Fendji, Christopher Gies2026-03-12
💬 NLP

Are you sure? Measuring models bias in content moderation through uncertainty

تقترح هذه الورقة نهجاً غير خاضع للإشراف باستخدام التنبؤ المطابق لقياس انحياز النماذج اللغوية في الإشراف على المحتوى من خلال تحليل عدم اليقين في التنبؤ للمجموعات المستضعفة، مما يكشف أن الدقة العالية لا تعني بالضرورة ثقة عالية، وبالتالي يقدم مقياساً جديداً لتوجيه عملية إزالة الانحياز في النماذج.

Alessandra Urbinati, Mirko Lai, Simona Frenda, Marco Antonio Stranisci2026-03-12✓ Author reviewed
💬 NLP

SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation

تقترح الورقة البحثية SAGE، وهو إطار عمل جديد لمحاكاة المستخدم لتقييم الوكلاء متعددي الأدوار يدمج بين منطق الأعمال من الأعلى إلى الأسفل ومعرفة البنية التحتية من الأسفل إلى الأعلى لتوليد تفاعلات واقعية ومتنوعة قادرة على تحديد أخطاء الوكلاء بشكل أكبر بكثير من الطرق الحالية.

Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu2026-03-12
💬 NLP

Assessing the Political Fairness of Multilingual LLMs: A Case Study based on a 21-way Multiparallel EuroParl Dataset

تقدم هذه الورقة مجموعة بيانات "EuroParl" جديدة متعددة المسارات بـ 21 مساراً لتقييم الانحياز السياسي في النماذج اللغوية الكبيرة متعددة اللغات، وذلك من خلال إثبات أن جودة الترجمة تحابي بشكل منهجي الأحزاب الأغلبية على حساب المجموعات الخارجية، مما يقدم بديلاً قائماً على العدالة لطرق الاستطلاع التقليدية باللغة الإنجليزية.

Paul Lerner, François Yvon2026-03-12
💬 NLP

KV Cache Transform Coding for Compact Storage in LLM Inference

يُعد KVTC مشفر تحويل خفيف الوزن ومستقل عن النموذج، يحقق ضغطاً يصل إلى 20 ضعفاً (أو أكثر) لذاكرة التخزين المؤقت للمفاتيح والقيم (Key-Value caches) لنماذج اللغات الكبيرة من خلال الجمع بين إلغاء الارتباط القائم على تحليل المكونات الرئيسية (PCA)، والكمية التكيفية، وترميز الإنتروبيا، مما يتيح تقديم الخدمة بكفاءة في استهلاك الذاكرة مع استخدام ذاكرة تخزين مؤقت قابلة لإعادة الاستخدام مع الحفاظ على دقة الاستنتاج والسياق الطويل.

Konrad Staniszewski, Adrian Łańcucki2026-03-12
💬 NLP

Get away with less: Need of source side data curation to build parallel corpus for low resource Machine Translation

تقدم هذه الورقة إطار عمل LALITA، الذي يعمل على تنسيق مجموعات نصوص متوازية فعالة للترجمة الآلية منخفضة الموارد من خلال اختيار الجمل المصدرية المعقدة بناءً على السمات المعجمية واللغوية، مما يحسن جودة الترجمة بشكل كبير مع تقليل متطلبات البيانات بأكثر من النصف.

Saumitra Yadav, Manish Shrivastava2026-03-12
💬 NLP

Evaluating Long-Horizon Memory for Multi-Party Collaborative Dialogues

تقدم هذه الورقة EverMemBench، وهو أول معيار مصمم لتقييم الذاكرة طويلة المدى في الحوارات التعاونية متعددة الأطراف، والذي يكشف أن أنظمة النماذج اللغوية الكبيرة الحالية تعاني من صعوبات في الاستدلال متعدد الخطوات، والنسخ الزمني، واسترجاع الصلة الضمنية في سيناريوهات التفاعل الواقعية والمعقدة.

Chuanrui Hu, Tong Li, Xingze Gao, Hongda Chen, Yi Bai, Dannong Xu, Tianwei Lin, Xiaohong Li, Yunyun Han, Jian Pei, Yafen (…)2026-03-12