💬 NLP

The Token Tax: Systematic Bias in Multilingual Tokenization

تُثبت هذه الورقة أن عدم كفاءة التجزئة (tokenization) تفرض "ضريبة توكن" على اللغات الأفريقية ذات البنية الصرفية المعقدة والموارد المحدودة، وذلك من خلال ربط ارتفاع معدل الخصوبة في التوكنات (token fertility) بانخفاض الدقة وزيادة التكاليف بشكل كبير، مع تسليط الضوء على أن نماذج الاستدلال يمكن أن تساعد في تقليص فجوات الأداء هذه.

Jessica M. Lundin, Ada Zhang, Nihal Karim, Hamza Louzan, Victor Wei, David Adelani, Cody Carroll2026-03-04
💬 NLP

Bridging Kolmogorov Complexity and Deep Learning: Asymptotically Optimal Description Length Objectives for Transformers

تجسّر هذه الورقة البحثية الفجوة بين تعقيد كولموغوروف والتعلم العميق من خلال إثبات وجود أهداف لطول الوصف مثالية تقاربيًا لنماذج المحولات (Transformers)، واستعراض تنفيذ تبايني قابل للتطبيق يعزز التعميم منخفض التعقيد، على الرغم من التحديات الكبيرة في عملية التحسين.

Peter Shaw, James Cohan, Jacob Eisenstein, Kristina Toutanova2026-03-04
💬 NLP

Death of the Novel(ty): Beyond n-Gram Novelty as a Metric for Textual Creativity

تجادل هذه الورقة بأن حداثة الـ n-gram هي مقياس غير كافٍ بحد ذاته للإبداع النصي لأنها تفشل في مراعاة الملاءمة، حيث أثبتت من خلال التوسيم البشري المكثف أنه بينما تفتقر الحداثة العالية غالباً إلى القيمة البراغماتية في النصوص المولدة بواسطة الذكاء الاصطناعي، يمكن ضبط النماذج اللغوية الكبيرة الرائدة لتحديد التعبيرات الإبداعية وغير البراغماتية بشكل أفضل من طرق الـ n-gram التقليدية.

Arkadiy Saakyan, Najoung Kim, Smaranda Muresan, Tuhin Chakrabarty2026-03-04
💬 NLP

ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs

تقدم الورقة البحثية "ManagerBench"، وهو معيار لتقييم قدرة النماذج اللغوية الكبيرة ذاتية التشغيل على الموازنة بين الأهداف التشغيلية والسلامة البشرية، كاشفةً أن النماذج الرائدة غالباً ما تخفق إما عبر إعطاء الأولوية للأفعال الضارة لتحقيق الأهداف أو عبر التحول إلى حالة من الإفراط في السلامة وعدم الفعالية، وذلك رغم إدراكها الدقيق للمخاطر المرتبطة بذلك.

Adi Simhi, Jonathan Herzig, Martin Tutek, Itay Itzhak, Idan Szpektor, Yonatan Belinkov2026-03-04
💬 NLP

AccurateRAG: A Framework for Building Accurate Retrieval-Augmented Question-Answering Applications

تقدم هذه الورقة البحثية AccurateRAG، وهو إطار عمل مبتكر يعمل على تبسيط تطوير تطبيقات التوليد المعزز بالاسترجاع (RAG) عالية الأداء من خلال مسار شامل لمعالجة البيانات، وضبط النماذج، والتقييم، محققاً في نهاية المطاف نتائج رائدة على مجموعات البيانات المرجعية.

Linh The Nguyen, Chi Tran, Dung Ngoc Nguyen, Van-Cuong Pham, Hoang Ngo, Dat Quoc Nguyen2026-03-04
💬 NLP

LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning

تقترح الورقة البحثية إطار عمل LaDiR، وهو إطار عمل استدلالي مبتكر يعزز النماذج اللغوية الكبيرة عبر ترميز الاستدلال النصي في فضاء كامن مهيكل واستخدام نموذج انتشار كامن مع انتباه ثنائي الاتجاه لتمكين الصقل الشمولي والتكراري والتوليد المتوازي لمسارات استدلال متنوعة، متفوقاً بذلك على الأساليب الحالية القائمة على التوليد الذاتي التراجعي والانتشار في اختبارات التقييم الخاصة بالرياضيات والتخطيط.

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Nicklas Majamaki, Navdeep Jaitly, Yi-An Ma, Lianhui Qin2026-03-04
📊 statistics

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy

تقدم هذه الورقة "توجيه مشهد الطاقة" (ELS)، وهو إطار عمل للتوجيه أثناء الاستدلال لا يتطلب ضبطاً دقيقاً، يستخدم نموذجاً خفيف الوزن قائماً على الطاقة لتوجيه تنشيطات النماذج اللغوية الكبيرة ديناميكياً، مما يقلل بفعالية من الإفراط في رفض الطلبات الحميدة مع الحفاظ على سلامة قوية ضد المطالبات الضارة.

Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, XiaoFeng W (…)2026-03-04
💬 NLP

Are Language Models Borrowing-Blind? A Multilingual Evaluation of Loanword Identification across 10 Languages

تقيم هذه الورقة قدرة النماذج اللغوية متعددة اللغات على التمييز بين الكلمات المستعارة والمفردات الأصلية عبر عشر لغات، وتجد أنه على الرغم من التعليمات والسياق، فإن هذه النماذج تؤدي بشكل ضعيف وتظهر انحيازاً نحو الكلمات المستعارة، مما يسلط الضوء على تحديات كبيرة تواجه أدوات معالجة اللغات الطبيعية في الحفاظ على اللغات الأقل انتشاراً.

Mérilin Sousa Silva, Sina Ahmadi2026-03-04
💬 NLP

Are We Asking the Right Questions? On Ambiguity in Natural Language Queries for Tabular Data Analysis

تقترح هذه الورقة إطار عمل تعاوني يعيد صياغة الغموض في استعلامات اللغة الطبيعية للبيانات الجدولية باعتباره ميزة مقصودة في التفاعل بين المستخدم والنظام، مستخدمةً هذا المنظور لنقد ممارسات التقييم الحالية وتوجيه مسارات البحث المستقبلية.

Daniel Gomm, Cornelius Wolff, Madelon Hulsebos2026-03-04
💬 NLP

TransactionGPT

تقدم هذه الورقة TransactionGPT، وهو نموذج تأسيسي مبتكر مبني على بنية 3D-Transformer متخصصة تستفيد من بيانات معاملات بمليارات السجلات لتتفوق على النماذج الإنتاجية الحالية في اكتشاف الشذوذ وتوليد المعاملات المستقبلية، مع تقديم كفاءة فائقة مقارنة بالنماذج اللغوية الكبيرة التي تم ضبطها بدقة.

Yingtong Dou, Zhimeng Jiang, Tianyi Zhang, Mingzhi Hu, Zhichao Xu, Shubham Jain, Uday Singh Saini, Xiran Fan, Jiarui Sun (…)2026-03-04