💬 NLP

Position: Mechanistic Interpretability Must Disclose Identification Assumptions for Causal Claims

تجادل هذه الورقة بأن أبحاث التفسير الآلي غالباً ما تخلط بين مقاييس التحقق والتعريف السببي من خلال الفشل في التصريح صراحةً بالافتراضات الضرورية، وتقترح معيار إفصاح جديداً يتطلب من المؤلفين توضيح استراتيجيات التعريف الخاصة بهم ومدى متانة ادعاءاتهم السببية بشكل جلي.

Zezheng Lin, Fengming Liu2026-05-11
💬 NLP

Fast Byte Latent Transformer

يعالج محول البايت الكامن (BLT) عقبة البطء في التوليد لنماذج اللغة على مستوى البايت من خلال تقديم ثلاثة متغيرات مبتكرة — وهي BLT-Diffusion وBLT-Self-speculation وBLT-Diffusion+Verification — التي تستفيد من تقنيات التوليد المتوازي وفك التشفير التخميني لتقليل زمن انتقال الاستدلال وتكاليف عرض نطاق الذاكرة بشكل كبير مع الحفاظ على جودة عالية.

Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, S (…)2026-05-11
💬 NLP

Accurate and Efficient Statistical Testing for Word Semantic Breadth

تقترح هذه الورقة اختبار تبديل محاذٍ لـ "هاوسهولدر" (Householder) ومعززاً بمعالجات الرسوميات (GPU)، يميز بدقة بين الفروق الحقيقية في الاتساع الدلالي للكلمات وبين التباينات الاتجاهية، مما يقلل من خطأ النوع الأول بنسبة 32.5% ويحقق تسريعاً بمقدار 23 ضعفاً مقارنة بالأساسات المعتمدة على وحدة المعالجة المركزية (CPU).

Yo Ehara2026-05-11
💬 NLP

CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation

يُعد CA-SQL إطار عمل مبتكر لتحويل النص إلى SQL يعزز الاستدلال على المعايير المرجعية الصعبة من خلال توسيع نطاق استكشاف العرض ديناميكيًا بناءً على تعقيد المهمة، وتوظيف بذر المطالبات التطوري، واستخدام آلية التصويت لتحقيق أداء رائد في مجموعة بيانات BIRD باستخدام نموذج GPT-4o-mini فقط.

James Petullo, Nianwen Xue2026-05-11
💬 NLP

The Memory Curse: How Expanded Recall Erodes Cooperative Intent in LLM Agents

تكشف هذه الورقة أن توسيع نوافذ السياق في وكلاء النماذج اللغوية الكبيرة غالبًا ما يؤدي إلى إطلاق "لعنة الذاكرة" التي تؤدي بشكل منهجي إلى تآكل النوايا التعاونية في المعضلات الاجتماعية متعددة الوكلاء عبر تضخيم أنماط الاستدلال السلبية، وهي ظاهرة يمكن التخفيف من حدتها من خلال الضبط الدقيق المستهدف على آثار استشرافية أو تطهير الذاكرة.

Jiayuan Liu, Tianqin Li, Shiyi Du, Xin Luo, Haoxuan Zeng, Emanuel Tewolde, Tai Sing Lee, Tonghan Wang, Carl Kingsford, V (…)2026-05-11
💬 NLP

Conformal Path Reasoning: Trustworthy Knowledge Graph Question Answering via Path-Level Calibration

تقترح هذه الورقة "الاستدلال المساري المطابق" (CPR)، وهو إطار عمل موثوق للإجابة على أسئلة الرسوم البيانية المعرفية يجمع بين معايرة المسار على مستوى الاستعلام وشبكة قيمة متبقية مطابقة مدربة باستخدام خوارزمية (PUCT) لتحسين معدلات التغطية التجريبية بشكل كبير مع تقليل أحجام مجموعات التنبؤ مقارنة بالطرق الحالية.

Shuhang Lin, Chuhao Zhou, Xiao Lin, Zihan Dong, Kuan Lu, Zhencan Peng, Jie Yin, Dimitris N. Metaxas2026-05-11
💬 NLP

ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model

تقدم هذه الورقة ANGOFA، وهي مجموعة من أربعة نماذج لغوية مدربة مسبقاً للغات الأنغولية تستفيد من التهيئة المعلوماتية للتضمين والبيانات الاصطناعية ضمن إطار عمل الضبط الدقيق التكيفي متعدد اللغات لتتفوق بشكل كبير على النماذج الحالية ذات الأداء العالي.

Osvaldo Luamba Quinjica, David Ifeoluwa Adelani2026-05-08
💬 NLP

Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation

تقدم هذه الورقة البحثية RioRAG، وهو إطار عمل يعزز التوليد المعزز بالاسترجاع طويل النص من خلال تعريف المعلوماتية كهدف قابل للتحقق، وتوظيف التحقق المرتكز على الجزيئات المعلوماتية (nugget-centric) وعبر المصادر لتوفير مكافآت كثيفة ومستقرة للتعلم التعزيزي دون الاعتماد على الإشراف المصنوع يدويًا أو النماذج المعلمة القوية.

Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang2026-05-08
💬 NLP

How do datasets, developers, and models affect biases in a low-resourced language?: The Case of the Bengali Language

تثبت هذه الورقة تجريبيًا أن نماذج تحليل المشاعر للغة البنغالية ذات الموارد المنخفضة تظهر تحيزات مستمرة قائمة على النوع الاجتماعي والدين والجنسية بغض النظر عما إذا كانت مبنية على بنيات متعددة اللغات أو أحادية اللغة، مما يسلط الض الضوء على كيفية تسبب الجمع بين مجموعات البيانات المتنوعة والنماذج سابقة التدريب في إدخال عدم اتساق يؤدي إلى تفاقم الظلم المعرفي في الأنظمة الاجتماعية التقنية.

Dipto Das, Shion Guha, Bryan Semaan2026-05-08
💬 NLP

Searching the Internet for Challenging Benchmarks at Scale

تقدم هذه الورقة إطار عمل آلياً بالكامل وفعالاً من حيث التكلفة، يعمل على نمذجة الإنترنت كفضاء مواضيع شاسع ويستخدم استراتيجية "المتعدد الأذرع" (multi-armed bandit) لاكتشاف وبناء معايير اختبارية تحديّة بشكل ديناميكي تتجنب مشكلات التشبع التي تعاني منها مجموعات الاختبار الثابتة.

Wenda Xu, Vilém Zouhar, Parker Riley, Mara Finkelstein, Markus Freitag, Daniel Deutsch2026-05-08