💬 NLP

Dynamically Acquiring Text Content to Enable the Classification of Lesser-known Entities for Real-world Tasks

تقترح هذه الورقة إطار عمل يتيح إنشاء مصنفات مخصصة لمهام معينة للكيانات الأقل شهرة، وذلك عبر الحصول ديناميكياً على نصوص وصفية من خلال عمليات البحث في الويب والنماذج اللغوية الكبيرة (LLMs) باستخدام أسماء الكيانات وتسمياتها فقط كبيانات تدريب.

Fahmida Alam, Ellen Riloff2026-04-27
💬 NLP

SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking

تقترح الورقة البحثية طريقة SSG (الفرز ثم التقسيم حسب المجموعات)، وهي طريقة جديدة لتقسيم المفردات تعمل على تحسين قابلية اكتشاف العلامة المائية للنماذج اللغوية الكبيرة في سيناريوهات الإنتروبيا المنخفضة، مثل توليد الأكواد والرياضيات، وذلك عبر إنشاء مجموعات فرعية متوازنة من حيث الاحتمالات (logits) لرفع الحد الأدنى لقوة العلامة المائية.

Chenxi Gu, Xiaoning Du, John Grundy2026-04-27
💬 NLP

Measuring and Mitigating Persona Distortions from AI Writing Assistance

تُظهر هذه الورقة أن المساعدة في الكتابة عبر الذكاء الاصطناعي تشوه شخصيات المستخدمين بشكل منهجي من خلال جعل الكتاب يبدون أكثر تمسكاً بآرائهم، وكفاءةً، وامتيازاً، وبينما يمكن التخفيف من حدة هذه التشوهات عبر تدريب النماذج، إلا أن القيام بذلك غالباً ما يقلل من قبول المستخدمين.

Paul Röttger, Kobi Hackenburg, Hannah Rose Kirk, Christopher Summerfield2026-04-27
💬 NLP

Controllable Spoken Dialogue Generation: An LLM-Driven Grading System for K-12 Non-Native English Learners

تقدم هذه الورقة إطار عمل متوافقًا مع الكفاءة يستخدم خوارزمية جديدة تسمى "تحسين السياسة المدفوع بالتنوع" (DDPO) لتكييف الحوارات المنطوقة التي تولدها النماذج اللغوية الكبيرة لتناسب التعقيد المعجمي والاحتياجات التربوية المحددة لمتعلمي اللغة الإنجليزية غير الناطقين بها في مرحلة التعليم الأساسي (K-12).

Haidong Yuan, Haokun Zhao, Wanshi Xu, Songjun Cao, Qingyu Zhou, Long Ma, Hongjie Fan2026-04-27
💬 NLP

Using Embedding Models to Improve Probabilistic Race Prediction

لمعالجة أوجه القصور في طريقة "التحسين البايزي للأسماء والترميز الجغرافي" (BISG) القياسية في التنبؤ بعرق الأفراد ذوي الألقاب غير الشائعة، يقترح المؤلفون طريقة "التحسين البايزي للأسماء والترميز الجغرافي المدعوم بالتضمين" (eBISG)، وهي طريقة تستخدم تضمينات النصوص سابقة التدريب والشبكات العصبية لتحسين تقديرات احتمالية العرق بشكل كبير للمجموعات السكانية المستبعدة من بيانات ألقاب التعداد السكاني.

Noan Dasanaike, Kosuke Imai2026-04-27
💬 NLP

Learning Evidence Highlighting for Frozen LLMs

إن HighLight هو إطار عمل يعمل على تحسين استدلال النماذج اللغوية الكبيرة المجمدة عبر تدريب "ممثل تأكيد" (Emphasis Actor) خفيف الوزن لإدراج علامات تمييز دنيا حول الأدلة الرئيسية ضمن السياقات الطويلة والمشوشة باستخدام التعلم التعزيزي، دون الحاجة إلى تسميات للأدلة أو تعديل الحلّال الأساسي.

Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Luke Simon (…)2026-04-27
💬 NLP

From graphemic dependence to lexical structure: a Markovian perspective on Dante's Commedia

تستخدم هذه الدراسة نموذج سلسلة ماركوف رباعي الحالات يعتمد على ترميز الصامت والمتحرك لتوضيح أن "الكوميديا الإلهية" لدانتي تُظهر تحولاً تدريجياً في التبعية الكتابية من "الجحيم" إلى "الفردوس"، مما يكشف عن علاقة هيكلية بين الأنماط الرمزية المحلية، والتنظيم المعجمي، والبنية الكلية للقصيدة.

Angelo Maria Sabatini2026-04-27
💬 NLP

Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models

تقترح هذه الورقة إطار عمل للتمييز بين التحيز المنهجي والتباين العشوائي في تمثيلات المستوى الفونيمي، وتوضح أنه في حين يساهم كلاهما في عدم الإنصاف الديموغرافي في التعرف على الكلام، فإن الخطأ العشوائي هو على الأرجح العقبة الأكثر أهمية أمام تحقيق الإنصاف.

Felix Herron, Solange Rossato, Alexandre Allauzen, François Portet2026-04-27
💬 NLP

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

يُعد BERAG (التوليد المعزز بالاسترجاع عبر المجموعات البايزية) إطار عمل جديداً يحسن التوليد المعزز بالاسترجاع من خلال تكييف النماذج اللغوية مع الوثائق الفردية واستخدام قاعدة بايز لتحديث أوزان الوثائق توكنًا بتوكن، مما يقلل بفعالية من تأثير "الضياع في المنتصف" ويحسن الإسناد في الإجابة على الأسئلة البصرية القائمة على المعرفة.

Jinghong Chen, Jingbiao Mei, Guangyu Yang, Bill Byrne2026-04-27
💬 NLP

Thinking Without Words: Efficient Latent Reasoning with Abstract Chain-of-Thought

تقترح الورقة البحثية **سلسلة الأفكار المجردة** (Abstract Chain-of-Thought)، وهي آلية ما بعد التدريب تُمكّن النماذج اللغوية من إجراء عمليات استدلال فعالة عبر استبدال سلاسل الأفكار الطويلة باللغة الطبيعية بتسلسلات قصيرة من الرموز "المجردة" المتعلمة، مما يقلل تكاليف الاستدلال بشكل كبير مع الحفاظ على أداء مماثل.

Keshav Ramji, Tahira Naseem, Ramón Fernandez Astudillo2026-04-27