🤖 AI

Exploration of Perceptual Speech Features for Clinical Decision-Support in Mental Health Care

تقدم هذه الورقة إطار عمل شفافاً قائماً على الميزات، يستفيد من الخصائص الإدراكية للكلام والتعلم الآلي القابل للتفسير لتحديد الارتباطات المستقرة بين الأنماط الصوتية واللغوية وشدة الاكتئاب والقلق واضطراب نقص الانتباه مع فرط النشاط عبر كل من المعايير المرجعية المنضبطة والبيانات السريرية الواقعية.

Vassilis Lyberatos, Edmund G. Dervakos, Eleni Adamidi, Athanasios Voulodimos, Giorgos Stamou2026-05-26
💬 NLP

Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs

تقترح الورقة البحثية إطار عمل Mix-MoE، وهو إطار عمل "خليط من الخبراء" (Mixture-of-Experts) ثنائي المراحل يفصل بين خبراء النماذج اللغوية وخبراء الترجمة الآلية ويستخدم توجيهاً معززاً بتحويل فوريه للتخفيف بفعالية من تداخل المعلمات وتحسين أداء الترجمة الآلية متعددة اللغات بشكل كبير في النماذج اللغوية الكبيرة.

Bo Li, Tianyu Dong, Shaolin Zhu, Deyi Xiong2026-05-26
💬 NLP

The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models

تقدم هذه الورقة TraceLock، وهو متحكم خفيف الوزن وذاتي الإشراف يتعلم سياسة التزام بالرموز (token-commitment) قابلة لإعادة الاستخدام لنماذج اللغات الانتشارية المجمدة من خلال الاستفادة من الاستقرار المستقبلي، مما يحسن جودة التوليد والقدرة على التكيف عبر إعدادات مختلفة دون الحاجة إلى إعادة التدريب.

Bohang Sun, Max Zhu, Francesco Caso, Jindong Gu, Junchi Yu, Philip Torr, Pietro Liò, Jialin Yu2026-05-26
💬 NLP

The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty

تُحدد هذه الورقة البحثية "ضريبة الرموز" (tokenizer tax) عبر 25 لغة أوروبية، كاشفةً أن اللغات غير الإنجليزية، ولا سيما الأوكرانية وتلك ذات الصرف المعقد، تعاني من نسب أعلى بكثير من الرموز إلى الكلمات بسبب نقص تمثيلها في بيانات ما قبل التدريب، مع إثبات أن تصنيفات الخصوبة هذه تظل ثابتة عبر المجالات وأن تأثيرات التعلم بلقطات قليلة (few-shot effects) هي سمة متأصلة في النموذج وليست مرتبطة باللغة.

Volodymyr Ovcharov2026-05-26
💬 NLP

ROC Analysis for Evaluating Translation Quality Estimation Systems

تقترح هذه الورقة تحليل منحنى خصائص التشغيل (ROC) كمنهجية عملية وموجهة نحو اتخاذ القرار لتقييم أنظمة تقدير جودة الترجمة، مبرهنةً على توافقها مع مقاييس التقييم الحالية مع توفير رؤى قابلة للتنفيذ لاتخاذ القرارات التجارية.

Evelyn Y. Garland (Acta-Transphere), Carola F. Berger (CFB Scientific Translations LLC)2026-05-26
💬 NLP

StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering

تقدم الورقة البحثية StepGap، وهو شجرة قرار هجينة تجمع بين الاستدلال اللغوي الطبيعي (NLI) والنماذج اللغوية الكبيرة (LLM)، والتي تكتشف فجوات أدلة محددة على مستوى الخطوات في الإجابة على الأسئلة متعددة القفزات بشفافية هيكلية أكبر من النماذج المرجعية التي تعتمد على النماذج اللغوية الكبيرة فقط، وتثبت فعاليتها كمكافأة عملية نمطية تعمل على تحسين أداء المطابقة التامة لنموذج Qwen2.5-7B-Instruct بشكل كبير.

Yuelyu Ji, Zhuochun Li, Hui Ji, Daqing He2026-05-26
💬 NLP

Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring

تقدم هذه الورقة "govllm"، وهو إطار عمل مفتوح المصدر يطبق مبدأ "الحوكمة من خلال المقاييس" لتمكين المراقبة المستمرة لامتثال النماذج اللغوية الكبيرة بموجب قانون الذكاء الاصطناعي للاتحاد الأوروبي، وذلك عبر استخدام مجموعة من النماذج اللغوية الصغيرة المتخصصة كقضاة تنظيميّين لتوليد إشارات امتثال في الوقت الفعلي وتحديد حالات عدم اليقين للتحكيم البشري.

Jehanne Dussert2026-05-26
💬 NLP

Beyond the Target: From Imitation to Collaboration in Speculative Decoding

تقدم هذه الورقة البحثية "الفك التنبؤي التعاوني" (CoSpec)، وهو إطار عمل مبتكر يستبدل النهج التقليدي القائم على المحاكاة بسياسة تحكيم مدفوعة بالتعلم المعزز، مما يسمح لنموذج مسودة أصغر بالمساهمة بشكل انتقائي بالرموز حتى عندما لا تتطابق مع النموذج المستهدف الأكبر، مما يحقق بذلك تسريعاً كبيراً في الاستنتاج ودقة نهائية فائقة.

Jinze Li, Yixing Xu, Guanchen Li, Jinfeng Xu, Shuo Yang, Yang Zhang, Xuanwu Yin, Dong Li, Edith C. H. Ngai, Emad Barsoum2026-05-26
📊 statistics

Spiking the training data to correct for test set contamination

تقترح هذه الورقة طريقة لتصحيح درجات الاختبار المتضخمة الناتجة عن تلوث البيانات عبر "حقن" بيانات التدريب عمدًا بأمثلة اختبار معروفة لمعايرة متنبئات الحفظ، والتي تُستخدم بعد ذلك إحصائيًا لضبط مقاييس أداء النموذج.

Johnny Tian-Zheng Wei, Jerry Li, Ameya Godbole, Robin Jia2026-05-26
💬 NLP

Translators as Invisible Teachers of AI: Copyright, Translation Memory, and the Political Economy of Linguistic Data

تجادل هذه الورقة بأن المترجمين قد تحولوا إلى "معلمين غير مرئيين" للذكاء الاصطناعي من خلال استغلال نتاج عملهم الإبداعي كبيانات تدريب أساسية دون اعتراف أو تعويض، وهي عملية يحللها المؤلف من خلال منظور قانون حقوق الطبع والنشر، والاقتصاد السياسي للبيانات اللغوية، والحاجة الملحة للتصميم القائم على إعادة التوزيع.

Masaru Yamada2026-05-26