💬 NLP

Improving Neural Argumentative Stance Classification in Controversial Topics with Emotion-Lexicon Features

تقترح هذه الورقة نموذجاً عصبياً لتصنيف الموقف معززاً بمعجم مشاعر موسع وسياقي (eNRC) مستمد من تضمينات DistilBERT، مما يحسن الأداء بشكل كبير عبر خمس مجموعات بيانات لمواضيع مثيرة للجدل ومتنوعة مقارنة بالنماذج المرجعية، والمعجم الأصلي، والأساليب القائمة على النماذج اللغوية الكبيرة.

Mohammad Yeghaneh Abkenar, Weixing Wang, Manfred Stede, Davide Picca, Mark A. Finlayson, Panagiotis Ioannidis2026-02-27
💬 NLP

Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference

تقترح هذه الورقة ReMix، وهو إطار عمل لا يتطلب تدريباً يقدم حالة خلط مستمرة وآلية رفض لمعالجة التناقضات الدلالية في نماذج اللغة الكبيرة القائمة على الانتشار، محققاً تسريعاً في الاستنتاج بمعدل 2 إلى 8 أضعاف دون المساس بجودة التوليد.

Yushi Ye, Feng Hong, Huangjie Zheng, Xu Chen, Zhiyong Chen, Yanfeng Wang, Jiangchao Yao2026-02-27
💬 NLP

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

تقترح هذه الورقة البحثية إطار عمل "خياطة أفكار الانتشار المشوشة" (Stitching Noisy Diffusion Thoughts)، وهو إطار عمل لا يتطلب تدريباً يعمل على تعزيز الاستنتاج في المهام الرياضية والبرمجية المعقدة عبر أخذ عينات لخطوات وسيطة متنوعة باستخدام نموذج انتشار مقنع، وتقييمها عبر نموذج مكافأة للعمليات، ثم إعادة دمج الخطوات الأعلى جودة في مسوغ مركب لتوجيه الحل التكراري الذاتي، مما يحقق مكاسب كبيرة في الدقة وانخفاضاً في زمن الاستجابة مقارنة بالطرق الحالية.

Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi2026-02-27
💬 NLP

Frequency-Ordered Tokenization for Better Text Compression

تقدم هذه الورقة تقنية "الترميز المرتب حسب التكرار" (frequency-ordered tokenization)، وهي تقنية معالجة مسبقة بسيطة تعيد ترتيب مفردات ترميز "BPE" بناءً على تكرار الرموز لتحسين نسب ضغط النصوص غير الفاقد للبيانات بشكل كبير وتسريع سرعات الضغط عبر مختلف الخوارزميات واللغات.

Maximilian Kalcher2026-02-27
💬 NLP

Toward Automatic Filling of Case Report Forms: A Case Study on Data from an Italian Emergency Department

تتناول هذه الورقة ندرة البيانات المشروحة لعملية التعبئة التلقائية لنماذج تقارير الحالات (CRF) من خلال تقديم مجموعة بيانات جديدة لقسم الطوارئ باللغة الإيطالية، وتحديد المهمة ومقاييس التقييم، وإثبات أنه بينما يمكن للنماذج اللغوية الكبيرة الحديثة أداء هذه المهمة في إطار التعلم الصفري، فإن مخرجاتها تتطلب تصحيحاً بسبب الانحيازات المتأصلة مثل الحذر المفرط.

Gabriela Anna Kaczmarek, Pietro Ferrazzi, Lorenzo Porta, Vicky Rubini, Bernardo Magnini2026-02-27
⚡ electrical engineering

Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment

تعالج هذه الورقة ندرة موارد الكلام باللغة البنغالية طويلة المدى من خلال تقديم مجموعة بيانات "Lipi-Ghor-882" المكونة من 882 ساعة، وإثبات أن الضبط الدقيق المستهدف باستخدام التدهور الاصطناعي يحسن أداء التعرف التلقائي على الكلام (ASR)، في حين أن المعالجة اللاحقة الاستدلالية للنماذج الأساسية تثبت أنها أكثر فعالية من إعادة التدريب لتجزئة المتحدثين، مما يؤسس مجتمعًا لخط معالجة مزدوج عالي الكفاءة بمعامل زمن حقيقي يبلغ حوالي 0.019.

Sanjid Hasan, Risalat Labib, A H M Fuad, Bayazid Hasan2026-02-27
💬 NLP

Quantity Convergence, Quality Divergence: Disentangling Fluency and Accuracy in L2 Mandarin Prosody

تكشف هذه الدراسة أنه بينما يحقق المتعلمون الفيتناميون المتقدمون للغة الماندرين كميات تشبه مستويات المتحدثين الأصليين من الحدود العروضية عند مستوى العبارة الكبرى، إلا أنهم يظهرون تباعداً غير خطي ومستمراً في التخطيط البنيوي من خلال عكس التسلسل الهرمي العروضي الأصلي بين واجهات "المبتدأ-الفعل" و"الفعل-المفعول به"، مما يعطي الأولوية للطلاقة على حساب الدقة النحوية.

Yuqi Shi, Hao Yang, Xiyao Lu, Jinsong Zhang2026-02-27
💬 NLP

Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent

تقدم هذه الورقة SALA، وهو إطار عمل لوكيل نماذج لغوية كبيرة مدعوم بالأسلوبية، يقيم مخاطر كشف هوية المؤلف في المقالات الإخبارية ويقترح استراتيجية إعادة تكوين موجهة للتخفيف من هذه المخاطر بفعالية مع الحفاظ على المعنى النصي.

Boyang Zhang, Yang Zhang2026-02-27
💬 NLP

AgentDropoutV2: Optimizing Information Flow in Multi-Agent Systems via Test-Time Rectify-or-Reject Pruning

يُعد AgentDropoutV2 إطار عمل في مرحلة الاختبار يعمل على تحسين أداء الأنظمة متعددة الوكلاء من خلال التدخل الديناميكي لاعتراض مخرجات الوكلاء الخاطئة وإما تصحيحها أو تقليمها باستخدام التصحيح المعزز بالاسترجاع ومؤشرات قائمة على الفشل، مما يعزز الدقة بشكل كبير في مهام الاستدلال المعقدة دون الحاجة إلى إعادة تدريب النموذج.

Yutong Wang, Siyuan Xiong, Xuebo Liu, Wenkang Zhou, Liang Ding, Miao Zhang, Min Zhang2026-02-27
💬 NLP

Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems

تقترح الورقة إطار عمل الاستجابة المتدفقة ثنائي المسار المدرك للخطاب (DDTSR)، وهو بنية ذات زمن انتقال منخفض لأنظمة الحوار المنطوق تستخدم التآزر النموذجي الموجه بالروابط، والتعاون عبر الوسائط المتعددة المتدفق، والتعلم المنهجي لتمكين الاستماع والتفكير والتحدث بشكل متوازٍ، مما يقلل زمن انتقال الاستجابة بنسبة تتراوح بين 19% و51% مع الحفاظ على جودة الخطاب.

Siyuan Liu, Jiahui Xu, Feng Jiang, Kuang Wang, Zefeng Zhao, Chu-Ren Huang, Jinghang Gu, Changqing Yin, Haizhou Li2026-02-27