💬 NLP

Multi-Stage Training for Abusive Comment Detection in Indic Languages

تقترح هذه الورقة مسار تدريب متعدد المراحل يجمع بين المعالجة المسبقة القائمة على اللغة ومجموعة من النماذج للكشف عن التعليقات المسيئة في اللغات الهندية مع تقليل الإيجابيات الكاذبة للحفاظ على حرية التعبير.

Pranshu Rastogi, Madhav Mathur, Ramaneswaran S, Kshitij Mohan2026-05-22
💬 NLP

Unified Data Selection for LLM Reasoning

تقدم هذه الورقة "مجموع الإنتروبيا العالية" (HES)، وهو مقياس لا يتطلب تدريباً يعمل على تحديد بيانات الاستدلال عالية الجودة بكفاءة من خلال جمع الإنتروبيا لأعلى الرموز، مما يحسن بشكل كبير أداء النماذج اللغوية الكبيرة عبر نماذج الضبط الدقيق الخاضع للإشراف، والضبط الدقيق بالرفض، والتعلم التعزيزي، مع تقليل التكاليف الحسابية.

Xiaoyuan Li, Yubo Ma, Chengpeng Li, Fengbin Zhu, Yiyao Yu, Keqin Bao, Wenjie Wang, Fuli Feng, Dayiheng Liu2026-05-22
💬 NLP

Epicure: Navigating the Emergent Geometry of Food Ingredient Embeddings

تقدم الورقة البحثية "إيبيكيور" (Epicure)، وهي عائلة من تضمينات المكونات متعددة اللغات المدربة على 4.14 مليون وصفة تستخدم مخططات مسار عشوائي متميزة للتنقل عبر رسم بياني هجين لتواجد المكونات معاً ومركبات النكهة الكيميائية، مما يضع النماذج عند نقاط متفاوتة على طول طيف يمتد بين سياق الوصفة والبنية الكيميائية.

Jakub Radzikowski, Josef Chen2026-05-22
💬 NLP

In Silico Modeling of the RAMPHO Buffer: Dissociating Informational and Energetic Masking via Phonetic Entropy in Deep Neural Networks

تقدم هذه الورقة محاكاة حاسوبية (in silico) لمخزن RAMPHO المؤقت باستخدام الإنتروبيا الصوتية من نموذج wav2vec 2.0 لتوضيح أنه في حين أن تدمير المحتوى الدلالي للمشتت يخفف من الحجب المعلوماتي عند نسب الإشارة إلى الضجيج العالية، فإنه يؤدي في الوقت ذاته إلى تدهور إشارات التلميح الزمني عند النسب المنخفضة، مما يكشف عن مشكلة تحسين "باريتو" معرفية-صوتية جوهرية في إدراك الكلام.

Stefan Bleeck2026-05-22
💬 NLP

Polite on the Surface, Wrong in Practice: A Curated Dataset for Fixing Honorific Failures in Multilingual Bangla Generation

تقدم هذه الورقة BLADE، وهو مجموعة بيانات منسقة تضم 4,196 زوجًا من التفاعلات المصممة لمعالجة إخفاقات أساليب التبجيل والبراغماتية في توليد اللغة البنغالية متعددة اللغات، مما يثبت أن الضبط الدقيق للنماذج ذات الأوزان المفتوحة على هذا المورد يحسن بشكل كبير من الدقة الهيكلية والمواءمة الثقافية.

Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi2026-05-22
💬 NLP

Reflecti-Mate: A Conversational Agent for Adaptive Decision-Making Support Through System 1 and System 2 Thinking

تُظهر هذه الدراسة أن العميل المحادثاتي المصمم للتكيف مع أنماط التفكير الفردية عبر دمج عمليات النظام 1 والنظام 2 يعزز سلوكاً تأملياً أكثر تخصيصاً وشمولية وتكاملاً مقارنة بالتأمل غير المدعوم أو بالعميل المرجعي غير المتكيف.

Morita Tarvirdians, Senthil Chandrasegaran, Hayley Hung, Catholijn M. Jonker, Catharine Oertel2026-05-22
💬 NLP

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

تُعد Search-E1 طريقة تطور ذاتي تعزز وكلاء الاستدلال المعززين بالبحث باستخدام تقنيتي GRPO الخام والتقطير الذاتي غير المتصل فقط، وذلك لتحقيق أداء رائد في معايير الأسئلة والأجوبة دون الاعتماد على إشراف خارجي معقد أو وحدات مساعدة.

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao2026-05-22
💬 NLP

Scene Abstraction for Lexical Semantics: Structured Representations of Situated Meaning

تقدم هذه الورقة "تجريد المشهد" (Scene Abstraction)، وهو إطار عمل يستخدم النماذج اللغوية الكبيرة لإنشاء تمثيلات مهيكلة للسياقات الموقعية والارتباطات الوجدانية للكلمات، والذي تم التحقق من صحته من خلال مجموعة بيانات جديدة (COCA-Scenes) وتجارب تثبت تفوق توافقه مع التفسير البشري مقارنة بنهج التضمين وقواعد المعرفة الحالية.

Yejin Cho, Katrin Erk2026-05-22✓ Author reviewed
💬 NLP

One prompt is not enough: Instruction Sensitivity Undermines Embedding Model Evaluation

تُثبت هذه الورقة أن طريقة التقييم الحالية القائمة على المطالبة الواحدة (single-prompt) لنماذج التضمين المضبوطة بالتعليمات معيبة بشكل جوهري بسبب حساسيتها العالية لصياغة التعليمات، مما يؤدي إلى درجات أداء مضللة وتصنيفات غير مستقرة في لوحة الصدارة، وهو ما يستلزم وجود معايير قياس تتضمن متانة المطالبة.

Yevhen Kostiuk, Kenneth Enevoldsen2026-05-22
💬 NLP

SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations

تقدم الورقة البحثية SynAE، وهو إطار تقييم متعدد المحاور مصمم لتقييم صلاحية وتماثل وتنوع مجموعات البيانات الاصطناعية لوكلاء استدعاء الأدوات (tool-calling agents) من خلال تحليل تعليمات المهام، واستدعاءات الأدوات، والمخرجات، والأداء اللاحق، مما يثبت أنه لا يكفي مقياس واحد لتوصيف جودة البيانات الاصطناعية.

Shuaiqi Wang, Aadyaa Maddi, Zinan Lin, Giulia Fanti2026-05-22