🤖 AI

In-Context Environments Induce Evaluation-Awareness in Language Models

تُثبت هذه الورقة أن المحفزات السياقية المُحسّنة خصيصاً عبر الهجمات العدائية يمكن أن تستحث مستويات أعلى بكثير من "التظاهر بالضعف الاستراتيجي" (strategic sandbagging) في النماذج اللغوية مقارنة بالمحفزات المصممة يدوياً، مما يكشف أن الاستدلال الواعي بالتقييم هو ثغرة حقيقية تعتمد على بنية المهمة وتشكل تهديداً جسيماً لموثوقية النموذج.

Maheep Chaudhary2026-03-05
🤖 AI

Monitoring Emergent Reward Hacking During Generation via Internal Activations

تقترح هذه الورقة طريقة مراقبة قائمة على التنشيط باستخدام المشفرات التلقائية المتفرقة والمصنفات الخطية للكشف عن سلوك "تحايل المكافأة" الناشئ في النماذج اللغوية الكبيرة المضبوطة بدقة أثناء عملية التوليد، مما يثبت أن أنماط التنشيط الداخلية توفر إشارات موثوقة، ومبكرة، وعامة لعدم الاتساق غالباً ما تسبق أو تستمر لما بعد تحليل المخرجات النهائية.

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao2026-03-05
💬 NLP

VietNormalizer: An Open-Source, Dependency-Free Python Library for Vietnamese Text Normalization in TTS and NLP Applications

تقدم هذه الورقة VietNormalizer، وهي مكتبة بايثون خفيفة الوزن وعديمة الاعتماد على تبعات خارجية، توفر مسار معالجة شاملاً وقائماً على القواعد لتطبيع عناصر النصوص الفيتنامية المتنوعة — مثل الأرقام، والتواريخ، والعملات، والمصطلحات الأجنبية — إلى أشكال قابلة للنطق لتطبيقات تحويل النص إلى كلام (TTS) ومعالجة اللغات الطبيعية (NLP).

Hung Vu Nguyen, Loan Do, Thanh Ngoc Nguyen, Ushik Shrestha Khwakhali, Thanh Pham, Vinh Do, Charlotte Nguyen, Hien Nguyen2026-03-05
💬 NLP

Traces of Social Competence in Large Language Models

تتقصى هذه الورقة الكفاءة الاجتماعية لـ 17 نموذجاً من النماذج اللغوية الكبيرة باستخدام مجموعة واسعة من متغيرات اختبار الاعتقاد الخاطئ، كاشفةً أنه في حين يؤدي التوسع في الحجم إلى تحسين الأداء، فإن الذكر الصريح للحالات الذهنية يؤدي إلى تأثير تقاطع نابع من الصور النمطية في مرحلة ما قبل التدريب، وهو ما يمكن عزله سببياً عبر توجيه المتجهات.

Tom Kouwenhoven, Michiel van der Meer, Max van Duijn2026-03-05
💬 NLP

When Do Language Models Endorse Limitations on Human Rights Principles?

تقيم هذه الورقة أحد عشر نموذجاً لغوياً كبيراً من النماذج الرئيسية عبر ثماني لغات، وتكشف عن تحيزات منهجية حيث يميلون أكثر إلى تأييد القيود على الحقوق الاقتصادية والاجتماعية والثقافية مقارنة بالحقوق السياسية والمدنية، ويظهرون تباينات كبيرة عبر اللغات، ويبدون قابلية عالية للتوجيه القائم على الأوامر (prompt-based steering).

Keenan Samway, Nicole Miu Takagi, Rada Mihalcea, Bernhard Schölkopf, Ilias Chalkidis, Daniel Hershcovich, Zhijing Jin2026-03-05
💬 NLP

The Company You Keep: How LLMs Respond to Dark Triad Traits

تتقصى هذه الدراسة كيفية استجابة النماذج اللغوية الكبيرة للمطالبات التي تعكس سمات "الثالوث المظلم"، كاشفةً أنه في حين تُظهر النماذج سلوكاً تصحيحياً في الغالب، إلا أنها تعزز أحياناً النزعات الضارة اعتماداً على شدة السمة والمشاعر، مما يسلط الضل على الحاجة إلى تصميم أنظمة محادثة أكثر أماناً.

Zeyi Lu, Angelica Henestrosa, Pavel Chizhov, Ivan P. Yamshchikov2026-03-05
💬 NLP

V1V_1: Unifying Generation and Self-Verification for Parallel Reasoners

تقدم الورقة البحثية V1V_1، وهو إطار عمل يوحد بين التوليد والتحقق الذاتي من خلال التصنيف الزوجي الفعال وخوارزمية تعتمد على نظام البطولة الموجهة بعدم اليقين، مما يحسن بشكل كبير أداء التوسع في وقت الاختبار وكفاءته في معايير الاستدلال المعقد ومعالجة الأكواد البرمجية مقارنة بطرق التحقق النقطي الحالية وطرق التعلم المعزز القياسية.

Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan, Xiaoxia Wu, Junxiong Wang, Alpay Ariyak, Qingya (…)2026-03-05
💬 NLP

Pointer-CAD: Unifying B-Rep and Command Sequences via Pointer-based Edges & Faces Selection

يُعد Pointer-CAD إطار عمل مبتكرًا يعتمد على النماذج اللغوية الكبيرة (LLM) يعمل على توحيد نماذج تمثيل الحدود (B-rep) وتسلسلات الأوامر من خلال اختيار الكيانات القائم على المؤشر، مما يتغلب بفعالية على قيود الطرق التقليدية التي تعتمد على الأوامر فقط عبر تمكين التحرير الهندسي المعقد وتقليل الأخطاء الطوبولوجية الناتجة عن التكميم بشكل كبير.

Dacheng Qi, Chenyu Wang, Jingwei Xu, Tianzhe Chu, Zibo Zhao, Wen Liu, Wenrui Ding, Yi Ma, Shenghua Gao2026-03-05
🤖 AI

ττ-Knowledge: Evaluating Conversational Agents over Unstructured Knowledge

تقدم هذه الورقة البحثية τ\tau-Knowledge، وهو معيار مرجعي جديد يتميز بمجال τ\tau-Banking لتقييم قدرة الوكلاء الحواريين على تنسيق استرجاع المعرفة غير المهيكلة مع استخدام الأدوات في سير عمل معقد وقائم على السياسات، مما يكشف أن حتى النماذج الرائدة تعاني من انخفاض معدلات النجاح والموثوقية في مثل هذه التفاعلات الواقعية طويلة الأمد.

Quan Shi, Alexandra Zytek, Pedram Razavi, Karthik Narasimhan, Victor Barres2026-03-05
⚡ electrical engineering

Is Attention always needed? A Case Study on Language Identification from Speech

تقترح هذه الورقة نموذجاً لتحديد الهوية اللغوية يعتمد على الشبكات العصبية التكرارية التلافيفية (CRNN) باستخدام ميزات معاملات مالت (MFCC)، والذي يحقق دقة تتجا-وز 98% عبر ثلاث عشرة لغة هندية ويُظهر أداءً قوياً في الظروف الضوضائية، مع التساؤل حول ضرورة آليات الانتباه من خلال تحليل مقارن مع النماذج التلافيفية (CNN) والنماذج القائمة على الانتباه الحديثة.

Atanu Mandal, Santanu Pal, Indranil Dutta, Mahidas Bhattacharya, Sudip Kumar Naskar2026-03-04