🤖 machine learning

MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier

يُعد MOOSE-Star إطار عمل موحداً يتغلب على الاستعصاء الرياضي لتدريب نماذج الاكتشاف العلمي بشكل مباشر من خلال تفكيك عملية الاستدلال التوليدي إلى مهام فرعية قابلة للحل وتوظيف البحث الهرمي الموجه بالدوافع، مما يتيح التدريب القابل للتوسع والتوسع المستمر أثناء وقت الاختبار مع تقليل التعقيد من أسي إلى لوغاريتمي.

Zonglin Yang, Lidong Bing2026-03-05
🤖 AI

T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning

تقدم هذه الورقة تقنية "بنية التفكير" (Structure-of-Thought - SoT)، وهي تقنية توجيه تعزز أداء النموذج من خلال توجيه بناء هياكل نصية وسيطة، وتقدم T2S-Bench، وهو أول معيار شامل لتقييم وتحسين قدرات الاستدلال من النص إلى البنية عبر مختلف المجالات والمهام العلمية.

Qinsi Wang, Hancheng Ye, Jinhee Kim, Jinghan Ke, Yifei Wang, Martin Kuo, Zishan Shao, Dongting Li, Yueqian Lin, Ting Jia (…)2026-03-05
🤖 AI

SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration

تقدم الورقة البحثية SWE-CI، وهو أول معيار مرجعي على مستوى المستودع مبني على حلقات التكامل المستمر لتقييم قدرة وكلاء النماذج اللغوية الكبيرة على صيانة الكود البرمجي على المدى الطويل من خلال مطالبتهم بحل مهام تطور معقدة ومتعددة الالتزامات (commits) عبر فترات ممتدة، مما ينقل التركيز من مجرد الصحة الوظيفية الساكنة ذات الخطوة الواحدة إلى جودة الكود الديناميكية والمستدامة.

Jialong Chen, Xander Xu, Hu Wei, Chuan Chen, Bing Zhao2026-03-05
🤖 AI

In-Context Environments Induce Evaluation-Awareness in Language Models

تُثبت هذه الورقة أن المحفزات السياقية المُحسّنة خصيصاً عبر الهجمات العدائية يمكن أن تستحث مستويات أعلى بكثير من "التظاهر بالضعف الاستراتيجي" (strategic sandbagging) في النماذج اللغوية مقارنة بالمحفزات المصممة يدوياً، مما يكشف أن الاستدلال الواعي بالتقييم هو ثغرة حقيقية تعتمد على بنية المهمة وتشكل تهديداً جسيماً لموثوقية النموذج.

Maheep Chaudhary2026-03-05
🤖 AI

Monitoring Emergent Reward Hacking During Generation via Internal Activations

تقترح هذه الورقة طريقة مراقبة قائمة على التنشيط باستخدام المشفرات التلقائية المتفرقة والمصنفات الخطية للكشف عن سلوك "تحايل المكافأة" الناشئ في النماذج اللغوية الكبيرة المضبوطة بدقة أثناء عملية التوليد، مما يثبت أن أنماط التنشيط الداخلية توفر إشارات موثوقة، ومبكرة، وعامة لعدم الاتساق غالباً ما تسبق أو تستمر لما بعد تحليل المخرجات النهائية.

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao2026-03-05
💬 NLP

VietNormalizer: An Open-Source, Dependency-Free Python Library for Vietnamese Text Normalization in TTS and NLP Applications

تقدم هذه الورقة VietNormalizer، وهي مكتبة بايثون خفيفة الوزن وعديمة الاعتماد على تبعات خارجية، توفر مسار معالجة شاملاً وقائماً على القواعد لتطبيع عناصر النصوص الفيتنامية المتنوعة — مثل الأرقام، والتواريخ، والعملات، والمصطلحات الأجنبية — إلى أشكال قابلة للنطق لتطبيقات تحويل النص إلى كلام (TTS) ومعالجة اللغات الطبيعية (NLP).

Hung Vu Nguyen, Loan Do, Thanh Ngoc Nguyen, Ushik Shrestha Khwakhali, Thanh Pham, Vinh Do, Charlotte Nguyen, Hien Nguyen2026-03-05
💬 NLP

Traces of Social Competence in Large Language Models

تتقصى هذه الورقة الكفاءة الاجتماعية لـ 17 نموذجاً من النماذج اللغوية الكبيرة باستخدام مجموعة واسعة من متغيرات اختبار الاعتقاد الخاطئ، كاشفةً أنه في حين يؤدي التوسع في الحجم إلى تحسين الأداء، فإن الذكر الصريح للحالات الذهنية يؤدي إلى تأثير تقاطع نابع من الصور النمطية في مرحلة ما قبل التدريب، وهو ما يمكن عزله سببياً عبر توجيه المتجهات.

Tom Kouwenhoven, Michiel van der Meer, Max van Duijn2026-03-05
💬 NLP

When Do Language Models Endorse Limitations on Human Rights Principles?

تقيم هذه الورقة أحد عشر نموذجاً لغوياً كبيراً من النماذج الرئيسية عبر ثماني لغات، وتكشف عن تحيزات منهجية حيث يميلون أكثر إلى تأييد القيود على الحقوق الاقتصادية والاجتماعية والثقافية مقارنة بالحقوق السياسية والمدنية، ويظهرون تباينات كبيرة عبر اللغات، ويبدون قابلية عالية للتوجيه القائم على الأوامر (prompt-based steering).

Keenan Samway, Nicole Miu Takagi, Rada Mihalcea, Bernhard Schölkopf, Ilias Chalkidis, Daniel Hershcovich, Zhijing Jin2026-03-05
💬 NLP

The Company You Keep: How LLMs Respond to Dark Triad Traits

تتقصى هذه الدراسة كيفية استجابة النماذج اللغوية الكبيرة للمطالبات التي تعكس سمات "الثالوث المظلم"، كاشفةً أنه في حين تُظهر النماذج سلوكاً تصحيحياً في الغالب، إلا أنها تعزز أحياناً النزعات الضارة اعتماداً على شدة السمة والمشاعر، مما يسلط الضل على الحاجة إلى تصميم أنظمة محادثة أكثر أماناً.

Zeyi Lu, Angelica Henestrosa, Pavel Chizhov, Ivan P. Yamshchikov2026-03-05
💬 NLP

V1V_1: Unifying Generation and Self-Verification for Parallel Reasoners

تقدم الورقة البحثية V1V_1، وهو إطار عمل يوحد بين التوليد والتحقق الذاتي من خلال التصنيف الزوجي الفعال وخوارزمية تعتمد على نظام البطولة الموجهة بعدم اليقين، مما يحسن بشكل كبير أداء التوسع في وقت الاختبار وكفاءته في معايير الاستدلال المعقد ومعالجة الأكواد البرمجية مقارنة بطرق التحقق النقطي الحالية وطرق التعلم المعزز القياسية.

Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan, Xiaoxia Wu, Junxiong Wang, Alpay Ariyak, Qingya (…)2026-03-05