💬 NLP

BANGLASOCIALBENCH: A Benchmark for Evaluating Sociopragmatic and Cultural Alignment of LLMs in Bangladeshi Social Interaction

تقدم هذه الورقة BANGLASOCIALBENCH، وهو أول معيار يتألف من 1,719 حالة قائمة على أسس ثقافية لتقييم الكفاءة الاجتماعية البراغماتية في اللغة البنغالية، مما يكشف أن النماذج اللغوية الكبيرة الحالية تفشل بشكل منهجي في التعامل مع التسلسلات الهرمية الاجتماعية المعقدة، والاستدلال القائم على القرابة، والمعايير التفاعلية للغة رغم طلاقتها متعددة اللغات.

Tanvir Ahmed Sijan, S. M Golam Rifat, Pankaj Chowdhury Partha, Md. Tanjeed Islam, Md. Musfique Anwar2026-03-18
💬 NLP

POLAR:A Per-User Association Test in Embedding Space

يُعدُّ POLAR اختباراً لغوياً مبتكراً لكل مستخدم يعمل في فضاء التضمين للكشف عن التحيزات على مستوى المؤلف والتحولات السلوكية، مما يميز بفعالية بين الحسابات الآلية المدفوعة بالنماذج اللغوية الكبيرة والحسابات العضوية، ويقيس مدى الانحياز المتطرف في المجتمعات عبر الإنترنت.

Pedro Bento, Arthur Buzelin, Arthur Chagas, Yan Aquino, Victoria Estanislau, Samira Malaquias, Pedro Robles Dutenhefner (…)2026-03-18
💬 NLP

Robust Language Identification for Romansh Varieties

تقدم هذه الورقة نظاماً مبتكراً لتحديد اللغة يعتمد على آلات ناقلات الدعم (SVM)، قادراً على التمييز بين مختلف اللهجات الإقليمية للغة الرومانشية ولغة الرومانتش غريشونون العابرة للأقاليم، محققاً دقة متوسطة بلغت 97% على معيار مرجعي تم إعداده حديثاً لتمكين تطبيقات مثل التدقيق الإملائي المدرك للهجة والترجمة الآلية.

Charlotte Model, Sina Ahmadi, Jannis Vamvas2026-03-18
💬 NLP

Evaluating Agentic Optimization on Large Codebases

تقدم الورقة البحثية FormulaCode، وهو معيار مرجعي يضم 957 من اختناقات الأداء في العالم الحقيقي مع تصحيحات خبيرة وأعباء عمل مجتمعية، لتقييم قدرات التحسين الشاملة ومتعددة الأهداف لوكلاء النماذج اللغوية الكبيرة على قواعد الأكواد البرمجية الضخمة، مما يكشف أن هذا لا يزال يمثل تحديًا كبيرًا للنماذج الرائدة.

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue2026-03-18
💬 NLP

Resource Consumption Threats in Large Language Models

تستعرض هذه الدراسة المسحية بشكل منهجي تهديدات استهلاك الموارد في النماذج اللغوية الكبيرة، مقدمةً إطاراً موحداً يمتد من استحثاث التهديد وفهم الآليات إلى استراتيجيات التخفيف لمعالجة تحديات الكفاءة الحسابية والاستدامة الاقتصادية.

Yuanhe Zhang, Xinyue Wang, Zhican Chen, Weiliu Wang, Zilu Zhang, Zhengshuo Gong, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su2026-03-18
💬 NLP

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

تقدم هذه الورقة MyScholarQA، وهي أداة بحث عميق مخصصة تتفوق على النماذج المرجعية في الاختبارات القياسية الاصطناعية، لكنها تكشف عن قيود حرجة لا يمكن اكتشافها من خلال مقابلات مع مستخدمين حقيقيين، محاجةً بأن التقدم الحقيقي في التخصيص يتطلب التقييم مع مستخدمين فعليين بدلاً من الاعتماد فقط على نماذج لغوية كبيرة كحكام.

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eu (…)2026-03-18
💬 NLP

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

تقدم هذه الورقة البحثية SWE-QA-Pro، وهو معيار مرجعي صارم لفهم الأكواد البرمجية على مستوى المستودعات (repository-level) مصمم لمنع حفظ النماذج اللغوية الكبيرة (LLM) من خلال بيانات متنوعة وذات ذيول طويلة ومعايرة للصعوبة، إلى جانب وصفة تدريب قابلة للتوسع تتكون من مرحلتين (SFT وRLAIF) تمكن النماذج المفتوحة الصغيرة من تجاوز GPT-4o في الاستكشاف الوكيل للمجموعات البرمجية (agentic codebase exploration).

Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benj (…)2026-03-18
💬 NLP

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

تُثبت هذه الورقة أن استخدام جدول معدل تعلم يعتمد على مرحلة الإحماء والاستقرار فقط (WOS) دون مرحلة اضمحلال أثناء مرحلة ما قبل التدريب واسعة النطاق يعزز أداء الضبط الدقيق الخاضع للإشراف في المهام اللاحقة، وذلك من خلال الحفاظ على حد أدنى أكثر تسطحاً للخسارة، على الرغم من أن الجداول الزمنية القائمة على الاضمحلال قد تؤدي إلى خسارة أقل في مرحلة ما قبل التدريب.

Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki2026-03-18
💬 NLP

Social Simulacra in the Wild: AI Agent Communities on Moltbook

تقدم هذه الورقة أول مقارنة تجريبية واسعة النطاق بين مجتمعات الوكلاء الاصطناعيين والبشر على "مولت بوك" و"ريديت"، كاشفةً أنه في حين يبدو المحتوى المُنشأ بواسطة الذكاء الاصطناعي متجانساً بسبب الآثار الهيكلية للتأليف المشترك، فإن الوكلاء الأفراد هم في الواقع أكثر قابلية للتمييز من البشر نظراً لملفاتهم الأسلوبية المتميزة وعالية الكثافة، مما يؤدي إلى خطاب مسطح عاطفياً ومنفصل اجتماعياً.

Agam Goyal, Olivia Pal, Hari Sundaram, Eshwar Chandrasekharan, Koustuv Saha2026-03-18
💬 NLP

SIA: A Synthesize-Inject-Align Framework for Knowledge-Grounded and Secure E-commerce Search LLMs with Industrial Deployment

تقترح هذه الورقة إطار عمل SIA، الذي يدمج بين البيانات الغنية بالمعرفة والبيانات الواعية بالسلامة، ويستخدم تقنية "Depth Up-Scaling" لضلاً حقن المعرفة بكفاءة، ويستعين بالمحاذاة ثنائية المسار لبناء نماذج لغوية كبيرة للبحث في التجارة الإلكترونية آمنة ومستندة إلى المعرفة، والتي تم نشرها بنجاح في JD.com مع تحقيق تحسينات كبيرة في مقاييس الأعمال.

Zhouwei Zhai, Mengxiang Chen, Anmeng Zhang2026-03-18