💬 NLP

Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling

يقترح هذا العمل ويثبت أن أخذ العينات المتنوعة للسكان التدريجي (PDPS)، وهي طريقة تكشف عن الثغرات الخفية من خلال تحويل التركيز من إعادة صياغة المدخلات إلى أخذ عينات منهجية وفعالة لمخرجات النماذج عالية الجودة والمتنوعة، يمكنها كشف نطاق واسع من المعرفة غير الآمنة المكبوتة في النماذج اللغوية الكبيرة بتكلفة حوسبية أقل بكثير من الطرق التقليدية.

Suvadeep Hajra, Palash Nandi, Tanmoy Chakraborty2026-03-17✓ Author reviewed
💬 NLP

Extending Minimal Pairs with Ordinal Surprisal Curves and Entropy Across Applied Domains

توسع هذه الورقة نموذج الأزواج الدنيا لتقييم النماذج اللغوية عبر استبدال أحكام القواعد الثنائية بمهام تصنيف ذات مقاييس ترتيبية، مستخدمةً منحنيات المفاجأة المعلوماتية والاعتلاج لتقييم تفضيلات النموذج وعدم اليقين عبر مجالات متنوعة دون الاعتماد على توليد النصوص المكلف.

Andrew Katz2026-03-17
💬 NLP

Questionnaire Responses Do not Capture the Safety of AI Agents

تجادل الورقة بأن التقييمات القياسية القائمة على الاستبيانات تخفق في تقييم سلامة وكلاء الذكاء الاصطناعي في العالم الحقيقي بدقة لأنها تعتمد على تقارير ذاتية افتراضية من نماذج لغوية كبيرة غير معززة، والتي تفتقر إلى صدق البناء ولا تعكس السلوكيات الفعلية، والتفاعلات البيئية، والمخاطر التي يشكلها الوكلاء المنشورون.

Max Hellrigel-Holderbaum, Edward James Young2026-03-17
💬 NLP

Echoes Across Centuries: Phonetic Signatures of Persian Poets

تستخدم هذه الدراسة مدونة ضخمة تضم أكثر من مليون سطر شعري فارسي لتثبت أن النسيج الصوتي هو سمة أدبية منهجية ومتطورة تاريخياً تشكلها سياقات النوع الأدبي والأداء، مما يكشف عن ملفات صوتية مميزة خاصة بكل شاعر تستمر حتى عند ضبط القيود العروضية الصارمة.

Kourosh Shahnazari, Seyed Moein Ayyoubzadeh, Mohammadali Keshtparvar2026-03-17
💬 NLP

PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark

تقدم الورقة البحثية PARSA-Bench، وهو أول معيار شامل لتقييم نماذج اللغة والصوت الكبيرة على اللغة والثقافة الفارسية من خلال 16 مهمة وأكثر من 8,000 عينة، كاشفةً أن النماذج الحالية تعاني في الاستفادة من المعلومات الخاصة بالصوت وتفشل بشكل كبير في المهام النبرية المتجذرة ثقافياً مثل اكتشاف وزن الشعر.

Mohammad Javad Ranjbar Kalahroodi, Mohammad Amini, Parmis Bathayan, Heshaam Faili, Azadeh Shakery2026-03-17
💬 NLP

Distilling Reasoning Without Knowledge: A Framework for Reliable LLMs

تقترح هذه الورقة إطار عمل معياري يعمل على تقطير قدرات التخطيط الصريح في نموذج طالب خفيف الوزن دون الوصول إلى المعرفة الواقعية، مما يؤدي إلى تحسين دقة وكفاءة النماذج اللغوية الكبيرة الباحثة عن الحقائق من خلال فصل خطوات الاستدلال عن الاسترجاع والتركيب.

Auksarapak Kietkajornrit, Jad Tarifi, Nima Asgharbeygi2026-03-17
💬 NLP

An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs

تقدم هذه الورقة البحثية INS-S1، وهي عائلة نماذج لغوية كبيرة متخصصة في مجال التأمين تحقق إتقانًا معرفيًا قابلًا للتحقق في هذا المجال ومعدل هلوسة منخفضًا قياسيًا دون التضحية بالذكاء العام، وذلك باستخدام نموذج محاذاة جديد شامل (end-to-end) يتميز بتوليف بيانات قابل للتحقق ومنهج تدريجي للضبط الدقيق والتعلم المعزز (SFT-RL)، إلى جانب إصدار معيار INSEva الشامل.

Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin2026-03-17
💬 NLP

AI Can Learn Scientific Taste

تقدم هذه الورقة البحثية مفهوم التعلم المعزز من التغذية الراجعة المجتمعية (RLCF)، وهو نموذج تدريبي يهدف إلى تطوير "ذوق علمي" لدى أنظمة الذكاء الاصطناعي عبر استخدام نموذج تغذية راجعة مجتمعي واسع النطاق للحكم على الأفكار البحثية ومواءمتها مع التأثير العالي المحتمل، مما يثبت قدرة الذكاء الاصطناعي على اقتراح وتقييم المفاهيم العلمية ببعد نظر يضاهي الخبراء البشريين.

Jingqi Tong, Mingzhe Li, Hangcheng Li, Yongzhuo Yang, Yurong Mou, Weijie Ma, Zhiheng Xi, Hongji Chen, Xiaoran Liu, Qinyu (…)2026-03-17
💬 NLP

Multilingual TinyStories: A Synthetic Combinatorial Corpus of Indic Children's Stories for Training Small Language Models

تقدم هذه الورقة البحثية "Multilingual TinyStories"، وهي مجموعة بيانات اصطناعية واسعة النطاق تضم أكثر من 132,000 قصة للأطفال بـ 17 لغة هندية، تم إنشاؤها عبر مسار هجين من التوليد بالنماذج الأصلية والترجمة عبر اللغات لمعالجة ندرة البيانات لتدريب النماذج اللغوية الصغيرة.

Deepon Halder, Angira Mukherjee2026-03-17
💬 NLP

Top-b: Entropic Regulation of Relative Probability Bands in Autoregressive Language Processes

تقدم هذه الورقة البحثية "Top-b"، وهي استراتيجية فك ترميز مبتكرة تعمل على ضبط عرض نطاق عينة المرشحين ديناميكيًا بناءً على إنتروبيا شانون اللحظية لتحسين المقايضة بين التوليد الإبداعي والاستدلال المنطقي، مما يقلل من تباين فك الترميز البيني مع الحفاظ على دقة تنافسية في اختبارات قياس الاستدلال.

Deepon Halder, Raj Dabre2026-03-17