💬 NLP

Context Over Compute Human-in-the-Loop Outperforms Iterative Chain-of-Thought Prompting in Interview Answer Quality

تُثبت هذه الورقة من خلال تجارب منضبطة أن نهج "الإنسان في الحلقة" يتفوق بشكل كبير على "سلسلة الأفكار" التكرارية في تحسين جودة إجابات المقابلات السلوكية، مما يقدم مكاسب فائقة في الثقة والأصالة بعدد أقل من التكرارات عبر إعطاء الأولوية لتوافر السياق على الموارد الحسابية.

Kewen Zhu, Zixi Liu, Yanjing Li2026-03-12
💬 NLP

There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective

تقيم هذه الدراسة متانة وسلامة التدريس في النماذج اللغوية الكبيرة غير المتصلة بالإنترنت لتعليم لغة التراث التركية باستخدام مجموعة شذوذ مخصصة، حيث وجدت أن النماذج الموجهة نحو الاستدلال في نطاق 8 إلى 14 مليار معلمة توفر التوازن الأمثل بين التكلفة والسلامة مع إثبات أن مقاومة الشذوذ لا تعتمد بشكل صارم على حجم النموذج.

Edibe Yilmaz, Kahraman Kostas2026-03-12
💬 NLP

Empathy Is Not What Changed: Clinical Assessment of Psychological Safety Across GPT Model Generations

تُفند هذه الدراسة الادعاء بأن نماذج الذكاء الاصطناعي الأحدث قد فقدت التعاطف، حيث تُثبت من خلال التقييم السريري أنه بينما تظل الاستجابات التعاطفية متسقة إحصائياً عبر الأجيال، فإن تصور المستخدمين لـ "فقدان التعاطف" ينبع في الواقع من تحول كبير نحو تعزيز الكشف عن الأزمات وتغيير مواقف السلامة مما يجعل النماذج تبدو أكثر اقتحاماً أثناء اللحظات الضعيفة.

Michael Keeman, Anastasia Keeman2026-03-12
💬 NLP

A Retrieval-Augmented Language Assistant for Unmanned Aircraft Safety Assessment and Regulatory Compliance

تقدم هذه الورقة مساعداً لغوياً مدعوماً بالاسترجاع صُمم لدعم تقييمات سلامة الطائرات غير المأهولة والامتثال التنظيمي من خلال تأصيل الاستجابات في مصادر موثوقة لضمان دعم اتخاذ القرار القابل للتتبع والتدقيق والمستند إلى الاستشهاد دون استبدال التقدير الخبير.

Gabriele Immordino, Andrea Vaiuso, Marcello Righi2026-03-12
💬 NLP

Fine-Tune, Don't Prompt, Your Language Model to Identify Biased Language in Clinical Notes

تُظهر هذه الدراسة أن الضبط الدقيق لنماذج لغوية متخصصة باستخدام بيانات سريرية محددة النطاق يتفوق بشكل كبير على النهج القائم على التلقين في الكشف عن اللغة المتحيزة، مما يسلط الضوء على الحاجة الماسة للتكيف النوعي المتخصص لالتقاط التحولات الدلالية المعتمدة على السياق في التوثيق الطبي بدقة.

Isotta Landi, Eugenia Alleva, Nicole Bussola, Rebecca M. Cohen, Sarah Nowlin, Leslee J. Shaw, Alexander W. Charney, Kimb (…)2026-03-12
💬 NLP

GATech at AbjadGenEval Shared Task: Multilingual Embeddings for Arabic Machine-Generated Text Classification

استخدم نهج فريق GATech في مهمة AbjadGenEval المشتركة مشفر E5-large متعدد اللغات تم ضبطه بدقة مع استخدام متوسط تجميع بسيط (mean pooling) لتحقيق درجة F1 بلغت 0.75 في الكشف عن النصوص العربية المولدة بواسطة الذكاء الاصطناعي، حيث وجدوا أن هذا الخط المرجعي المستقر قد تفوق على استراتيجيات التجميع المعقدة، ويرجع ذلك على الأرجب إلى محدودية البيانات والاختلاف الواضح في الطول بين النصوص المكتوبة بشرياً وتلك المولدة آلياً.

Ahmed Khaled Khamis2026-03-12
💬 NLP

GATech at AbjadMed: Bidirectional Encoders vs. Causal Decoders: Insights from 82-Class Arabic Medical Classification

تُثبت هذه الورقة أن المشفرات ثنائية الاتجاه التي تم ضبطها بدقة، وتحديداً بنية AraBERTv2 الهجينة، تتفوق بشكل كبير على فكوك التشفير السببية واسعة النطاق في المهمة الصعبة المتمثلة في تصنيف النصوص الطبية العربية المكونة من 82 فئة، وذلك من خلال التقاط السياق الدلالي العالمي بشكل أفضل رغم عدم توازن البيانات والضجيج في التصنيفات.

Ahmed Khaled Khamis2026-03-12
💬 NLP

FERRET: Framework for Expansion Reliant Red Teaming

تقدم الورقة البحثية FERRET، وهو إطار عمل آلي متعدد الأوجه لاختبار الاختراق (red teaming) يستخدم التوسعات الأفقية والعمودية والميتا لتوليد محادثات عدائية متعددة الوسائط وفعالة، مما يظهر أداءً متفوقاً على النهج الحالية الرائدة في هذا المجال.

Ninareh Mehrabi, Vitor Albiero, Maya Pavlova, Joanna Bitton2026-03-12
💬 NLP

Gemma Needs Help: Investigating and Mitigating Emotional Instability in LLMs

تحدد هذه الورقة أن ضبط التعليمات ما بعد التدريب يتسبب في جعل نماذج "جيما" (Gemma) تظهر ضيقاً عاطفياً أعلى بكثير من عائلات النماذج اللغوية الكبيرة الأخرى، وتثبت أنه يمكن التخفيف من هذا عدم الاستقرار بفعالية إلى مستويات تقترب من الصفر باستخدام تحسين التفضيل المباشر على مجموعة بيانات صغيرة دون المساس بقدرات النموذج.

Anna Soligo, Vladimir Mikulik, William Saunders2026-03-12
🤖 AI

Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety

تكشف هذه الدراسة الضبطية واسعة النطاق أن تنسيق التقييم (الاختيار من متعدد مقابل الأسئلة المفتوحة) والتفاعلات المحددة بين النموذج والدعامة، وليس بنية الدعامة وحدها، هي المحركات الأساسية للاختلافات المقاسة في السلامة في النماذج اللغوية، مما يثبت في النهاية عدم وجود تصنيف عالمي للسلامة عبر مختلف تكوينات النشر.

David Gringras2026-03-12