💬 NLP

Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models

تقدم هذه الورقة إطار عمل للتدقيق عبر اللغات يكشف أن التحيز الديموغرافي في النماذج اللغوية الكبيرة المستخدمة في عمليات إرسال الشرطة لحالات الطوارئ يظهر بشكل منهجي أثناء الحوادث الغامضة، ويتفاوت بشكل كبير عبر النوع الاجتماعي، والعرق، والمظهر الديني، ويظهر تباينات متميزة بين اللغتين الإنجليزية والماندارين الصينية، مما يسلط الضوء على الحاجة إلى تقييمات للنماذج تراعي السياق وتعتمد على اللغة قبل النشر في العالم الحقيقي.

William Guey, Wei Zhang, Pierrick Bougault, Yi Wang, Bertan Ucar, Vitor D. de Moura, José O. Gomes2026-05-05
💬 NLP

ReMedi: Reasoner for Medical Clinical Prediction

يُعد ReMedi إطار عمل مبتكر يعزز التنبؤ بالنتائج السريرية من السجلات الصحية الإلكترونية من خلال توليد أزواج (التعليل-الإجابة) عبر آلية إعادة توليد العينات الموجهة بالنتائج الحقيقية، محققاً تحسناً يصل إلى 19.9% في مقياس F1 مقارنة بالنماذج المرجعية المتطورة.

Yushi Cao, Yiming Chen, Hongchao Jiang, Hung-yi Lee, Robby T. Tan2026-05-05
💬 NLP

FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

تقدم هذه الورقة البحثية FT-RAG، وهو إطار عمل للتوليد المعزز بالاسترجاع دقيق التفاصيل يقوم بتفكيك الجداول إلى وحدات دلالية على مستوى المدخلات ويستخدم توسيع الجوار الهيكلي ليتفوق بشكل كبير على النماذج المرجعية الحالية في الاستدلال على الجداول المعقدة، مدعوماً بمعيار Multi-Table-RAG-Lib المقترح حديثاً.

Zebin Guo, Weidong Geng, Ruichen Mao2026-05-05
💬 NLP

Automated Interpretability and Feature Discovery in Language Models with Agents

تقدم هذه الورقة إطار عمل مستقلاً متعدد الوكلاء يعمل على أتمتة التفسير الآلي من خلال صقل الفرضيات واكتشاف الميزات الداخلية في النماذج اللغوية الكبيرة بشكل تكراري، مما يظهر أداءً فائقاً على الطرق أحادية الخطوة في إنتاج تفسيرات أكثر دقة وقابلية للتفنيد والتدقيق.

Arnau Marin-Llobet, Javier Ferrando2026-05-05
💬 NLP

Fine-Tuning Pre-Trained Code Models for AI-Generated Code Detection

تقدم الورقة البحثية نظام فريق "Archaeology" لمهمة SemEval-2026 رقم 13، والذي يستفيد من نماذج الأكواد البرمجية مسبقة التدريب والمعدلة بدقة واستراتيجيات متخصصة مثل التحقق المتقاطع بأسلوب "ترك لغة واحدة خارج المجموعة" وتعبئة الرموز بنظام "الساندوتش" لتحقيق أداء رفيع المستوى في كشف الكود المولد بواسطة الذكاء الاصطناعي وعزو مصدره.

Jany-Gabriel Ispas, Sergiu Nisioi2026-05-05
💬 NLP

Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models

تقدم الورقة البحثية S2^2R2^2، وهو إطار عمل للمتانة على مستوى القطع للنماذج اللغوية الضبطت باستخدام تقنية LoRA، يقوم بمحاذاة القطع الدلالية عبر النقل الأمثل ويقيد استقرار المهايئ للتخفيف من حدة الانجراف المعلوماتي الحرج الناتج عن اضطرابات المطالبات مع الحفاظ على الأداء النظيف والقدرة على الانتقال عبر مجموعات البيانات.

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Zhenglin Huang, Qisong He, Xinmiao Huang, Guangliang Cheng, Xiaowei Huang, Yi Dong2026-05-05
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

تقدم الورقة البحثية Prosa، وهو أول معيار اختبار للدردشة باللغة البرتغالية البرازيلية متعدد الجولات من مستخدمين حقيقيين، وتوضح أن استخدام نظام تسجيل المعايير الثنائية مع تصفية متعددة القضاة يحسن بشكل كبير من استقرار التقييم وقدرته التمييزية مقارنة بطرق "النموذج اللغوي الكبير كحَكَم" الشمولية التقليدية.

Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos P (…)2026-05-05
💬 NLP

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

تقدم هذه الورقة البحثية MultiBreak، وهو معيار مرجعي لكسر الحماية متعدد الدورات يتسم بالقابلية للتوسع والتنوع، ويحتوي على أكثر من 10,000 مطالبة عدائية تم إنشاؤها عبر مسار تعلم نشط، مما يكشف أن النماذج اللغوية الكبيرة تظهر نقاط ضعف أعلى بكثير في الإعدادات الحوارية الواقعية مقارنة بتقييمات الدور الواحد.

Jialin Song, Xiaodong Liu, Weiwei Yang, Wuyang Chen, Mingqian Feng, Xuekai Zhu, Jianfeng Gao2026-05-05
💬 NLP

GRAVITY: Architecture-Agnostic Structured Anchoring for Long-Horizon Conversational Memory

تقدم الورقة البحثية GRAVITY، وهو وحدة برمجية (module) مستقلة عن البنية التحتية وقابلة للتشغيل المباشر (plug-and-play)، تعمل على تعزيز ذاكرة المحادثات طويلة المدى من خلال استخراج وحقن تمثيلات علاقية وزمنية وموضوعية مهيكلة في المطالبات (prompts)، مما يحسن دقة الاستدلال بشكل كبير عبر مختلف النماذج اللغوية دون الحاجة إلى تعديلات في بنيتها.

Yushi Sun, Bowen Cao, Dong Fang, Lingfeng Su, Wai Lam2026-05-05
💬 NLP

BIM Information Extraction Through LLM-based Adaptive Exploration

تقدم هذه الورقة نموذج استكشاف تكيفي باستخدام وكلاء يعتمدون على النماذج اللغوية الكبيرة (LLM) يقومون بتنفيذ الكود بشكل تكراري لاكتشاف هياكل نماذج نمذجة معلومات البناء (BIM) ديناميكياً في وقت التشغيل، مما يظهر تحسينات كبيرة في الأداء مقارنة بطرق توليد الاستعلامات الثابتة على معيار ifc-bench v2 المقترح حديثاً.

Sylvain Hellin, Suhyung Jang, Stefan Fuchs, Stavros Nousias, André Borrmann2026-05-05