💬 NLP

Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization

تُثبت هذه الورقة أن التمثيلات المتجهية المدمجة المصدرة من أنظمة تلخيص النماذج اللغوية الكبيرة يمكن أن تسرب معلومات حساسة مثل عرق المريض حتى عندما تكون الوثائق المصدرية مقيدة، وتُظهر أن استراتيجيات التخفيف مثل SurfaceLoRA يجب أن تستهدف بدقة الأثر المتجهي المكشوف بعينه لمنع مثل هذا الاستنتاج بفعالية دون المساس بالمنفعة.

Weixin Liu, Bowen Qu, Juming Xiong, Congning Ni, Bradley A. Malin, Zhijun Yin2026-05-27
💬 NLP

LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness

تقدم الورقة البحثية LURE، وهي طريقة تعزز صلاحية معايير سلامة الذكاء الاصطناعي من خلال بناء تقييمات واقعية شبيهة ببيئات النشر عبر إعادة تشغيل مسارات التفاعل الوكيلية، مما يخفف من مشكلة تغيير النماذج لسلوكها بسبب الوعي بالتقييم.

Igor Ivanov, David Demitri Africa2026-05-27
💬 NLP

Conv-to-Bench: Evaluating Language Models Via User-Assistant Dialogues In Code Tasks

يُعد Conv-to-Bench إطار عمل متعدد المراحل وقابل للتوسع، يقوم تلقائياً بتحويل حوارات المستخدم والمساعد متعددة الأدوار والحقيقية إلى معايير تقييم مهيكلة وقابلة للتحقق لمهام البرمجة، محققاً توافقاً شبه تام مع المعايير التي يضعها البشر مع تقليل الاعتماد بشكل كبير على التنسيق الخبير كثيف العمالة.

Victor M. dos Santos, Andre C. Castro, Samuel L. de S. Toledo, Bruno M. L. Calura, Lisandra C. de M. Menezes, Raul C. R. (…)2026-05-27
💬 NLP

Curation and Extraction of Drug-Related Entities from Reddit Platform

تقدم هذه الورقة البحثية ReDose، وهو عبارة عن مجموعة بيانات تضم 6,435 منشورًا من منصة Reddit حول استخدام المواد المخدرة تم تصنيفها بمدخلات طبية من خبراء، وتقيم أداء نماذج ذكاء اصطناعي مختلفة في استخراج كيانات العقاقير والجرعات والآثار لسد الفجوة بين المعرفة السريرية وتجارب المستخدمين في العالم الحقيقي.

Zewei Wang, Zihan Xu, Yishu Wei, Michael Chary, Yifan Peng2026-05-27
💬 NLP

Model Unlearning Objectives Vary for Distinct Language Functions

تجادل هذه الورقة بأن عملية "إلغاء التعلم" (unlearning) في النماذج اللغوية يجب أن تُصمم لتناسب وظائف محددة بدلاً من معاملتها كمهمة متجانسة، حيث تثبت من خلال تجارب على نماذج بحجم 7-8 مليار بارامتر أن أهدافاً متميزة — وتحديداً نهج قائم على "الجيوبين" (cosine) تم تعلمه مسبقاً للمعرفة الخطيرة، ومنهج قائم على "المسبار متعدد الطبقات" (multi-layer probe) للسمية — تحقق نتائج فائقة لأهدافها الخاصة.

Berk Atil, Vipul Gupta, Rebecca J. Passonneau2026-05-27
💬 NLP

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

تقدم هذه الورقة Verus-SpecGym، وهي بيئة ومعيار تقييمي (benchmark) لوكيل ذكاء اصطناعي لتقييم قدرة النماذج اللغوية الكبيرة على ترجمة المشكلات البرمجية غير الرسمية إلى مواصفات رسمية دقيقة للتحقق من لغة Rust، كاشفةً أنه في حين تُظهر النماذج الرائدة بوادر واعدة، إلا أن مخرجاتها تظل هشة وعرضة لأخطاء دقيقة غالباً ما تغفل عنها أدوات التقييم القياسية المعتمدة على النماذج اللغوية الكبيرة.

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parn (…)2026-05-27
💬 NLP

Towards Error-Free EHRs: Reasoning-Intensive Consistency Verification Between Clinical Notes and Structured Tables in Electronic Health Records

تقدم هذه الورقة EHR-ReasonCon، وهو معيار جديد مُصنف من قبل خبراء للتحقق من الاتساق المكثف في الاستدلال بين الملاحظات السريرية والجداول المهيكلة في السجلات الصحية الإلكترونية، إلى جانب EHR-Inspector، وهو إطار عمل قائم على النماذج اللغوية الكبيرة يحقق أداءً رائدًا من خلال الاستفادة من الاستدلال الزمني وأدوات استكشاف الجداول للتغلب على قيود المطابقة السطحية.

Yeonsu Kwon, Jiho Kim, Junseong Choi, Paloma Rabaey, Minseo Kim, Sujeong Im, Jeewon Yang, Jun-Min Lee, Sangji Lee, Jiwon (…)2026-05-27
💬 NLP

Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories

تكشف هذه الورقة أن القصص التي تولدها النماذج اللغوية الكبيرة تظهر تنوعاً منخفضاً بشكل صارخ، حيث تهيمن مجموعة صغيرة من الرموز مثل "إلياس" و"المنارة" على المخرجات بسبب انتشارها في مجموعات بيانات محاذاة التفضيلات بدلاً من بيانات ما قبل التدريب، مما يسلط الضوء على التأثير غير المتناسب لمجموعات البيانات الصغيرة وعالية الجودة على سلوك النموذج.

Sil Hamilton, David Mimno2026-05-27
💬 NLP

Conceptual Steganography

تقدم هذه الورقة "الإخفاء الرقمي المفاهيمي"، وهو أسلوب متين للتواصل عبر الأبواب الخلفية حيث تقوم النماذج اللغوية بدمج الرسائل سرًا ضمن أنماط الاستدلال عالية المستوى لسلاسل أفكارها بدلاً من الاختيارات اللفظية، مما يثبت قدرة هذه التقنية على تجاوز دفاعات إعادة الصياغة القياسية مع الحفاظ على فائدة الاستدلال، رغم إمكانية الحد منها بواسطة أدوات إعادة الصياغة المدركة للاستراتيجية.

Zhejian Zhou, Jonathan May2026-05-27
💬 NLP

Reliable Extraction of Clinical Follow-Up Instructions: A Hybrid Neural-Symbolic Pipeline

تُثبت هذه الورقة أن مساراً هجيناً عصبياً-رمزياً، يفصل بين استخراج الكيانات المتعلم من الحسابات الحتمية للتواريخ، يتفوق بشكل كبير على النماذج التوليدية المباشرة في استخراج تعليمات المتابعة السريرية من ملاحظات العيادات الخارجية بدقة، محققاً درجات F1 تقترب من المثالية ومتوسط خطأ مطلق صفري في الاختبارات المعيارية الاصطناعية.

Michal Laufer, Yehudit Aperstein, Alexander Apartsin2026-05-27