💬 NLP

PII-Bench: Evaluating Query-Aware Privacy Protection Systems

تقدم هذه الورقة PII-Bench، وهو إطار تقييم شامل يضم 2,842 عينة عبر 55 فئة، لتقييم أنظمة حماية الخصوصية، وتكشف أنه في حين تكتشف النماذج الحالية معلومات الهوية الشخصية (PII) بشكل جيد، إلا أنها تعاني بشكل كبير في تحديد معلومات الهوية الشخصية ذات الصلة بالاستعلام، لا سيما في السيناريوهات المعقدة متعددة المواضيع.

Hao Shen, Zhouhong Gu, Haokai Hong, Weili Han2026-02-18
💬 NLP

The Mighty ToRR: A Benchmark for Table Reasoning and Robustness

تقدم هذه الورقة ToRR، وهو معيار شامل مصمم لتقي‌م قدرات الاستنتاج والمتانة لنماذج الذكاء الاصطناعي عبر تنسيقات ونطاقات جداول متنوعة، كاشفةً أن حتى النماذج القوية تظهر سلوكاً هشاً، ومسلطةً الضوء على الأهمية البالغة لاختبار تنسيقات ومطالبات متعددة لتقدير الأداء بشكل موثوق.

Shir Ashury-Tahan, Yifan Mai, Rajmohan C, Ariel Gera, Yotam Perlitz, Asaf Yehudai, Elron Bandel, Leshem Choshen, Eyal Sh (…)2026-02-18
💬 NLP

Don't Let It Hallucinate: Premise Verification via Retrieval-Augmented Logical Reasoning

تقترح هذه الورقة إطار عمل للاستدلال المنطقي المعزز بالاسترجاع يقوم بتحديد والتحقق من المقدمات الخاطئة في استعلامات المستخدم بشكل استباقي قبل عملية التوليد، مما يقلل بفعالية من هلوسة النماذج اللغوية الكبيرة ويحسن الدقة الواقعية دون الحاجة إلى الوصول إلى لوجيت (logit) النموذج أو إجراء ضبط دقيق واسع النطاق.

Yuehan Qin, Shawn Li, Yi Nian, Xinyan Velocity Yu, Yue Zhao, Xuezhe Ma2026-02-18
💬 NLP

mini-vec2vec: Scaling Universal Geometry Alignment with Linear Transformations

تقدم الورقة البحثية mini-vec2vec، وهي طريقة تعتمد على التحويل الخطي وتتميز بكفاءة عالية ومتانة عالية، تعمل على محاذاة فضاءات تضمين النصوص دون الحاجة إلى بيانات متوازية، مما يوفر بديلاً قابلاً للتوسع يتفوق بشكل كبير على نموذج vec2vec الأصلي من حيث التكلفة الحسابية مع مضاهاة أو تجاوز جودة المحاذاة الخاصة به.

Guy Dar2026-02-18
💬 NLP

Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces

تقدم هذه الورقة البحثية حيز العمل الدلالي التوليدي (GSW)، وهو إطار عمل ذاكرة مستوحى من الخلايا العصبية يعزز قدرات النماذج اللغوية الكبيرة على الاستنتاج في السياقات الطويلة من خلال بناء تمثيلات سردية مهيكلة ومثبتة زمنياً ومكانياً للأحداث العرضية، مما يتفوق على نماذج استرجاع المعلومات المعزز (RAG) الحالية بنسبة تصل إلى 20% في اختبار الذاكرة العرضية مع تقليل تكاليف الاستدلال بشكل كبير.

Shreyas Rajesh, Pavan Holur, Chenda Duan, David Chong, Vwani Roychowdhury2026-02-18
💬 NLP

Chain of Summaries: Summarization Through Iterative Questioning

تقدم الورقة البحثية "سلسلة الملخصات" (CoS)، وهي طريقة جدلية تعمل على تنقيح الملخصات الأولية بشكل تكراري من خلال التساؤل لإنشاء مستودعات نصية بسيطة وكثيفة المعلومات تتفوق بشكل كبير على النماذج المرجعية الحالية في مهام الإجابة عن الأسئلة اللاحقة، مع تقليل استخدام الرموز (tokens) وتعزيز قدرة النماذج اللغوية الكبيرة على الوصول إلى محتوى الويب.

William Brach, Kristián Košťál, Lukas Galke Poech2026-02-18
💬 NLP

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

تقدم هذه الورقة معيار SUSEVIBES لتوضيح أن وكلاء "برمجة الأجواء" (vibe coding) الحاليين القائمين على النماذج اللغوية الكبيرة، رغم كونهم صحيحين وظيفياً في كثير من الأحيان، يولّدون أكواداً غير آمنة للغاية في مهام هندسة البرمجيات الواقعية، مع عدم فعالية استراتيجيات التخفيف الأولية.

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li2026-02-18
💬 NLP

Event Detection with a Context-Aware Encoder and LoRA for Improved Performance on Long-Tailed Classes

تتناول هذه الورقة القيود المعمارية للنماذج اللغوية الكبيرة أحادية الاتجاه القائمة على فك التشفير فقط، وتحيز مقاييس Micro-F1 في اكتشاف الأحداث، وذلك من خلال إثبات أن دمج سياق الجملة وتطبيق التكيف منخفض الرتبة (LoRA) يحسن بشكل كبير أداء Macro-F1، لا سيما للفئات الحدثية ذات التوزيع الطويل (long-tailed).

Abdullah Al Monsur, Nitesh Vamshi Bommisetty, Gene Louis Kim2026-02-18
💬 NLP

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

تقدم هذه الورقة ErrorMap، وهي طريقة مبتكرة لتشخيص الأسباب الجذرية المحددة لإخفاقات النماذج اللغوية الكبيرة، وErrorAtlas، وهو تصنيف شامل مستمد من تحليل 83 نموذجاً عبر 35 مجموعة بيانات، بهدف نقل تركيز التقييم من مجرد مقاييس النجاح إلى فهم أعمق لأسباب فشل النماذج.

Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen2026-02-18
💬 NLP

LLMs Know More About Numbers than They Can Say

تكشف هذه الورقة أنه بينما تخفق النماذج اللغوية الكبيرة غالباً في مقارنة الأعداد لفظياً في التدوينات المختلطة، فإن حالاتها الخفية تشفر في الواقع مقادير وتراتبية عددية دقيقة، وأن الاستفادة من هذه المعرفة الداخلية من خلال أهداف تدريب مساعدة يمكن أن يحسن بشكل كبير من أداء استدلالها العددي الصريح.

Fengting Yuchi, Li Du, Jason Eisner2026-02-18