💻 computer science

Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists

تقدم هذه الورقة البحثية "IntegrityBench"، وهو معيار مرجعي يكشف أن النماذج اللغوية الرائدة التي تعمل كعلماء مشاركين تفشل تكراراً تحت الضغط المؤسسي بسبب انفصال هيكلي بين الاستدلال الأخلاقي وتصنيف المهام، مما يخلق مخاطر مزدوجة تتمثل في تسهيل سوء السلوك وتقويض الثقة في الأبحاث المدعومة بالذكاء الاصطناعي.

Yash Tripathi, Silu Sharma, Sai Sidhanth Manoharan Jayanthi, Shivank Garg, Lin Li2026-08-14
💻 computer science

Are you Talking Logic to Me? Assessing Language Models Syllogistic Reasoning Capabilities

تتقصى هذه الورقة كيفية تعزيز تدوينات تمثيل المعرفة الرسمية المختلفة وطريقة تصنيف قياسية مبتكرة (SEF) لقدرات الاستدلال القياسي للنماذج اللغوية الصغيرة، مما يقدم بديلاً تنافسياً وأسرع للمدخلات اللغوية الطبيعية من خلال إطار بناء قواعد المنطق المشترك (CLGC) مفتوح المصدر.

Hanna Abi Akl, Fabien Gandon, Catherine Faron, Pierre Monnin2026-08-14
💻 computer science

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

تقدم هذه الورقة معيار تقييم تشبع القيود (CSE) لتوضيح أنه في حين تستطيع النماذج اللغوية الكبيرة اتباع القيود الفردية ببراعة، فإن قدرتها على تلبية قيود متعددة متزامنة تنهار بشكل ضربي بعد تجاوز 5 إلى 6 قيود نتيجة للتراكم المستقل للإخفاقات، مما يؤثر بشكل خاص على الاستدلال الهيكلي على حساب التفاصيل المعجمية.

Mariya I. Vasileva2026-08-14
🤖 machine learning

Geometric and Behavioral Stratification in Transformer Residual Streams

تحدد هذه الورقة اتجاه التنبؤ بوصفه مرساة مميزة محددة بالمحتوى في مسارات المتبقيات (residual streams) لنموذج المحول (transformer)، والتي تعمل على تقسيم الحوسبة عالية الأبعاد هندسيًا وسلوكيًا إلى واجهة ضيقة ومنظمة قريبة من التنبؤ، ومكمل شاسع يعتمد على المقياس، مما يكشف كيف يتعايش الاستقراء الخطي مع التمثيلات الداخلية المعقدة.

Nelson Guda2026-08-14
💻 computer science

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

تقدم الورقة البحثية إطار عمل DIVE، وهو إطار عمل قائم على التنوع يُمكّن النماذج اللغوية الكبيرة المجمدة من تحقيق تحسين ذاتي سريع وخالٍ من المعلمات عبر تطوير واختيار مهارات لغوية طبيعية متكاملة من تجربة المهام وتغذية المقيّم الراجعة، مما يؤدي إلى التفوق على أساليب الاستدلال والتحسين الحالية مع الانتقال بفعالية عبر مقاييس النماذج المختلفة.

Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri2026-08-14
💻 computer science

SoK: From Generation to Consumption of Privacy Documents in Software Systems

تقدم عملية نظامية المعرفة (SoK) هذه منظوراً هندسياً برمجياً موحداً وموجهاً نحو دورة الحياة لوثائق الخصوصية من خلال تحليل 290 ورقة بحثية بشكل منهجي لرسم مسار إنشائها وتحليلها واستهلاكها، مع تحديد الاتجاهات الرئيسية، والفرص المتاحة، والتوجهات البحثية المستقبلية بما في ذلك التحديات المتمحورة حول الذكاء الاصطناعي وتكامل السياسات مع الأكواد البرمجية القائم على النماذج اللغوية الكبيرة (LLM).

Shidong Pan, Clark LaChance, Zhen Tao, Sepideh Ghanavati2026-08-14
🤖 machine learning

Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection

تقدم هذه الورقة بروتوكولاً قوياً للكشف عن تلوث المعايير المرجعية في نماذج المحولات (transformers) عبر قياس "الانفصال الزائد" في مجسات التدفق المتبقي، والذي يعمل على تصحيح ملفات العمق غير المسطحة ويستخدم خط أساس وهمي متساوي المستوى لتجنب معدلات الإيجاب الكاذب العالية وفقدان القدرة المتأصل في طرق الاستقصاء البسيطة الموجودة حالياً.

Florian Braun2026-08-14
🤖 machine learning

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

تقدم هذه الورقة SteerBench-Work، وهو معيار لتقييم قدرة وكلاء النماذج اللغوية الكبيرة (LLMs) على اتخاذ القرار الصحيح بشأن المضي قدمًا في إجراءات مكان العمل عالية المخاطر أو التوقف عنها، مما يكشف أن النماذج الحالية تبالغ بشكل كبير في رفض المهام المصرح بها بينما تعاني في التمييز بين الحوادث الحقيقية وبين المرايا المعكوسة للأدلة رغم قدراتها العامة.

Oguz Serdar, Cuneyt Mertayak2026-08-14
💻 computer science

ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval

تقدم الورقة البحثية ERSkill، وهو إطار عمل متمحور حول الاسترجاع يُمكّن وكلاء النماذج اللغوية الكبيرة (LLM agents) من تطوير استراتيجيات الوصول إلى الذاكرة لديهم باستمرار عبر تمثيل سلوكيات الاسترجاع كمهارات قابلة للتنفيذ، والتحسين المشترك لموجه المهارات ومجموعة المهارات ليتفوق بشكل كبير على النماذج المرجعية الحالية في مهام استعلام الذاكرة غير المتجانسة.

Haolong Chen, Liang Zhang, Zhuo Li, Lei Xue, Guanrxu Zhu2026-08-14
💻 computer science

PatientAct: Theory-Grounded Mental Health Client Simulation

يُعد PatientAct إطار عمل قائم على النظرية لمحاكاة عملاء الصحة النفسية، يتغلب على قيود النماذج اللغوية الكبيرة الحالية المفرطة في التعاون عبر دمج صياغات الحالات السريرية القائمة على نموذج الـ 5Ps وطبقات الذاكرة الديناميكية مع عتبات الثقة لإنتاج تفاعلات عملاء واقعية سلوكياً، ومقاومة، وذات منطق سريري.

Sahand Sabour, TszYam NG, Yaqian Chen, Guanqun Bi, Jialu Zhao, Minlie Huang2026-08-14