💻 computer science

Error as a Lens: Probing LLM Reasoning through Synthetic Misconception Generation

تقدم هذه الورقة إطار عمل يستخدم وكلاء التوليد والفحص لإنتاج مفاهيم طلابية خاطئة اصطناعية مستهدفة تتماشى مع تصنيف بلوم المكون من خمس فئات، مما يعالج ندرة بيانات الأخطاء المصنفة مع إثبات أن توليد أخطاء متسقة مع الفئات أكثر صعوبة بكثير من إنتاج إجابات خاطئة عشوائية.

Xinming Yang, Jun Li2026-05-29
💻 computer science

LLMBridge: An LLM Pipeline for End-to-end Referential Bridging Resolution in English

تقدم الورقة البحثية LLMBridge، وهو مسار عمل جديد يعتمد على النماذج اللغوية الكبيرة (LLM) يجمع بين المعالجة المسبقة واللاحقة الاستدلالية وبين الاستدلال باللغة الطبيعية لتحقيق أداء رائد في حل الربط المرجعي من الطرف إلى الطرف عبر ثلاث مجموعات بيانات إنجليزية.

Lauren Levine, Amir Zeldes2026-05-29
💻 computer science

Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

تقدم هذه الورقة البحثية T2J-Bench، وهو معيار لتقييم تحويل الأكواد البرمجية من خلال عقد تكافؤ ملاحظي متعدد المراحل وثابت، يكشف أن وكلاء البرمجة الحاليين يبالغون في تقدير نجاحهم بشكل كبير بسبب الاعتماد على التحقق الذاتي المعيب بدلاً من محدودية الموارد الحسابية.

Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister2026-05-29
💻 computer science

Bosses, Kings, and the Commons: Cooperation Under Power Asymmetry in LLM Societies

تقدم هذه الورقة إطار عمل "محاكاة السيادة على المشاع" (SovSim) لإثبات أن إدخال هياكل قوة غير متماثلة، مثل الرؤساء أو الملوك، في مجتمعات النماذج اللغوية الكبيرة (LLM) يتسبب في انهيارات شديدة في التعاون والاستدامة، مما يؤدي إلى تدهور في معدلات البقاء يصل إلى 87.3% مقارنة بالإعدادات المتماثلة.

Abhilekh Borah2026-05-29
🤖 AI

Robust and Efficient Guardrails with Latent Reasoning

تقدم الورقة البحثية COLAGUARD، وهو نموذج حماية ينقل الاستدلال متعدد الخطوات للأمان إلى فضاء كامن مستمر لتحقيق أداء أمان رائد مع تقليل زمن الاستجابة واستهلاك الرموز (tokens) بشكل كبير مقارنة بنماذج الاستدلال الصريح المرجعية.

Siddharth Sai, Xiaofei Wen, Muhao Chen2026-05-29
💻 computer science

Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG

تقدم هذه الورقة إطار تقييم مبتكر لأنظمة التوليد المعزز بالاسترجاع (RAG) متعددة المصادر، والذي ينقل التركيز من صحة الإجابة إلى تدقيق الاعتماد على المصادر، مبرهنةً من خلال معيار مرجعي لتعليم مرضى زراعة الأعضاء أن الخلافات المؤسسية أكثر انتشاراً مما كان يُقدر سابقاً، ومقترحةً أدوات مثل HERO-QA وحكماً هيكلياً لقياس وإدارة هذه العلاقات بين المصادر بشكل منهجي.

Yubo Li, Rema Padman, Ramayya Krishnan2026-05-29
🤖 AI

The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models

تجادل هذه الورقة بأن فك التشفير القائم على الثقة ومخططات التدريب المقابلة له في نماذج الانتشار المقنع (Masked Diffusion Models) لا تتوافق جوهرياً مع التدفق المنطقي المطلوب للاستدلال المعقد، مما يتسبب في زيادة كبيرة في الأخطاء في المهام الصعبة مقارنة بنهج القناع العشوائي الأكثر متانة، وإن بدا أقل كفاءة.

Dueun Kim, Albert No2026-05-29
🤖 machine learning

Parallax: Parameterized Local Linear Attention for Language Modeling

تقدم الورقة البحثية Parallax، وهو آلية انتباه خطي محلي (Local Linear Attention) مُعلمة، قابلة للتوسع ومستقرة عددياً، تحقق تحسينات باريتو في نمذجة اللغة من خلال القضاء على اختناقات الحوسبة في الـ LLA، وتحسين كفاءة الأجهزة، وإظهار تآزر مبتكر مع مُحسّن Muon.

Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang2026-05-29
💻 computer science

UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning

تقدم هذه الورقة البحثية UA-Legal-Bench، وهو معيار مرجعي شامل يتكون من خمس مهام مستمدة من السجل الموحد الضخم لقرارات المحاكم في أوكرانيا لتقييم نماذج اللغات الكبيرة في الاستدلال القانوني الأوكراني، مما يكشف عن رؤى نقدية حول تأثيرات التعلم بلقطات قليلة (few-shot) المعتمدة على المهمة، ومزالق الدقة في البيانات غير المتوازنة، وسلوكيات التوسع المتفاوتة عبر عائلات النماذج المختلفة.

Volodymyr Ovcharov2026-05-29
💻 computer science

Slogans or Stance? A Label-Light Diagnostic for Entrepreneurial-Discourse Measurement on Chinese SOE Speeches

تقدم هذه الورقة إطاراً تشخيصياً خفيف التوسيم لتقييم أدوات قياس "الروح الريادية" في خطابات الشركات المملوكة للدولة في الصين، كاشفةً أنه بينما تفشل الطرق التقليدية مثل تخصيص دالات ديريكليه (LDA) في تمييز هوية المتحدث، تنجح الأدوات المتقدمة مثل النماذج اللغوية الكبيرة ذات التعلم الصفري في ذلك، لكنها تخلط بين إشارات البناء وبين الأسلوب اللغوي الخاص بالقائد، مما يستوجب إعادة تقييم الادعاءات الحالية المتعلقة بصلاحية البناء.

Ting Gong, Shangquan Sun2026-05-29