🤖 AI

MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing

تقدم الورقة البحثية MULTITEXTEDIT، وهو معيار مرجعي منضبط يمتد عبر 12 لغة ومقياساً جديداً لدقة اللغة، لتوضيح أن أنظمة تحرير النصوص داخل الصور الحالية تعاني من تدهور كبير في دقة اللغات عبر اللغات، لا سيما في دقة الخطوط للغات غير اللاتينية، على الرغم من الحفاظ على البنية البصرية العالمية.

Liwei Cheng, Zirui Song, Shibo Feng, Lunjie Zhou, Yixuan Guan, Dayan Guan2026-05-12
⚛️ general relativity

LLMs with in-context learning for Algorithmic Theoretical Physics

تُثبت هذه الورقة أن نموذج لغة كبير رائد (Claude) متصل بنظام جبر حاسوبي (Maple) ومعزز بالتعلم في السياق عبر أمثلة محلولة، يمكنه تنفيذ حسابات خوارزمية معقدة في الفيزياء النظرية بشكل موثوق، وتحديداً للاضطرابات الكونية في نظريات الجاذبية المعدلة، مع تحديد القيود الحالية واستراتيجيات التحسين أيضاً.

Anamaria Hell, Leander Thiele2026-05-12
🤖 machine learning

In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification

تكشف هذه الورقة أن نماذج التعلم في السياق مقيدة ميكانيكيًا بمعاملة الرموز الموضحة كقاموس شامل، مما يؤدي إلى انهيار الدقة عندما تُملأ خانات التسمية برموز متجانسة أو حتى رموز صالحة دلاليًا، وهي ظاهرة تتركز في دوائر عصبية محددة تتجاوز الفهم الدلالي عبر استرجاع الرموز القائم على التنسيق.

Ming Liu2026-05-12
🤖 machine learning

mHC-SSM: Manifold-Constrained Hyper-Connections for State Space Language Models with Stream-Specialized Adapters

تُثبت هذه الورقة أن تطبيق الروابط الفائقة المقيدة بالمنوع (mHC) على نماذج فضاء الحالة (SSMs) يحسن بشكل كبير أداء نمذجة اللغة على مجموعة بيانات WikiText-2 من خلال تقييد خلط التدفق المتبقي بمصفوفات ثنائية العشوائية ودمج محولات متخصصة في التدفق، مما يحقق انخفاضاً في الحيرة مع زيادات طفيفة فقط في تكاليف الذاكرة والإنتاجية.

Abdulvahap Mutlu, Şengül Doğan, Türker Tuncer2026-05-12
💬 NLP

How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

تُظهر هذه الورقة أنه بينما تُعد دوائر النماذج اللغوية المُحددة متسقة للغاية وضرورية لأداء المهام، إلا أنها تفتقر إلى خصوصية المهمة بسبب التداخل الكبير بين المهام، مما يتحدى فائدة هذا الإطار للتدخل المستهدف والفهم.

Michael Li, Nishant Subramani2026-05-12
💬 NLP

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

تقدم الورقة البحثية SecureForge، وهو مسار مؤتمت يعمل على تحسين الأوامر النظامية باستخدام مجموعة بيانات اصطناعية من الأوامر المعززة بالثغرات الأمنية لتقليل العيوب الأمنية في الكود المولد بواسطة النماذج اللغوية الكبيرة بشكل كبير مع الحفاظ على الأداء الوظيفي، محققاً انخفاضاً يصل إلى 48% في الثغرات الأمنية مع قابلية انتقال من نوع "التعلم من المحاولة الأولى" (zero-shot) إلى سيناريوهات العالم الحقيقي.

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yan (…)2026-05-12
💬 NLP

Change My View? The Dynamics of Persuasion and Polarization in Online Discourse

من خلال تحليل المناظرات على موقع "ريديت" باستخدام النماذج اللغوية الكبيرة، تُظهر هذه الدراسة أن مراجعة المعتقدات في الخطاب عبر الإنترنت مدفوعة بالاستراتيجيات العلاقاتية مثل التنازل والتعاطف أكثر من دحض المنطق المباشر، مما يشير إلى أن الاستدلال العام الفعال يتطلب موازنة المحتوى الدليلي مع التأطير التعاطفي.

David Freeborn, Malihe Alikani, Anthony Sicilia2026-05-12
📊 statistics

Queryable LoRA: Instruction-Regularized Routing Over Shared Low-Rank Update Atoms

تقدم هذه الورقة البحثية "Queryable LoRA"، وهي طريقة لضبط المعلمات بكفاءة عالية، تستبدل المهايئات منخفضة الرتبة الثابتة بذاكرة مشتركة وقابلة للاستعلام من ذرات التحديث التي يتم توجيهها عبر آلية الانتباه ويتم تنظيمها بواسطة التعليمات، مما يتيح تكيفاً ديناميكياً وحساساً للسياق يحسن الأداء والاستقرار مقارنة بالأساليب القياسية.

Omatharv Bharat Vaidya, Connor T. Jerzak, Nhat Ho, Chandrajit Bajaj2026-05-12
📊 statistics

A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

تقدم هذه الورقة Sem-ECE، وهو إطار عمل مبتكر يقيم المعايرة في الإجابة على الأسئلة مفتوحة النهايات من خلال أخذ عينات من مخرجات النموذج وتجميعها في فئات دلالية لتوفير مقياس غير منحاز وقوي يتفوق على الأساليب القائمة على التعبير اللفظي وأساليب أخذ العينات الحالية، لا سيما عندما لا تتوفر احتمالات النموذج الداخلية.

Zhanliang Wang, Jiancong Xiao, Ruochen Jin, Shu Yang, Bojian Hou, Li Shen2026-05-12
🤖 AI

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

تقدم هذه الورقة Magis-Bench، وهو معيار مرجعي جديد مستمد من الاختبارات القضائية البرازيلية يقيم 23 نموذجاً من النماذج اللغوية الكبيرة المتطورة في مهام الاستدلال القانوني والكتابة على مستوى القضاة، كاشفاً أن حتى النماذج الأعلى أداءً تواجه صعوبة في تحقيق درجات عالية في صياغة القرارات القضائية المسببة.

Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Ju (…)2026-05-12