🧬 biology

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

تقترح هذه الورقة "المُجزئ الموحد" (One Tokenizer)، وهي بنية متعددة الوسائط أصلية تلغي الفجوة الهندسية بين الأنماط من خلال رسم خرائط لجميع المدخلات في فضاء رموز موحد، مما يتيح قدرة فائقة على الاستنتاج العميق ويتفوق على النهج النمطي التقليدي في مهام الحمض النووي والنصوص.

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang2026-05-12
🤖 AI

Faithful Autoformalization via Roundtrip Verification and Repair

تقترح هذه الورقة إطار عمل للتحقق من الرحلة الكاملة يضمن الترجمة الوفية من اللغة الطبيعية إلى اللغة الرسمية عبر الترجمة التكرارية العكسية إلى اللغة الطبيعية، والتحقق من التكافؤ المنطقي، وتطبيق إصلاحات محددة النطاق موجهة بالتشخيص لتصحيح الأخطاء دون الحاجة إلى تعليقات توضيحية للحقيقة الأرضية.

Daneshvar Amrollahi, Jerry Lopez, Clark Barrett2026-05-12
🤖 machine learning

Block-Wise Differentiable Sinkhorn Attention: Tail-Refinement Gradients with a Gap-Aware Dustbin Bridge

تقدم هذه الورقة آلية انتباه "سينكهورن" (Sinkhorn) قابلة للتفاضل على مستوى الكتل للنقل الأمثل المتوازن ذي السياق الطويل على أجهزة TPU، والتي تستخدم بديل صقل ذيل ثابت العمق وموقوف الأساس لتحقيق تدرجات خلفية دقيقة مع تقليل تعقيد الذاكرة، مع توفير ضمانات نظرية للتحيز والانكماش وإظهار تحسن في إعادة البناء وأداء الإنتروبيا المتقاطعة المتناثرة على مجموعات بيانات بروتين Pfam.

Dylan Forde2026-05-12
🤖 machine learning

Reasoning emerges from constrained inference manifolds in large language models

تقترح هذه الورقة أن الاستدلال في النماذج اللغوية الكبيرة هو عملية ديناميكية جوهرية تحكمها قيود هندسية ومعلوماتية، حيث لا ينبثق الأداء الفعال إلا عندما تنظم ديناميكيات الاستدلال الداخلي نفسها ذاتياً في متشعبات منخفضة الأبعاد تحافظ على حجم معلوماتي غير متحلل، مما يتيح إطاراً تشخيصياً جديداً خالياً من التسميات.

Yanbiao Ma, Fei Luo, Linfeng Zhang, Chuangxin Zhao, Mingxuan Wang, Yinan Wu, Zhe Qian, Yang Lu, Long Chen, Zhao Cao, Xia (…)2026-05-12
🤖 machine learning

Feature Rivalry in Sparse Autoencoder Representations: A Mechanistic Study of Uncertainty-Driven Feature Competition in LLMs

تقدم هذه الورقة البحثية مفهوم "التنافس الميزاتي" (feature rivalry) كأزواج من ميزات المشفر التلقائي المتناثر (Sparse Autoencoder) ذات ارتباط سلبي، والتي تعمل كبصمة ميكانيكية لعدم اليقين في نموذج Gemma-2-2B، حيث تُظهر أن المطالبات عالية الإنتروبيا تُحفز تنافساً أقوى عند طبقات محددة، وأن التوجيه عبر محاور التنافس يؤثر سببياً على المخرجات، وأن درجات التنافس يمكنها التنبؤ بصحة الإجابة.

Harshavardhan2026-05-12
🤖 AI

MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing

تقدم الورقة البحثية MULTITEXTEDIT، وهو معيار مرجعي منضبط يمتد عبر 12 لغة ومقياساً جديداً لدقة اللغة، لتوضيح أن أنظمة تحرير النصوص داخل الصور الحالية تعاني من تدهور كبير في دقة اللغات عبر اللغات، لا سيما في دقة الخطوط للغات غير اللاتينية، على الرغم من الحفاظ على البنية البصرية العالمية.

Liwei Cheng, Zirui Song, Shibo Feng, Lunjie Zhou, Yixuan Guan, Dayan Guan2026-05-12
⚛️ general relativity

LLMs with in-context learning for Algorithmic Theoretical Physics

تُثبت هذه الورقة أن نموذج لغة كبير رائد (Claude) متصل بنظام جبر حاسوبي (Maple) ومعزز بالتعلم في السياق عبر أمثلة محلولة، يمكنه تنفيذ حسابات خوارزمية معقدة في الفيزياء النظرية بشكل موثوق، وتحديداً للاضطرابات الكونية في نظريات الجاذبية المعدلة، مع تحديد القيود الحالية واستراتيجيات التحسين أيضاً.

Anamaria Hell, Leander Thiele2026-05-12
🤖 machine learning

In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification

تكشف هذه الورقة أن نماذج التعلم في السياق مقيدة ميكانيكيًا بمعاملة الرموز الموضحة كقاموس شامل، مما يؤدي إلى انهيار الدقة عندما تُملأ خانات التسمية برموز متجانسة أو حتى رموز صالحة دلاليًا، وهي ظاهرة تتركز في دوائر عصبية محددة تتجاوز الفهم الدلالي عبر استرجاع الرموز القائم على التنسيق.

Ming Liu2026-05-12
🤖 machine learning

mHC-SSM: Manifold-Constrained Hyper-Connections for State Space Language Models with Stream-Specialized Adapters

تُثبت هذه الورقة أن تطبيق الروابط الفائقة المقيدة بالمنوع (mHC) على نماذج فضاء الحالة (SSMs) يحسن بشكل كبير أداء نمذجة اللغة على مجموعة بيانات WikiText-2 من خلال تقييد خلط التدفق المتبقي بمصفوفات ثنائية العشوائية ودمج محولات متخصصة في التدفق، مما يحقق انخفاضاً في الحيرة مع زيادات طفيفة فقط في تكاليف الذاكرة والإنتاجية.

Abdulvahap Mutlu, Şengül Doğan, Türker Tuncer2026-05-12
💬 NLP

How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

تُظهر هذه الورقة أنه بينما تُعد دوائر النماذج اللغوية المُحددة متسقة للغاية وضرورية لأداء المهام، إلا أنها تفتقر إلى خصوصية المهمة بسبب التداخل الكبير بين المهام، مما يتحدى فائدة هذا الإطار للتدخل المستهدف والفهم.

Michael Li, Nishant Subramani2026-05-12