📊 statistics

SHIFT: Robust Double Machine Learning for Average Dose-Response Functions under Heavy-Tailed Contamination

تقدم هذه الورقة SHIFT، وهو مُقدِّر تعلم آلي مزدوج (Double Machine Learning) متين لدوال متوسط استجابة الجرعة (Average Dose-Response Functions)، يجمع بين التعامد عبر التوفيق المتقاطع (cross-fit orthogonalization)، وتحسين عدم التحدب المتدرج (Graduated Non-Convexity optimization)، وإعادة التوفيق بطريقة المربعات الصغرى العادية الدفاعية (defensive OLS refit) المُقاسة بـبواقي ما بعد الـ GNC للتخفيف بفعالية من التلوث ثقيل الذيول، مع توفير أدوات تشخيصية لاختيار النظام (regime selection) وإثبات أن النماذج المزعجة الخطية (linear nuisance models) يمكن أن تتفوق على النماذج المرنة في ظل التلوث الموحد.

Eichi Uehara2026-05-04
🤖 machine learning

Towards A Generative Protein Evolution Machine with DPLM-Evo

تقدم الورقة البحثية DPLM-Evo، وهو إطار عمل تطوري للانتشار المنفصل يربط توليد البروتين بالبديهة البيولوجية من خلال نمذجة عمليات الاستبدال والإدراج والحذف صراحةً ضمن فضاء كامن منفصل، مما يحقق أداءً هو الأفضل في حالته في التنبؤ بالطفرات ويسمح بتصميم بروتينات مرنة ومتغيرة الطول.

Xinyou Wang, Liang Hong, Jiasheng Ye, Zaixiang Zheng, Yu Li, Shujian Huang, Quanquan Gu2026-05-04
🤖 machine learning

Fair Dataset Distillation via Cross-Group Barycenter Alignment

تتناول هذه الورقة فجوات العدالة في تقطير مجموعات البيانات الناتجة عن الأنماط التنبؤية المتباينة عبر المجموعات الديموغرافية، وذلك من خلال اقتراح طريقة تعمل على محاذاة مركز ثقل للمعلومات التنبؤية غير متأثر باختلال التوازن بين المجموعات لضمان أداء عادل عبر جميع المجموعات الفرعية.

Mohammad Hossein Moslemi, Nima Hosseini Dashtbayaz, Zhimin Mei, Boyu Wang, Bissan Ghaddar2026-05-04
🤖 machine learning

CompleteRXN: Toward Completing Open Chemical Reaction Databases

تقدم الورقة البحثية CompleteRXN، وهو معيار مرجعي خاضع للإشراف واسع النطاق لإكمال قواعد بيانات التفاعلات الكيميائية المفتوحة عن طريق ربط سجلات USPTO بتفاعلات ميكانيكية منسقة، وتقيم نماذج متنوعة — بما في ذلك نموذج Constrained Reaction Balancer (CRB) عالي الأداء — لتوضيح أنه بينما تحقق الطرق الحالية دقة قوية في التقسيمات المنضبطة، لا تزال هناك تحديات كبيرة في التعامل مع البيانات الواقعية غير المنسقة ذات النقص المتزايد.

Gabriel Vogel, Minouk Noordsij, Evgeny Pidko, Jana M. Weber2026-05-04
📊 statistics

Information-geometric adaptive sampling for graph diffusion

تقدم هذه الورقة إطار عمل للعينات التكيفية القائم على الهندسة المعلوماتية لانتشار الرسوم البيانية، والذي يستخدم مقياس فيشر-راو لاستخلاص درجة تباين الانجراف (DVS)، مما يتيح مسارات عينات مدركة للهندسة تحافظ على سرعة معلوماتية ثابتة لتحسين الدقة الهيكلية والكفاءة في توليد الرسوم البيانية بشكل كبير.

Yuhui Lu, Wenjing Liu, Kun Zhan2026-05-04
🤖 machine learning

Polaris: Coupled Orbital Polar Embeddings for Hierarchical Concept Learning

تقدم الورقة البحثية Polaris، وهو إطار عمل للتمثيل الفائق في الفضاء الكروي القطبي يعمل على فصل المعنى الدلالي عن البنية الهرمية باستخدام الهندسة الزاوية ونصف القطر لتحقيق أداء رائد في توسيع التصنيفات عبر إعدادات متنوعة.

Sahil Mishra, Srinitish Srinivasan, Sourish Dasgupta, Tanmoy Chakraborty2026-05-04
🤖 machine learning

Jailbroken Frontier Models Retain Their Capabilities

تثبت هذه الورقة أنه خلافاً لافتراض وجود "ضريبة كسر الحماية"، فإن النماذج المتطورة الرائدة تحتفظ بقدراتها حتى عند تعرضها لعمليات كسر حماية معقدة، حيث يتناسب تدهور الأداء عكسياً مع قدرة النموذج، ويكون ضئيلاً بالنسبة للنماذج من الفئة الأولى مثل Opus 4.6.

Daniel Zhu, Zihan Wang, Jenny Bao, Jerry Wei2026-05-04
💬 NLP

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

تكشف هذه الورقة أن طرق كشف البيانات خارج التوزيع (OOD) ذات الصندوق الأبيض الحالية للنماذج اللغوية تعاني من خلط بنيوي بسبب طول التسلسل، وتقترح إطار عمل ثنائي المسار يميز بين الإشارات القائمة على التضمين لتحولات المفردات وبين سمات مسار الحالة الخفية للكشف عن مدخلات النوايا المستترة مثل عمليات الاختراق (jailbreaks).

Hamidreza Saghir2026-05-04
💻 computer science

A Comparative Analysis of Machine Learning Models for Intrusion Detection in Intelligent Transport Systems

تقترح هذه المساهمة إطار عمل هجين لاكتشاف التسلل يعتمد على التعلم الاتحادي والمدرك للثقة، يجمع بين نماذج الغابة العشوائية، وشجرة القرار، وآلات المتجهات الداعمة الخطية عند عقد الحافة مع التجميع من جانب الخادم لتعزيز الأمن وتقليل زمن الاستجابة في أنظمة النقل الذكية.

Zawad Yalmie Sazid, Robert Abbas, Sasa Maric2026-05-04
🤖 machine learning

Caracal: Causal Architecture via Spectral Mixing

تُعد Caracal بنية مبتكرة، محمولة، وقابلة للتوسع تستبدل آلية الانتباه بوحدة فورييه متعددة الرؤوس ذات كفاءة في المعلمات وتقنية قناع سببي في مجال التردد لتحقيق نمذجة تسلسلات طويلة بتعقيد O(LlogL)\mathcal{O}(L \log L) دون الاعتماد على تطبيقات خاصة بالأجهزة.

Bingzheng Gan, Tianyi Zhang, Yusu Li, Jing Huang, Wei Shi, Yangkai Ding, Tao Yu2026-05-04