🤖 machine learning

LUCoS: Latent Unsupervised Context Selection for Tabular Foundation Models

تقترح الورقة البحثية LUCoS، وهي طريقة غير خاضعة للإشراف لاختيار العينات المصنفة في التعلم الجدولي منخفض التسمية عبر الاستفضاء بالهندسة الكامنة للتمثيلات غير الخاضعة للإشراف بدلاً من فضاءات الميزات الخام غير الموثوقة، وهو ما يحقق أداءً هو الأفضل حالياً عبر 67 مجموعة بيانات من خلال ضمان فعالية التغطية وجودة التمثيل.

Oroel Ipas, Guillermo Gomez-Trenado, Rocío Romero-Zaliz, Isaac Triguero2026-05-27
🤖 machine learning

Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning

تقدم هذه الورقة محولات امتداد كان (KETs) كإطار عمل فئوي يوحد آليات الانتباه، والانتشار، والاشتراط الذاتي، مظهرةً أنه بينما تتفوق محولات KETs التربيعية في الإعدادات السببية الصارمة، فإن أهم مكاسب الأداء عبر مجموعات بيانات متعددة تأتي من اعتماد نظام اشتراط ذاتي قائم على التنبؤ والفصل.

Sridhar Mahadevan2026-05-27
📊 statistics

Causal Risk Minimization for High-Dimensional Treatments

تقترح هذه الورقة إطاراً للحد من المخاطر السببية يعالج فضاءات العلاج عالية الأبعاد من خلال تفكيك الخطأ السببي إلى حدود موازنة العزوم وإسقاط آثار العلاج على سمات منخفضة الأبعاد، مما يتيح تقديراً سببياً فعالاً وتنافسياً عبر التدخلات المستمرة والمنفصلة والقائمة على النصوص دون الحاجة إلى تدريب خاص بكل سمة.

Nikita Dhawan, Arnav Paruthi, Andrew Kim, Lovedeep Gondara, Jekaterina Novikova, Chris J. Maddison2026-05-27
🤖 machine learning

Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling

يُعد Falcon-X نموذجاً تأسيسياً جديداً للسلاسل الزمنية يعالج أوجه القصور في النهج أحادي المتغير والنهج المعتمد على الفضاء الخام من خلال فك ارتباط المتغيرات إلى فضاء نماذج أولية كامن موحد، واستخدام آلية "الاهتمام التفاضلي" (Diff-Attention) لمحاذاة الكميات غير المتجانسة والتقاط التفاعلات المعقدة، وتوظيف "موجه إعادة تجميع المتغيرات" (Variate Reassembly Router) لتحقيق أداء فائق في التنبؤ متعدد المتغيرات.

Yiding Liu, Yifan Hu, Hongjie Xia, Peiyuan Liu, Hongzhou Chen, Xilin Dai, Zewei Dong, Jiang-Ming Yang2026-05-27
💬 NLP

It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty

تقدم هذه الورقة إطار عمل MUSE، الذي يوضح أن امتثال النماذج اللغوية الكبيرة (LLMs) لاعتراض المستخدم لا ينبع من التملق فحسب، بل أيضاً من عدم اليقين المعرفي، حيث يزداد كلا العاملين بناءً على الخبرة المتصورة للمستخدم ومدى معقولية مقترحاته.

Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin2026-05-27
📊 statistics

Detectability in Diversity: Improved Canary Crafting for Privacy Auditing in One Run

تقترح هذه الورقة طريقة مبتكرة لصياغة الكناري (canary crafting) لتدقيق الخصوصية في تمريرة واحدة، تجمع بين التهيئة الجشعة والتحسين ثنائي المستوى لتعظيم قابلية اكتشاف الكناري مع تقليل التداخل إلى أدنى حد، مما يحقق تقديرات أقوى لتسرب الخصوصية بتكاليف حوسبة أقل مقارنة بالأساليب الحالية.

Mathieu Dagréou, Aurélien Bellet2026-05-27
🤖 machine learning

Probabilistic Smoothing with Ratio-Monotone Transforms for Global Optimization

تقترح هذه الورقة إطاراً قوياً للتحسين العالمي يجمع بين النوى المتماثلة المرنة وتحويلات النسب الرتيبة للحفاظ على القيم العظمى العالمية وتركيز النقاط الثابتة دون الحاجة إلى جدول زمني لخفض التنعيم، مع توفير حدود التعقيد النظرية وإثبات الأداء المحسن في الاختبارات المعيارية عالية الأبعاد والهجمات العدائية.

Kukyoung Jang, Taehyun Cho, Junrui Zhang, Ping Xu, Kyungjae Lee2026-05-27
🤖 machine learning

Towards Controllable Image Generation through Representation-Conditioned Diffusion Models

تقترح هذه الورقة إطار عمل لتوليد الصور القابل للتحكم يستفيد من التمثيلات المستمدة من نماذج التعلم الذاتي مسبقة التدريب لتهيئة عمليات الانتشار، مما يعزز جودة التوليد غير المشروط مع تمكين التحكم السلس والمتمايز في التباينات الناتجة دون الحاجة إلى مجموعات بيانات موسومة واسعة النطاق.

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen2026-05-27
📊 statistics

From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models

تقدم هذه الورقة طريقة "جيبس-المسرعة للانتشار المنفصل" (GADD)، وهي طريقة تصحيح مبتكرة تستفيد من دوال الدرجة الملموسة لتحقيق تعقيد أخذ عينات بمعدل O(polylog(ε1))\mathcal{O}(\mathrm{polylog} (\varepsilon^{-1})) وتحسين الكفاءة لنماذج الانتشار المنفصل ذات المعدل الموحد دون الحاجة إلى تدريب إضافي.

Yuchen Liang, Ness Shroff, Yingbin Liang2026-05-27
💬 NLP

Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders

تقدم هذه الورقة SAERL، وهو إطار عمل لهندسة البيانات يستفيد من المشفّرات التلقائية المتناثرة (Sparse Autoencoders) لاستخراج إشارات النموذج الجوهرية المتعلقة بتنوع البيانات وصعوبتها وجودتها، مما يؤدي إلى تحسين التعلم التعزيزي لما بعد التدريب للنماذج اللغوية الكبيرة (LLM) بدقة وكفاءة أفضل.

Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang2026-05-27