📊 statistics

Sampling from Flow Language Models via Marginal-Conditioned Bridges

تقدم هذه الورقة طريقة أخذ عينات تنبؤية لاحقة خالية من التدريب لنماذج لغة التدفق، والتي تربط الحالات المستمرة بنقاط نهاية الرموز (one-hot tokens) التي تم أخذ عينات منها عبر عمليات أورنشتاين-أولنبيك مشروطة بالهامش، مما يحافظ على الهوامش لكل رمز ويحسن المقايضة بين الجودة والتنوع مقارنة بنهج المتوسط الشرطي القياسي.

Iskander Azangulov, Leo Zhang2026-05-14
🤖 machine learning

Scale-Sensitive Shattering: Learnability and Evaluability at Optimal Scale

تؤسس هذه الورقة لتعميم حساس للمقياس للنظرية الأساسية لتعلم الـ PAC، والتي تثبت تكافؤ التقارب الموحد، والقابلية للتعلم اللاأدري، ومحدودية بُعد التهشيم السمين عند المقاييس المثلى، مما يحل أسئلة مفتوحة طويلة الأمد تتعلق بالعوامل الضربِيّة الدقيقة التي تحكم القابلية للتعلم، وحدود الإنتروبيا المترية، وقابلية تقييم مقاييس احتمالية التكامل.

Shashaank Aiyer, Yishay Mansour, Shay Moran, Han Shao, Tom Waknine2026-05-14
🤖 machine learning

DisAgg: Distributed Aggregators for Efficient Secure Aggregation in Federated Learning

تقترح الورقة البحثية بروتوكول DisAgg، وهو بروتوكول تجميع موزع يستخدم لجنة عملاء صغيرة لإجراء عملية تجميع محلية قائمة على مشاركة الأسرار، مما يؤدي إلى إلغاء العمليات التشفيرية المكلفة وتقليل عبء الاتصالات والحوسبة بشكل كبير مقارنة بطرق التجميع الآمن الحالية مثل OPA.

Haaris Mehmood, Giorgos Tatsis, Dimitrios Alexopoulos, Karthikeyan Saravanan, Jie Xu, Anastasios Drosou, Mete Ozay2026-05-14
💬 NLP

Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة المدمجة ذات الـ 8 مليارات بارامتر، عند ضبطها بدقة باستخدام بيانات تعليمية مصممة من قبل خبراء، يمكنها توليد قصص قراءة باللغة الإنجليزية للأطفال بصعوبة قابلة للتحكم ومعايير سلامة تتفوق على النماذج الكبيرة ذات القدرات الصفرية مثل GPT-4o وLlama 3.3 70B في مقاييس الصعوبة، مع بقائها فعالة من حيث التكلفة للاستخدام التعليمي واسع النطاق.

Qian Shen (University of Florida, Gainesville, USA), Fanghua Cao (University of Florida, Gainesville, USA), Min Yao (Uni (…)2026-05-14
🤖 AI

Humanwashing -- It Should Leave You Feeling Dirty

تجادل هذه الورقة بأن الاستخدام العشوائي لاستعارة "الإنسان في الحلقة" يسهل عملية "التبييض البشري" (humanwashing) عبر تعتيم حقائق اتخاذ القرار في الذكاء الاصطناعي وخلق شعور زائف بالأمان، مما يؤدي بالتالي إلى الإخفاق في معالجة قضايا جوهرية مثل التحيز والمساءلة والشفافية.

Ben Wilson, Matimba Swana, Peter Winter, Matt Roach2026-05-14
🤖 machine learning

Learning POMDP World Models from Observations with Language-Model Priors

تقدم هذه الورقة Pinductor، وهي طريقة تستفيد من الأولويات المعرفية للنماذج اللغوية لتعلم نماذج العالم لعمليات ماركوف لاتخاذ القرار ذات الملاحظة الجزئية (POMDP) بكفاءة من مسارات ملاحظة-فعل محدودة، محققة أداءً يضاهي الأساليب القائمة على الحالة المميزة مع تفوق ملحوظ على الخطوط المرجعية التقليدية في كفاءة العينات.

Valentin Six, Frederik Panse, Mathis Fajeau, Lancelot Da Costa, Mridul Sharma, Alfonso Amayuelas, Tim Z. Xiao, David Hyl (…)2026-05-14
🤖 machine learning

GHGbench: A Unified Multi-Entity, Multi-Task Benchmark for Carbon Emission Prediction

تقدم هذه الورقة البحثية GHGbench، وهو معيار مرجعي مفتوح وموحد للتنبؤ بانبعاثات الكربون على مستوى الشركات والمباني يعالج تشتت البيانات من خلال توفير مجموعات بيانات متناغمة واسعة النطاق، ويكشف أن التعميم خارج نطاق التوزيع هو التحدي الرئيسي، حيث تتفوق النماذج التأسيسية للبيانات الجدولية وتضمينات الاستشعار عن بعد متعددة الوسائط بشكل كبير على الخطوط المرجعية التقليدية.

Yifan Duan, Siyuan Zheng, Lihuan Li, Chao Xue, Flora Salim2026-05-14
🤖 machine learning

Min Generalized Sliced Gromov Wasserstein: A Scalable Path to Gromov Wasserstein

تقترح الورقة البحثية "الحد الأدنى من مسافة غرووموف-واسرشتاين المقطعة المعممة" (min-GSGW)، وهو إطار عمل قابل للتوسع وغير متغير بتغير الحركة الصلبة، يتعلم أدوات تقطيع غير خطية مقترنة لحساب خطط نقل "غرووموف-واسرشتاين" بكفاءة وتحقيق ارتباطات هندسية ذات مغزى بتكاليف حوسبة أقل بكثير من الحلول الحالية.

Ashkan Shahbazi, Xinran Liu, Ping He, Soheil Kolouri2026-05-14
🤖 machine learning

Fast and effective algorithms for fair clustering at scale

تقترح هذه الورقة إطاراً عاماً وثلاث خوارزميات استدلالية قابلة للتوسع للتجميع العادل، توازن بفعالية بين تقليل تكلفة التجميع وضمان قيود العدالة المحددة من قبل المستخدم عبر المجموعات المحمية، متفوقة بذلك على الأساليب الحالية في مجموعات البيانات واسعة النطاق.

Claudio Mantuano, Manuel Kammermann, Philipp Baumann2026-05-14
🤖 machine learning

Toward AI-Driven Digital Twins for Metropolitan Floods: A Conditional Latent Dynamics Network Surrogate of the Shallow Water Equations

تقدم هذه الورقة البحثية CLDNet، وهو نموذج بديل للنماذج التفاضلية العادية العصبية الكامنة الشرطية يحقق تسريعاً بمقدار 115 ضعفاً مقارنة بالمحللات التقليدية مع الحفاظ على دقة عالية للتنبؤ بالفيضانات على مستوى المناطق الحضرية، وذلك من خلال تمكين التدريب الموفر للذاكرة والمستقل عن الشبكة، والاستعلام المباشر القائم على الإحداثيات في الأحواض المائية غير المنتظمة.

Phillip Si, Yuan Qiu, Omar Sallam, Jeremy Feinstein, Ziang He, Eugene Yan, Peng Chen2026-05-14