🤖 machine learning

Label-Free Reinforcement Learning via Cross-Model Entropy

تقترح هذه الورقة البحثية "الاعتلاج عبر النماذج" (Cross-Model Entropy - CME)، وهو إشارة مكافأة للتعلم التعزيزي خالية من الملصقات، تستفيد من لوغاريتم احتمالية حدوث مخرجات النموذج المولد تحت نموذج تحقق مستقل لتمكين التدريب اللاحق الفعال لاتباع التعليمات مفتوحة النطاق دون الاعتماد على ملصقات الحقيقة الأرضية أو التفضيلات البشرية.

Matt Gorbett, Hossein Shirazi2026-05-29
🔭 astrophysics

Three-dimensional Conditional Diffusion Models for Cosmological 21 cm Lightcone Emulation

تتقصى هذه الورقة تطبيق نماذج الانتشار الشرطية لمحاكاة المخاريط الضوئية لخط الـ 21 سم الكوني ثلاثي الأبعاد، مظهرةً أنه في حين يتيح المعالجة المسبقة بطريقة "يو-جونسون" مقترنة بضغط السعة المتوسط استقرار التدريب ودقة قوية للإشارة العالمية، إلا أن النماذج الناتجة لا تزال تظهر انحيازات ملموسة في الإحصاءات من الرتب العليا، مما يؤسس خط أساس حاسم على مستوى المحاكاة لدراسات المحاكاة ثلاثية الأبعاد المستقبلية.

Bin Xia, John H. Wise2026-05-29
🤖 AI

Differentiable Belief-based Opponent Shaping

تقترح هذه الورقة طريقة "تشكيل الخصم القائم على الاعتقاد القابل للتفاضل" (D-BOS)، وهي طريقة من الدرجة الأولى تعمل على تحسين استراتيجيات متعددة الوكلاء من خلال التفاضل عبر ديناميكيات اعتقاد "softmax-Bayes" لعدد kk من الخطوات لتشكيل معتقدات الخصوم بشكل طبيعي دون الاعتماد على أهداف خداع محددة مسبقًا، مما يحقق أداءً متفوقًا في الألعاب ذات الأدوار المخفية والدوافع المختلطة مقارنة بالنماذج المرجعية الحالية.

Aarav G Sane, Karthik Sivachandran, Rohan Paleja2026-05-29
🤖 AI

Robust and Efficient Guardrails with Latent Reasoning

تقدم الورقة البحثية COLAGUARD، وهو نموذج حماية ينقل الاستدلال متعدد الخطوات للأمان إلى فضاء كامن مستمر لتحقيق أداء أمان رائد مع تقليل زمن الاستجابة واستهلاك الرموز (tokens) بشكل كبير مقارنة بنماذج الاستدلال الصريح المرجعية.

Siddharth Sai, Xiaofei Wen, Muhao Chen2026-05-29
🤖 machine learning

Ensemble Score Filtering for Real-Data Energy Consumption Forecast Correction

تقترح هذه الورقة استخدام مرشح درجة التجميع (EnSF) لتصحيح التنبؤات الصادرة عن نموذج مكاني زماني معقد ومُدرب مسبقاً لبيانات استهلاك الطاقة في العالم الحقيقي، مما يثبت أن مرشح (EnSF) يتعامل بفعالية مع الملاحظات الجزئية والمشوشة ويتفوق على مرشح كالمان التجميعي في الحالات غير الخطية.

Ruoyu Hu, Dahai Yu, Feng Bao, Guang Wang, Guannan Zhang2026-05-29
🤖 AI

Bridging the Sim-to-Real Gap in Reinforcement Learning-Based Industrial Dispatching through Execution Semantics

تقترح هذه الورقة طبقة تنفيذ وقياس محايدة للسياسات تسد الفجوة بين المحاكاة والواقع في جدولة التعلم المعزز الصناعي من خلال إنشاء لقطات قرار صالحة، وتحديد مقبولية الإجراء بشكل صريح، وإرجاع تباينات التنفيذ هيكلياً لتحويل عدم اليقين إلى بيانات إشرافية قابلة للتنفيذ من أجل تحسين السياسة.

Jonathan Hoss, Noah Klarmann2026-05-29
🤖 machine learning

OISD: On-Policy Internal Self-Distillation of Language Models

تقدم الورقة البحثية OISD، وهو إطار عمل جديد للتقطير الذاتي الداخلي القائم على السياسة (on-policy) يعزز استدلال النماذج اللغوية من خلال محاذاة التمثيلات الوسيطة مع الإشارات التنبؤية للطبقة النهائية عبر محاذاة الـ logit والـ attention أثناء تحسين GRPO، محققاً تحسينات كبيرة مقارنة بالنماذج المرجعية لتعلم التعزيز (RL) الحالية في مهام الاستدلال الرياضي دون الحاجة إلى معلومات خارجية مميزة.

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He2026-05-29
🤖 machine learning

Model Merging by Output-Space Projection

تقترح هذه الورقة إطار عمل جديد لدمج النماذج يصيغ عملية الجمع بين نقاط التفتيش المضبوطة بدقة كبرنامج تربيعي محدب على التحديثات المتبقية، مما يوفر أداة تشخيصية ذات صيغة مغلقة ومؤسسة نظرياً للتنبؤ بجودة الدمج، مع تفوقه تجريبياً على الأساليب الاستدلالية الحالية عبر معايير اللغات والرؤية الحاسوبية.

Bethan Evans, Benjamin Etheridge, Stephen Roberts, Jared Tanner2026-05-29
🤖 machine learning

Bridging Chemists and AI: An Expert-Augmented Framework for Interpretable Route Evaluation

تقدم هذه الورقة إطار عمل مدفوعاً بالبيانات ومعززاً بالخبراء، يدمج تعلم الآلة مع المعرفة المتخصصة للكيميائيين لتقييم وتفسير مسارات التخليق متعددة الخطوات، محققاً دقة وقابلية تفسير أعلى بكثير من النماذج المرجعية السابقة.

Yujia Guo, Mikhail Kabeshov, Tat Hong Duong Le, Samuel Genheden, Marco V. Mijangos, Varvara Voinarvoska, Giulia Bergonzi (…)2026-05-29
💻 computer science

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

تقدم هذه الورقة أول دراسة منهجية بنظام "الصندوق الأسود" تثبت أن نماذج الرؤية واللغة والعمل (Vision-Language-Action) القائمة على الاستنتاج والمستخدمة في القيادة الذاتية معرضة بشدة للاضطرابات النصية الواقعية، والتي تؤدي بشكل كبير إلى تدهور قدرات الاستنتاج وسلامة القيادة، مما يسلط الضوء على الحاجة الملحة لأطر تقييم قوية ودفاعات محسنة.

Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr2026-05-29