🤖 AI

Why Conclusions Diverge from the Same Observations: Formalizing World-Model Non-Identifiability via an Inference

تُصوّر هذه الورقة ظاهرة الاستنتاجات المتباينة من ملاحظات متطابقة بوصفها قضية بنيوية تتعلق بعدم قابلية تحديد النموذج العالمي (world-model non-identifiability) الناجمة عن اختلاف ملفات الاستدلال وانحيازات التعلم، بدلاً من كونها عيباً في العقلانية أو حسن النية.

Toru Takahashi2026-05-13✓ Author reviewed ⓘ
🤖 AI

Missingness-MDPs: Bridging the Theory of Missing Data and POMDPs

تقدم هذه الورقة نماذج عمليات ماركوف لاتخاذ القرار ذات البيانات المفقودة (missingness-MDPs)، وهي فئة فرعية جديدة من عمليات ماركوف لاتخاذ القرار بملكية جزئية (POMDPs) التي تُنمذج عدم قابلية ملاحظة سمات الحالة من خلال نظرية البيانات المفقودة، وتقترح خوارزميات التعلم الاحتمالي بأداء قريب من الأمثل (PAC) لتعلم دالة الفقدان الكامنة من بيانات المسار لاستخلاص سياسات مثالية بمقدار إبسيلون (ϵ\epsilon-optimal).

Joshua Wendland, Markel Zubia, Roman Andriushchenko, Maris F. L. Galesloot, Milan Ceska, Henrik von Kleist, Thiago D. Si (…)2026-05-13
🤖 AI

How Useful Is Cross-Domain Generalization for Training LLM Monitors?

تُثبت هذه الورقة أن الضبط الدقيق للنماذج اللغوية على مهام تصنيف متعددة عبر مجالات مختلفة يحسن الأداء في المجالات غير المرئية، رغم أنها قد تعاني من تغيرات الأوامر، وهو قصور يمكن التخفيف من حدته عن طريق خلط تدريب التصنيف مع اتباع التعليمات العامة لتمكين نماذج قوية لا تتطلب تفكيراً وتعمم على مهام الاستدلال المعقدة.

Sam Martin, Fabien Roger2026-05-13
🤖 AI

Iterative Audit Convergence in LLM-Managed Multi-Agent Systems: A Case Study in Prompt Engineering Quality Assurance

تقدم هذه الورقة دراسة حالة لعملية تدقيق تكرارية مدفوعة بالوكلاء طُبقت على نظام AEGIS متعدد الوكلاء، والتي استخدمت تسع جولات متتالية من عمليات التفتيش القائمة على النماذج اللغوية الكبيرة لتحديد 51 عيباً في مواصفات الأوامر البرمجية، ووضع تصنيف جديد للعيوب، وإثبات التقارب غير الرتيب في بيئة إنتاج.

Elias Calboreanu2026-05-13
💬 NLP

TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

تقدم هذه الورقة البحثية "تحسين تفضيل بريغمان على مستوى الرمز" (TBPO)، وهي طريقة مبتكرة تشتق نموذج تفضيل "برادلي-تيري" على مستوى الرمز من مقارنات معيارية على مستوى التسلسل لتحسين جودة المحاذاة، واستقرار التدريب، وتنوع المخرجات، مع الحفاظ على بساطة "التحسين المباشر للتفضيلات" (DPO).

Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le2026-05-13
🤖 machine learning

PriorZero: Bridging Language Priors and World Models for Decision Making

يُعد PriorZero إطار عمل موحداً يسد الفجوة بين المعارف المسبقة الساكنة للنماذج اللغوية الكبيرة والنماذج العالمية الديناميكية من خلال حقن توجيه النموذج اللغوي الكبير حصرياً عند جذر بحث مونت كارلو في الأشجار من أجل استكشاف مركز، وفصل تدريب النموذج العالمي عن تكيف النموذج اللغوي الكبير لتمكين تخصيص ائتمان مستقر ودقيق، مما يعزز بشكل كبير كفاءة وأداء اتخاذ القرار في المهام طويلة الأمد.

Junyu Xiong, Yuan Pu, Jia Tang, Yazhe Niu2026-05-13
🤖 AI

Executable Agentic Memory for GUI Agent

تقدم هذه الورقة "الذاكرة الوكيلية القابلة للتنفيذ" (EAM)، وهي إطار عمل قائم على رسم بياني معرفي مهيكل يستبدل تفاعلات النماذج اللغوية الكبيرة الهشة والمتدرجة بعملية استرجاع وتنفيذ قوية باستخدام البحث في الرسم البياني الموجه بالقيم، مما يحقق أداءً فائقاً وتكاليف أقل وزمن استجابة منخفض في مهام أتمتة واجهة المستخدم الرسومية طويلة الأمد.

Zerui Qin, Sheng Yue, Xingyuan Hua, Yongjian Fu, Ju Ren2026-05-13
🤖 AI

LISA: Cognitive Arbitration for Signal-Free Autonomous Intersection Management

تقترح الورقة البحثية إطار عمل LISA، وهو إطار تحكيم معرفي خالٍ من الإشارات يستفيد من النماذج اللغوية الكبيرة للاستنتاج حول نوايا المركبات وأولوياتها لإدارة التقاطعات ذاتية القيادة، مما يظهر تحسينات كبيرة في تأخير حركة المرور، وطول الطابور، واستهلاك الوقود، وتحقيق النوايا مقارنة بالطرق التقليدية القائمة على الإشارات أو القائمة على الحجز.

Abderrahmane Lakas, Mohamed Amine Ferrag, Merouane Debbah2026-05-13
📊 statistics

Manifold Sampling via Entropy Maximization

تقدم هذه الورقة MASEM، وهي طريقة تعمل على تعظيم اعتلاج التوزيع التجريبي عبر تقدير كثافة أقرب kk من الجيران وإعادة أخذ العينات لأخذ عينات بكفاءة وقابلية توسع من متعددات الطيات ذات الأعداد غير المعروفة من المكونات المنفصلة، متفوقة بشكل كبير على البدائل الحالية في سرعة التقارب وجودة الخلط.

Cornelius V. Braun, Tilman Burghoff, Marc Toussaint2026-05-13
🤖 machine learning

BSO: Safety Alignment Is Density Ratio Matching

تقدم هذه الورقة "تحسين بريغمان للسلامة" (Bregman Safety Optimization - BSO)، وهو إطار عمل منهجي أحادي المرحلة يبسط عملية محاذاة سلامة النماذج اللغوية من خلال اختزالها في مشكلة مطابقة نسبة الكثافة، مما يلغي الحاجة إلى مسارات معقدة أو نماذج مساعدة مع تحسين المقايضة بين السلامة والمساعدة بشكل مستمر.

Tien-Phat Nguyen, Truong Nguyen, Thin Nguyen, Duy Minh Ho Nguyen, Ngoc-Thanh Dinh, Trung Le2026-05-13