💬 NLP

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

تقدم هذه الورقة EcoGym، وهو معيار مفتوح المصدر ومبتكر يتميز بثلاث بيئات اقتصادية تفاعلية متنوعة وطويلة الأمد، صُممت لتقييم التماسك الاستراتيجي وقوة التنفيذ للوكلاء القائمين على النماذج اللغوية الكبيرة، مما يكشف أن النماذج الحالية تعاني في تحسين التخطيط رفيع المستوى وتنفيذ الإجراءات الفعالة في آن واحد عبر سيناريوهات متباينة.

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zen (…)2026-05-12
🤖 AI

Formal Policy Enforcement for Real-World Agentic Systems

تقدم هذه الورقة إطار عمل FORGE، الذي يستفيد من البرمجة الموجهة بالجوانب والتحقق الرسمي القائم على Datalog لفرض سياسات أمنية بضمانات صارمة عبر الأنظمة الوكيلة، معالجةً بذلك حدود الامتثال القائم على المطالبات باللغة الطبيعية في البيئات متعددة الوكلاء.

Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha2026-05-12
🤖 AI

Faithful Autoformalization via Roundtrip Verification and Repair

تقترح هذه الورقة إطار عمل للتحقق من الرحلة الكاملة يضمن الترجمة الوفية من اللغة الطبيعية إلى اللغة الرسمية عبر الترجمة التكرارية العكسية إلى اللغة الطبيعية، والتحقق من التكافؤ المنطقي، وتطبيق إصلاحات محددة النطاق موجهة بالتشخيص لتصحيح الأخطاء دون الحاجة إلى تعليقات توضيحية للحقيقة الأرضية.

Daneshvar Amrollahi, Jerry Lopez, Clark Barrett2026-05-12
🤖 AI

When to Trust Imagination: Adaptive Action Execution for World Action Models

تقترح هذه الورقة إطار تنفيذ تكيفي لنماذج "العمل العالمي" (World Action Models) يستخدم مُتحققًا خفيف الوزن من "انتباه السببية الديناميكية المستقبلية الأمامية" (Future Forward Dynamics Causal Attention) لضبط أحجام كتل الأفعال ديناميكيًا بناءً على الاتساق بين التنبؤ والواقع، مما يحسن بشكل كبير من كفاءة ومعدل نجاح مهام التلاعب الروبوتي.

Rui Wang, Yue Zhang, Jiehong Lin, Kuncheng Luo, Jianan Wang, Zhongrui Wang, Xiaojuan Qi2026-05-12✓ Author reviewed
⚡ electrical engineering

ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning

تقدم الورقة البحثية \textsc{ReasonSTL}، وهو إطار عمل مدعوم بالأدوات يعمل على تكييف النماذج اللغوية مفتوحة المصدر المحلية عبر التعلم القائم على مكافأة العمليات لترجمة متطلبات اللغة الطبيعية بدقة وخصوصية إلى صيغ المنطق الزمني الإشاري (STL)، مما يوفر بديلاً فعالاً من حيث التكلفة للمواصفات اليدوية وواجهات برمجة التطبيقات التجارية.

Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin2026-05-12
🤖 AI

Playing Games with My Heart: An Evaluation of AI Companion Apps

تقيم هذه الورقة أكثر خمسة تطبيقات رفيقة تعمل بالذكاء الاصطناعي شعبية في أسواق الاتحاد الأوروبي والمملكة المتحدة، كاشفةً أنها تستخدم بشكل عالمي أنماط تصميم تلاعبية، ومستويات عالية من التجسيد، وميزات إباحية أو قائمة على الألعاب لتعزيز الربحية والتفاعل، مما يستدعي تقديم توصيات تنظيمية ملموسة لحماية المستهلكين من الضرر النفسي المحتمل.

Maribeth Rauh, Dick A. H. Blankvoort, Matias Duran, Caoilfhionn Ní Dheoráin, Harshvardhan J. Pandit, Siddharth D. Jaiswa (…)2026-05-12
🤖 AI

MedThink: Enhancing Diagnostic Accuracy in Small Models via Teacher-Guided Reasoning Correction

تقدم الورقة البحثية MedThink، وهو إطار عمل للتقطير الموجه من المعلم على مرحلتين، والذي يعزز بشكل كبير دقة التشخيص وقدرات الاستنتاج للنماذج اللغوية الصغيرة في البيئات السريرية محدودة الموارد من خلال تحسين سلاسل الاستنتاج الخاصة بها بشكل تكراري عبر حقن المعرفة بالمجال وتصحيح الأخطاء.

Xinchun Su, Chunxu Luo, Lipeng Ma, Yixuan Li, Weidong Yang2026-05-12
🔬 physics

Crystal Fractional Graph Neural Network for Energy Prediction of High-Entropy Alloys

تقترح هذه الورقة شبكة عصبية رسومية بلورية كسرية تجمع بين تحليل البيئة الذرية المحلية عبر آليات انتباه الرسم البياني والبيانات التركيبية العالمية للتنبؤ بدقة بطاقة السبائك عالية الاعتلاج، محققةً دقة بمستوى المبادئ الأولية على مجموعة بيانات تضم أكثر من 1,000 بنية مع الإقرار بالقيود الحالية المتعلقة بخلايا البلورات الكبيرة.

Takanori Kotama, Yang Huang2026-05-12
🤖 machine learning

BaLoRA: Bayesian Low-Rank Adaptation of Large Scale Models

يقدم BaLoRA امتداداً بايزياً لتقنية التكيف منخفض الرتبة (LoRA) يستخدم بارامترية تكيفية مع المدخلات لتعزيز دقة التنبؤ وتوفير تقديرات معايرة جيداً لعدم اليقين في آن واحد، مما يقلص بفعالية فجوة الأداء مع الضبط الدقيق الكامل مع تمكين تقدير موثوق للأخطاء في التطبيقات الحرجة.

Dario Coscia, Sindy Löwe, Max Welling2026-05-12