🤖 AI

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

تقدم الورقة البحثية UI-Mate، وهو وكيل واجهة مستخدم رسومية (GUI) ذو أوزان مفتوحة يستفيد من حزمة تدريب قابلة للتوسع ومرتبطة بالبيئة، ومن تعلم العروض التوضيحية في السياق، لتحقيق أداء رائد في مهام استخدام الكمبيوتر طويلة المدى، مما يحسن بشكل كبير من الموثوقية ومعدلات النجاح مقارنة بنموذجه الأساسي.

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Le (…)2026-08-18
🤖 machine learning

Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation

تقترح هذه الورقة طريقة مبتكرة لتدريب أنظمة التوصية الحوارية تعمل على ضبط النماذج اللغوية الكبيرة لطرح الأسئلة بشكل استراتيجي باستخدام تقليل الإنتروبيا كإشارة مكافأة، مما يؤدي إلى تحسين دقة التوصية وكفاءة التفاعل دون الاعتماد على بيانات الحقيقة الأرضية غير المتوفرة.

Cedar Site Bai, Duanshun Li, Zhenyu Liao, Sheikh Sarwar, Huiyuan Chen, Yuan Chen, Changhe Yuan, Haiyang Zhang, Qilin Qi2026-08-18
🤖 AI

Solvable Sokoban Without a Solver via Diffusion

تُثبت هذه الورقة أن نموذج الانتشار المنفصل القائم على المحولات، والذي تم تدريبه حصرياً على هدف إكمال البلاطات المحلية دون أي وصول إلى حلال أو تسميات قابلية الحل، يمكنه توليد ألغاز سوكوبان قابلة للحل بفعالية من خلال استغلال قدرته على التكيّف مع مجموعات فرعية عشوائية من اللوحة، مما يسمح بالتقاط التفاعلات غير المحلية الضرورية لتعقيد لعبة سوكوبان الذي ينتمي لفئة PSPACE-complete.

Sina Baghal2026-08-18
🤖 AI

ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction

تقدم الورقة البحثية ALPS، وهو معيار مرجعي جديد يقيس بصرامة الإبداع الصالح في النماذج اللغوية الكبيرة من خلال تكليفها بتوليد براهين أو إنشاءات رياضية أصيلة وقابلة للتحقق لقوانين معادلات مُنشأة عشوائياً، مما يكشف أن النماذج الحالية تعاني بشكل كبير في جانب الإنشاء وأن معظم الحالات تظل دون حل حتى من قبل المبرهنات الآلية المتقدمة.

Eric Xie, Wenqian Ye, Aidong Zhang2026-08-18
🤖 AI

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

تقدم هذه الورقة البحثية RUPA، وهو إطار عمل لتقدير عدم اليقين على مستوى المسار، يقوم بنمذجة سجلات التنفيذ كرسوم بيانية موجهة لنشر عدم اليقين عبر التبعيات العلاقاتية، مما يتفوق بذلك على الأساليب الحالية في اكتشاف تراكم الأخطاء بعيد المدى وتحسين موثوقية وكلاء النماذج اللغوية الكبيرة (LLM) في البيئات التفاعلية المعقدة.

Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun2026-08-18
🤖 AI

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

تُثبت هذه الورقة أنه عندما يعمل مُحقِّق النموذج اللغوي ضمن سياق يحتوي على حلقة مراجعة وإصلاح سابقة، فإن عتبة اتخاذ القرار لديه تنزاح بشكل ملحوظ نحو التساهل، مما يقلل من الإنذارات الكاذبة بنسبة تتراوح بين 9 و25% دون المساس بقدرته على التمييز بين المخرجات الصحيحة والخاطئة.

Parsa Mazaheri, Kasra Mazaheri2026-08-18
🤖 machine learning

NICE: Scale-Stable Perturbations for Graph Neural Network Explanations via Noise Corruption

تقدم هذه الورقة NICE، وهو إطار تفسيري مبتكر للشبكات العصبية الرسومية يستبدل عملية "القناع العنصري" (Element-wise Masking) المسببة لإزاحة التوزيع بـ "فساد الضجيج" (Noise Corruption) المستقر قياسياً للقضاء على "انزياح المقياس" (Scale Drift) وتوليد نسب حواف أكثر دقة عبر "حد استعادة عشوائي" (Stochastic Restoration Boundary).

Ziluowen Luo, Jun Yin, Ruochen Liu, Ming Cheng, Shirui Pan, Chengqi Zhang, Senzhang Wang2026-08-18
🤖 AI

Governance at the Boundary: How Agent Decomposition Degrades Policy Compliance

تقدم هذه الورقة "Fiducia-bench" لتثبت أن تفكيك وكلاء الذكاء الاصطناعي إلى مكونات متعددة يؤدي بشكل كبير إلى تدهور الامتثال للسياسات من خلال إضعاف الحقائق الجوهرية عند حدود تسليم المهام، مما يؤدي إلى مخاطر كل من نقص التصعيد والإفراط فيه والتي تتباين باختلاف قدرة النموذج وبنيته.

Bowen Li, Guojun Wang2026-08-18
🤖 AI

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

تقدم هذه الورقة البحثية طريقة CAPO، وهي طريقة لتحسين الأوامر البرمجية (prompt optimization) تراعي القيود وتستخدم نهجاً ثنائياً أولياً (primal-dual approach) مع أوزان قيود تكيفية لتحسين الأوامر البرمجية لأنظمة وكلاء النماذج اللغوية الكبيرة (LLM agent systems) بفعالية من أجل أداء المهام مع الالتزام بالقيود التشغيلية مثل السلامة والتنسيق، إلى جانب نسخة ديناميكية (DCAPO) تقوم بتدريب مُعيد صياغة متخصص لتحقيق أوامر برمجية قابلة للتنفيذ وعالية الأداء عبر مجالات متنوعة دون تعديل وكيل المهمة الأساسي.

Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao2026-08-18
🤖 machine learning

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

تقدم هذه الورقة البحثية طريقة "إعادة وزن الميزة الواعية بالتشبع لتحسين السياسات متعددة المكافآت" (SA-MRPO)، وهي طريقة مبتكرة تعمل على توحيد معايير أهداف مكافآت متعددة بشكل مستقل وإعادة وزنها تكيفياً بناءً على مستويات تشبعها لنقل تركيز التحسين ديناميكياً نحو الأهداف غير المحسنة كفاية، مما يؤدي إلى تحسين الأداء بشكل كبير في الاختبارات المعيارية الصعبة مع الحفاظ على الكفاءة في المهام التي تم حلها بالفعل.

Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun Fu, Nuno Vasconcelos, Yijiang Li2026-08-18