🤖 AI

Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration

تُظهر هذه الورقة أن معايرة ثقة النماذج اللغوية الكبيرة حساسة للغاية لبروتوكولات القياس — وتحديداً سياق التكييف، وقراءة احتمالية الرمز (token)، واختيار الإجابة — مما يكشف أن الثقة المُعبّر عنها لفظياً غالباً ما تعكس معقولية الإجابة بدلاً من صحتها، وتحث على اعتماد قوائم مراجعة معيارية للتقارير من أجل تقييم موثوق.

Hankyeol Kim, Pilsung Kang2026-05-28
🤖 AI

SkillGrad: Optimizing Agent Skills Like Gradient Descent

يُعد SkillGrad إطار عمل مبتكر يعمل على تحسين مهارات الوكيل عبر معاملتها كمعلمات مهيكلة في عملية تشبه انحدار الاشتقاق، وذلك باستخدام أدلة الخسارة على مستوى المسار، والتدرجات التشخيصية القائمة على النصوص، ووكيل زخم، لتنقيح المهارات بشكل تكراري، مما يجعله يتفوق على النماذج المرجعية الحالية القائمة على التدريب في مهام الاختبار القياسي.

Hanyu Wang, Yifan Lan, Bochuan Cao, Lu Lin, Jinghui Chen2026-05-28
🤖 AI

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

يُعد PEAM إطار عمل مبتكر للوكلاء المتجسدين في لعبة ماينكرافت، حيث يحول الذاكرة من مجرد استرجاع وقت الاستدلال إلى مهارات مستقرة في المعلمات عبر استخدام بنية ثنائية النظام تجمع بين التفكير التأملي البطيء والتنفيذ الانعكاسي السريع، حيث تعمل الإخفاقات كإشارات تدريب حاسمة للتعلم التبايني، كما يقرر آلية ذاتية التشغيل بشكل مستقل متى يتم استيعاب الخبرات لتمكين التعلم المستمر دون نسيان كارثي.

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su2026-05-28
🤖 AI

Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought

تقدم هذه الورقة SegWorld، وهو نموذج تجزئة يستفيد من استدلال تسلسل الأفكار البصري الاستباقي لسد الفجوة بين التعليمات القائمة على النوايا عالية المستوى والتنبؤ الدقيق بالقناع من خلال استنتاج الإمكانيات ومواقع التفاعل الفيزيائي قبل تلقي أوامر محددة.

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su2026-05-28
🤖 machine learning

Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning

تقدم هذه الورقة البحثية SC-SDPO، وهو متغير جديد من تحسين سياسة التقطير الذاتي، يقوم بوزن أسئلة التدريب ديناميكيًا بجذر التباين المتوقع لمعدل النجاح لإنشاء منهج تعليمي ضمني مدرك للصعوبة، مما يحقق مكاسب أداء ثابتة في معايير الاستدلال واستخدام الأدوات مع الحفاظ على استقرار ديناميكيات التدريب.

Zehao Liu, Yuanpu Cao, Jinghui Chen, Vasant G. Honavar2026-05-28
🤖 AI

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

تقدم هذه الورقة منصة محاكاة متعددة الوكلاء تُظهر أن وكلاء النماذج اللغوية الكبيرة في البيئات الاجتماعية المستمرة هم أكثر عرضة بشكل كبير لانتهاكات الخصوصية بسبب الضغط الاجتماعي والعدوى، مما يكشف أن معايير السلامة الثابتة أحادية الدور تقلل بشكل منهجي من مخاطر تسرب المعلومات الحساسة في عمليات نشر الوكلاء في العالم الحقيقي.

Aman Priyanshu, Supriti Vijay, Esha Pahwa2026-05-28
💬 NLP

UniMaia: Steering Chess Policies with Language for Human-like Play

تقدم الورقة البحثية UniMaia، وهو إطار عمل فعال من حيث المعلمات يوجه شبكة سياسة شطرنج Lc0 مجمدة باستخدام مطالبات لغوية لتحقيق قدرة تحكم شبيهة بالبشر على أسلوب اللعب وقوته مع الحفاظ على الأداء الخاص بالمجال دون الحاجة إلى تدريب متعدد الوسائط شامل، وذلك دون الحاجة إلى تدريب متعدد الوسائط من طرف إلى طرف.

Sherman Siu (University of Waterloo), Lesley Istead (University of Waterloo)2026-05-28
🤖 AI

Auditable Decision Models with Learned Abstention and Real-Time Steering

تقدم هذه الورقة البحثية نموذج EvaluatorDPT، وهو نموذج تحكم في القرار محدود النطاق يتعلم الامتناع عن التنبؤ بدلاً من فرض التوقعات، مما يتيح قرارات ذكاء اصطناعي قابلة للتدقيق ومحكومة بالسياسات مع توجيه صريح لعدم اليقين وأداء تجريبي قوي على مجموعة اختبار كبيرة.

Sankaranarayanan Palamadai Chandrasekaran2026-05-28
💬 NLP

Do Models Know Why They Changed Their Mind? Interpretability and Faithfulness of Chain-of-Thought Under Knowledge Conflict

تكشف هذه الورقة أنه في حين أن تسلسل التفكير في النماذج اللغوية هو عرض مستقر إلى حد كبير وغير متغير بالقرار لاستعراض المعرفة، مما يؤدي إلى الفشل في تفسير خياراتها بأمانة أثناء صراعات المعرفة، فإن الثقة ذاتية التقييم تقدم إشارة ضعيفة ولكنها حقيقية للتنبؤ بالقرارات، مما يشير إلى أن مراقبة الثقة أكثر فعالية من تحليل الحجج الاستدلالية نفسها.

Pruthvinath Jeripity Venkata2026-05-28
🤖 AI

A Query Engine for the Agents

تقدم هذه الورقة Hyperparam، وهي مجموعة من مكتبات JavaScript خفيفة الوزن ومفتوحة المصدر والمصممة لتمكين الاستعلام الفعال والواعي بالنماذج للبيانات غير المهيكلة للوكلاء مباشرة داخل تطبيقات الذكاء الاصطناዊ للعميل عبر دمج تحليلات SQL مع التفسير غير المتزامن للنماذج اللغوية الكبيرة.

Kenny Daniel2026-05-28