Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use
تقدم الورقة البحثية MOSAIC، وهو إطار عمل لما بعد التدريب يعزز سلامة النماذج اللغوية الوكيلية في استخدام الأدوات متعدد الخطوات من خلال هيكلة الاستدلال في حلقات صريحة من (التخطيط-التحقق-التنفيذ/الرفض) والتدريب عبر التعلم المعزز القائم على التفضيلات، محققاً انخفاضات كبيرة في السلوك الضار وتسريب الخصوصية مع الحفاظ على أداء المهام عبر نماذج وسيناريوهات متنوعة.