Reasoning-Tier Drift in RL-Aligned LLMs: Within-Family Safety Spread Across Six Gemini Tiers on a Harm-Free Insult-Reproduction Protocol
Este artículo presenta TIERBLED, un protocolo de medición libre de daños que demuestra que las políticas de seguridad alineadas con el aprendizaje por refuerzo en la familia Gemini exhiben una deriva intra-familiar significativa a través de seis niveles de razonamiento, donde las técnicas de encuadre y las estrategias multi-nivel/semilla pueden explotar estas inconsistencias para reproducir insultos leves con tasas de éxito que superan con creces las tasas de rechazo directo.