Reasoning-Tier Drift in RL-Aligned LLMs: Within-Family Safety Spread Across Six Gemini Tiers on a Harm-Free Insult-Reproduction Protocol
本文介绍了 TIERBLEED,这是一种无害的测量协议,旨在证明 Gemini 系列中经过 RL 对齐的安全策略在六个推理层级上表现出显著的家族内漂移,其中框架技术和多层级/种子策略可以利用这些不一致性,以远超直接拒绝率的成功率复现轻微侮辱。