Reasoning-Tier Drift in RL-Aligned LLMs: Within-Family Safety Spread Across Six Gemini Tiers on a Harm-Free Insult-Reproduction Protocol
Dieses Paper führt TIERBLED ein, ein harmloses Messprotokoll, das zeigt, dass RL-angepasste Sicherheitsrichtlinien innerhalb der Gemini-Familie eine signifikante Intra-Familien-Drift über sechs Reasoning-Tiers hinweg aufweisen, wobei Framing-Techniken sowie Multi-Tier-/Seed-Strategien diese Inkonsistenzen ausnutzen können, um milde Beleidigungen mit Erfolgsraten zu reproduzieren, die weit über den direkten Verweigerungsraten liegen.