Byzantine-Robust Decentralized GRPO: Defending Against Domain Poisoning and Reasoning-Inflation Attacks
Dieses Paper stellt Dec-GRPO vor, ein Byzantine-robustes dezentrales Group Relative Policy Optimization-Framework, das durch die Integration von Reference-Logit-Filterung, reputationsgewichteter Selektion, Multi-Krum-Aggregation und adaptiven, längengestraften Vorteilen gegen Domain-Poisoning- und Reasoning-Inflation-Angriffe verteidigt.