Invariant Reasoning Directions in Latent Trajectories of Language Models
Ce document introduit le Trajectory-Invariant Latent Refinement (TILR), un cadre de travail sans entraînement qui identifie et manipule des directions invariantes stables de faible rang au sein des trajectoires latentes des modèles de langage afin d'améliorer significativement la cohérence du raisonnement et de réduire la sensibilité aux paraphrases et aux perturbations sans sacrifier la précision.