Invariant Reasoning Directions in Latent Trajectories of Language Models
이 논문은 언어 모델의 잠재 궤적 내에서 안정적인 저차원 불변 방향을 식별하고 조작함으로써, 정확도를 희생하지 않으면서도 추론 일관성을 크게 향상시키고 패러프레이징 및 섭동에 대한 민감도를 줄이는 훈련이 필요 없는 프레임워크인 궤적 불변 잠재 정제(Trajectory-Invariant Latent Refinement, TILR)를 소개한다.