← 최신 논문
💬 NLP

Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion

이 논문은 어휘적 섭동(lexical perturbations)이 토큰화를 파편화하고 트랜스포머 층의 어텐션을 분산시킴으로써 LLM의 추론 능력을 심각하게 저하시키며, 이러한 결합된 효과는 추론 시점의 복구 전략이 오염된 콘텐츠와 어텐션 할당을 동시에 복구하지 못하기 때문에 효과를 거두지 못한다는 것을 입증한다.

원저자: Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 복잡한 지시를 읽고, 수학 문제를 풀며, 놀라울 정도로 인간적인 대화를 나눌 수 있는 차세대 인공지능의 엔진입니다. 이 시스템들은 텍스트를 '토큰'이라고 불리는 작은 조각들로 나누어 작동하며, 이 토큰들은 모델이 의미를 이해하기 위한 블록 역할을 합니다. 인간이 오타가 있는 문장을 읽을 때, 뇌는 자연스럽게 오류를 건너뛰고 의도된 메시지를 파악합니다. 수년간 연구자들은 이 강력한 컴퓨터 모델들이 이러한 동일한 회복력을 공유한다고 가정하며, 사소한 철자 실수나 어색한 문구 표현이 추론 능력에 큰 지장을 주지 않을 것이라고 믿었습니다. 현실적이고 일상적인 오류에 직면했을 때 이 시스템들이 실제로 얼마나 취약한지에 대한 질문은 오랫동안 해결되지 않은 채 남아 있었으며, 이는 깨끗한 데이터에서의 인상적인 성능과 무질서한 현실 세계에서의 신뢰성 사이에 간극을 남겨두었습니다.

최근 한 연구는 네 가지 서로 다른 거대 언어 모델이 세 가지 특정 유형의 텍스트 손상을 어떻게 처리하는지 테스트함으로써 이 간극을 메우고자 했습니다. 연구진은 물리 과학에 관한 질문에 답하거나 다단계 수학 문제를 푸는 것과 같은 표준 추론 과업을 가져와 여기에 현실적인 오류를 도입했습니다. 그들은 의도한 키 옆의 키를 누르는 빠른 타이핑 실수, 단어 내 인접한 글자 바꾸기, 그리고 문장을 길게 만드는 "음"이나 "있잖아"와 같은 대화형 채움말을 시뮬레이션했습니다. 목표는 텍스트가 약간 망가진 것처럼 보일 때도 모델이 정답을 찾을 수 있는지 확인하고, 왜 실패하는지를 정확히 이해하는 것이었습니다.

결과는 모델이 어떻게 반응하는지에 대해 극명하고 놀라운 차이를 드러냈습니다. 연구진이 대화형 채움말을 추가했을 때, 문장이 길어졌음에도 불구하고 모델은 깨끗한 텍스트에서와 거의 동일하게 수행되었습니다. 그러나 타이핑 실수나 글자 바꾸기와 같은 문자 수준의 오류를 도입했을 때, 모델의 정확도는 급격히 떨어졌습니다. 이러한 하락은 단 하나의 오타가 모델을 완전히 길을 잃게 만들 수 있는 다단계 수학적 추론이 필요한 과업에서 가장 심각하게 나타났습니다. 연구는 이 실패가 텍스트의 추가적인 길이 때문이 아니라, 컴퓨터가 단어를 나누는 특정한 방식 때문임을 보여주었습니다. 단어가 철자가 틀리면, 컴퓨터의 내부 사전은 이를 하나의 단위로 인식하지 못합니다. 대신, 이를 낯설고 생소한 파편들로 분해해 버립니다.

연구진은 이 실패의 원인을 그들이 '주의력 분산(attention diversion)'이라고 부르는 현상으로 추적했습니다. 정상적으로 작동하는 모델에서 시스템은 수학 문제의 숫자나 이야기의 핵심 사실과 같이 문장에서 가장 중요한 부분에 계산 에너지를 집중합니다. 하지만 단어가 이상한 파편들로 분해되면, 이 파편들은 자석처럼 작용하여 모델의 초점을 중요한 증거로부터 벗어나 텍렉스트의 깨진 부분들로 끌어당깁니다. 모델은 해결책 대신 오타를 쳐다보게 되는 것입니다. 이러한 주의 산만은 모델이 정보를 결합하여 답을 형성하려고 시도하는 중간 및 최종 처리 단계에서 가장 치명적입니다. 연구는 문장의 길이가 아니라 단어의 파편화가 이러한 집중력 상실을 유발한다는 것을 확인했습니다.

이 문제가 왜 고치기 어려운지 이해하기 위해, 연구진은 문제를 격리하여 복구하려는 일련의 실험을 수행했습니다. 그들은 텍록에 오타는 그대로 둔 채 모델의 초점을 올바른 부분으로 되돌리려 시도했고, 모델의 초점은 혼란스러운 상태로 둔 채 오타를 수정하려고 시도했습니다. 두 접근 방식 모두 단독으로는 잘 작동하지 않았습니다. 실제로 텍스트가 깨진 상태에서 초점만을 수정하는 것은 모델이 오히려 잘못된 정보에 열중하게 만들어 성능을 더 악화시켰습니다. 연구는 텍스트의 손상과 모델의 주의 산만이 깊게 연결되어 있음을 발견했습니다. 즉, 둘은 분리될 수 없습니다. 모델은 입력을 이해하기 위해 단어의 특정한 형태에 의존하며, 그 형태가 깨지면 모델의 주의력도 함께 끌려갑니다.

이러한 결합 관계는 모델에게 단계별로 생각하도록 요청하거나 주요 과업 전에 철자 검사기를 사용하는 것과 같은 일반적인 성능 향상 전략들이 왜 손실된 정확도를 회복하는 데 자주 실패하는지를 설명합니다. 이러한 방법들은 대개 텍스트나 초점 중 한쪽만을 수정하려 하며, 다른 한쪽은 여전히 깨진 상태로 둡니다. 연구진은 또한 실패의 심각성이 어떤 종류의 정보가 손상되었는지에 따라 달라진다는 것을 발견했습니다. 만약 수학 문제의 숫자에서 오타가 발생하면, 주변 맥락으로부터 그 숫자를 추측할 수 없기 때문에 모델은 거의 확실히 실패합니다. 반면 흔한 단어에서 오타가 발생하면 모델은 여전히 회복할 수도 있습니다. 이는 가장 결정적인 오류가 고유하고 대체 불가능한 정보를 파괴하는 오류라는 점을 시사합니다.

궁극적으로, 이 연구는 이러한 모델의 취약성이 텍스트를 처리하는 아주 초기 단계의 표현 방식에 달려 있다고 결론짓습니다. 일단 단어가 낯선 파편들로 분해되면, 원래의 올바른 텍스트에 접근하지 않고서는 그 손상은 사실상 되돌릴 수 없습니다. 연구진은 강력한 복구 모델조차 오류를 안정적으로 수정할 수 없다는 것을 발견했는데, 이는 손상된 텍스트가 원래 단어가 무엇이었는지에 대한 단서를 포함하지 않는 경우가 많기 때문입니다. 이는 진정으로 견고한 인공지능을 구축하려면, 사후에 수정하는 것이 아니라 모델에 입력되기 전의 텍스트를 보호해야 함을 의미합니다. 이 결과는 미래의 개선 작업이 완벽한 철자에 의존하여 기능하는 것이 아니라, 표면적인 형태가 약간 손상되더라도 의미를 인식할 수 있도록 텍스트에 대한 시스템의 초기 이해를 더 유연하게 만드는 데 집중해야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →