Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation
본 논문은 의미는 동일하지만 어휘와 구문만 변형된 입력에 대해 23 개의 최신 LLM 을 평가한 결과, 어휘적 변화가 성능과 순위 불안정성을 크게 초래하며 모델 크기와 무관하게 표면적 어휘 패턴에 의존하는 경향이 있음을 밝혀 LLM 평가에 강건성 테스트의 필요성을 강조합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"똑같은 뜻인데, 말만 조금 바꾸면 AI 의 성적이 왜 이렇게 달라질까?"**라는 아주 흥미로운 질문에서 시작합니다.
마치 시험지를 생각해보세요. 같은 문제를 풀고 있는데, 문제의 단어만 살짝 바꾸거나 문장 순서를 바꿨을 때, 똑똑한 AI 가 엉뚱한 답을 하거나 점수가 뚝 떨어지는 현상을 연구한 것입니다.
이 복잡한 연구를 일상적인 언어와 비유로 쉽게 설명해 드릴게요.
🍎 핵심 비유: "사과"를 어떻게 부르느냐에 따라 달라지는 AI
이 연구는 23 개의 최신 AI 모델 (LLM) 을 대상으로 실험했습니다. 연구자들은 AI 에게 똑같은 내용을 묻되, 두 가지 방식으로 질문을 살짝 변형해 보았습니다.
- 단어 바꾸기 (Lexical Perturbation): "사과"라는 단어를 "붉은 과일"로 바꾸거나, "먹다"를 "섭취하다"로 바꾸는 것. (뜻은 똑같음)
- 문장 구조 바꾸기 (Syntactic Perturbation): "내가 사과를 먹었다"를 "사과가 내가 먹은 것이다"로 바꾸는 것. (문법 구조만 바뀜)
그 결과는 놀라웠습니다.
1. 단어 하나만 바꿔도 AI 는 당황합니다 (단어 민감성)
AI 는 문장의 구조 (문법) 보다는 단어 그 자체에 훨씬 더 의존하고 있었습니다.
- 비유: AI 는 마치 외계인처럼 생겼습니다. "사과"라는 단어를 보면 "이건 맛있는 과일이야"라고 기억해 두는데, 갑자기 "붉은 과일"이라고 하면 "아, 이건 다른 물건인가?"라고 혼란을 겪는 것입니다.
- 결과: 단어를 바꾸는 실험에서는 거의 모든 AI 의 점수가 크게 떨어졌습니다. 마치 시험지 지시어가 "선택지 A"에서 "선택지 1"로 바뀌는 것만으로도 학생이 당황하는 것과 비슷합니다.
2. 문장 순서를 바꿔도 AI 는 잘합니다 (문법 둔감성)
반면, 문장의 순서를 바꾸거나 수동태로 바꾸는 실험에서는 점수 변화가 크지 않았습니다.
- 비유: AI 는 문장 구조가 바뀌어도 "아, 이건 여전히 '내가 사과를 먹었다'는 뜻이구나"라고 파악할 줄 압니다. 하지만 단어 자체가 바뀌면 그 연결고리가 끊어지는 것입니다.
- 결론: AI 는 진짜 언어 능력 (문맥 이해) 보다는 표면적인 단어 패턴 (암기) 에 더 의존하고 있다는 뜻입니다.
🏆 리더보드 (순위표) 는 모래성이다
지금까지 AI 의 실력을 비교할 때 사용하는 '순위표 (Leaderboard)'가 얼마나 부서지기 쉬운지도 드러났습니다.
- 상황: A 라는 AI 가 1 등, B 라는 AI 가 2 등이라고 합시다.
- 변화: 문제의 단어만 살짝 바꿔서 다시 시험을 치르면, A 가 5 등으로 떨어지고 B 가 1 등으로 올라갈 수 있습니다.
- 비유: 이는 모래성과 같습니다. 파도 (단어 변화) 가 조금만 와도 성의 모양이 완전히 바뀝니다. 즉, "이 AI 가 1 등이다"라고 믿고 선택하는 것은 매우 위험할 수 있다는 경고입니다.
📏 "크면 무조건 안전하다?"는 속설은 틀렸습니다
많은 사람이 "AI 가 더 크고 복잡할수록 (파라미터가 많을수록) 더 똑똑하고 튼튼할 것"이라고 생각합니다. 하지만 이 연구는 이를 완전히 반박했습니다.
- 비유: 거대한 코끼리가 있다고 해서 항상 작은 개미보다 위험한 곳에 잘 대처하는 건 아닙니다.
- 결과:
- 어떤 과제 (MMLU) 에서는 큰 AI 일수록 단어 변화에 더 취약해서 점수가 많이 떨어졌습니다. (크면 더 민감함)
- 다른 과제 (SQuAD) 에서는 큰 AI 일수록 오히려 더 잘 견디는 경향을 보였습니다.
- 핵심: AI 의 크기와 튼튼함 (Robustness) 사이에는 단순한 비례 관계가 없습니다. 어떤 문제를 풀느냐에 따라 결과가 완전히 다릅니다.
💡 이 연구가 우리에게 주는 교훈
- AI 는 아직 '진짜' 이해를 하지 못합니다: AI 는 단어의 표면적인 패턴을 외워서 답을 맞추는 데 능숙하지만, 문장의 깊은 의미나 구조를 유연하게 이해하는 능력은 부족합니다.
- 순위표만 믿지 마세요: 현재 AI 순위표는 매우 불안정합니다. 단어 하나만 바꿔도 순위가 뒤바뀔 수 있으니, 특정 AI 를 선택할 때 신중해야 합니다.
- 새로운 평가 기준이 필요합니다: 단순히 "정답을 몇 개 맞췄나?"를 보는 것보다, **"단어가 바뀌어도 똑같은 답을 할 수 있는가?"**를 테스트하는 '견고성 (Robustness) 테스트'가 필수적으로 도입되어야 합니다.
한 줄 요약:
"AI 는 단어 하나만 바꿔도 당황하는 '외계인' 같은 존재일 수 있으며, 현재 순위표는 너무 불안정해서 믿기 어렵습니다. AI 가 더 크다고 해서 무조건 안전한 것도 아닙니다."
이 연구는 우리가 AI 를 더 신뢰할 수 있게 만들기 위해, 단순한 점수 경쟁을 넘어 '언어 변화에 얼마나 강한가'를 평가하는 새로운 기준을 만들어야 한다고 주장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.