← 최신 논문
💬 NLP

Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation

본 논문은 의미는 동일하지만 어휘와 구문만 변형된 입력에 대해 23 개의 최신 LLM 을 평가한 결과, 어휘적 변화가 성능과 순위 불안정성을 크게 초래하며 모델 크기와 무관하게 표면적 어휘 패턴에 의존하는 경향이 있음을 밝혀 LLM 평가에 강건성 테스트의 필요성을 강조합니다.

원저자: Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

게시일 2026-02-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"똑같은 뜻인데, 말만 조금 바꾸면 AI 의 성적이 왜 이렇게 달라질까?"**라는 아주 흥미로운 질문에서 시작합니다.

마치 시험지를 생각해보세요. 같은 문제를 풀고 있는데, 문제의 단어만 살짝 바꾸거나 문장 순서를 바꿨을 때, 똑똑한 AI 가 엉뚱한 답을 하거나 점수가 뚝 떨어지는 현상을 연구한 것입니다.

이 복잡한 연구를 일상적인 언어와 비유로 쉽게 설명해 드릴게요.


🍎 핵심 비유: "사과"를 어떻게 부르느냐에 따라 달라지는 AI

이 연구는 23 개의 최신 AI 모델 (LLM) 을 대상으로 실험했습니다. 연구자들은 AI 에게 똑같은 내용을 묻되, 두 가지 방식으로 질문을 살짝 변형해 보았습니다.

  1. 단어 바꾸기 (Lexical Perturbation): "사과"라는 단어를 "붉은 과일"로 바꾸거나, "먹다"를 "섭취하다"로 바꾸는 것. (뜻은 똑같음)
  2. 문장 구조 바꾸기 (Syntactic Perturbation): "내가 사과를 먹었다"를 "사과가 내가 먹은 것이다"로 바꾸는 것. (문법 구조만 바뀜)

그 결과는 놀라웠습니다.

1. 단어 하나만 바꿔도 AI 는 당황합니다 (단어 민감성)

AI 는 문장의 구조 (문법) 보다는 단어 그 자체에 훨씬 더 의존하고 있었습니다.

  • 비유: AI 는 마치 외계인처럼 생겼습니다. "사과"라는 단어를 보면 "이건 맛있는 과일이야"라고 기억해 두는데, 갑자기 "붉은 과일"이라고 하면 "아, 이건 다른 물건인가?"라고 혼란을 겪는 것입니다.
  • 결과: 단어를 바꾸는 실험에서는 거의 모든 AI 의 점수가 크게 떨어졌습니다. 마치 시험지 지시어가 "선택지 A"에서 "선택지 1"로 바뀌는 것만으로도 학생이 당황하는 것과 비슷합니다.

2. 문장 순서를 바꿔도 AI 는 잘합니다 (문법 둔감성)

반면, 문장의 순서를 바꾸거나 수동태로 바꾸는 실험에서는 점수 변화가 크지 않았습니다.

  • 비유: AI 는 문장 구조가 바뀌어도 "아, 이건 여전히 '내가 사과를 먹었다'는 뜻이구나"라고 파악할 줄 압니다. 하지만 단어 자체가 바뀌면 그 연결고리가 끊어지는 것입니다.
  • 결론: AI 는 진짜 언어 능력 (문맥 이해) 보다는 표면적인 단어 패턴 (암기) 에 더 의존하고 있다는 뜻입니다.

🏆 리더보드 (순위표) 는 모래성이다

지금까지 AI 의 실력을 비교할 때 사용하는 '순위표 (Leaderboard)'가 얼마나 부서지기 쉬운지도 드러났습니다.

  • 상황: A 라는 AI 가 1 등, B 라는 AI 가 2 등이라고 합시다.
  • 변화: 문제의 단어만 살짝 바꿔서 다시 시험을 치르면, A 가 5 등으로 떨어지고 B 가 1 등으로 올라갈 수 있습니다.
  • 비유: 이는 모래성과 같습니다. 파도 (단어 변화) 가 조금만 와도 성의 모양이 완전히 바뀝니다. 즉, "이 AI 가 1 등이다"라고 믿고 선택하는 것은 매우 위험할 수 있다는 경고입니다.

📏 "크면 무조건 안전하다?"는 속설은 틀렸습니다

많은 사람이 "AI 가 더 크고 복잡할수록 (파라미터가 많을수록) 더 똑똑하고 튼튼할 것"이라고 생각합니다. 하지만 이 연구는 이를 완전히 반박했습니다.

  • 비유: 거대한 코끼리가 있다고 해서 항상 작은 개미보다 위험한 곳에 잘 대처하는 건 아닙니다.
  • 결과:
    • 어떤 과제 (MMLU) 에서는 큰 AI 일수록 단어 변화에 더 취약해서 점수가 많이 떨어졌습니다. (크면 더 민감함)
    • 다른 과제 (SQuAD) 에서는 큰 AI 일수록 오히려 더 잘 견디는 경향을 보였습니다.
    • 핵심: AI 의 크기와 튼튼함 (Robustness) 사이에는 단순한 비례 관계가 없습니다. 어떤 문제를 풀느냐에 따라 결과가 완전히 다릅니다.

💡 이 연구가 우리에게 주는 교훈

  1. AI 는 아직 '진짜' 이해를 하지 못합니다: AI 는 단어의 표면적인 패턴을 외워서 답을 맞추는 데 능숙하지만, 문장의 깊은 의미나 구조를 유연하게 이해하는 능력은 부족합니다.
  2. 순위표만 믿지 마세요: 현재 AI 순위표는 매우 불안정합니다. 단어 하나만 바꿔도 순위가 뒤바뀔 수 있으니, 특정 AI 를 선택할 때 신중해야 합니다.
  3. 새로운 평가 기준이 필요합니다: 단순히 "정답을 몇 개 맞췄나?"를 보는 것보다, **"단어가 바뀌어도 똑같은 답을 할 수 있는가?"**를 테스트하는 '견고성 (Robustness) 테스트'가 필수적으로 도입되어야 합니다.

한 줄 요약:

"AI 는 단어 하나만 바꿔도 당황하는 '외계인' 같은 존재일 수 있으며, 현재 순위표는 너무 불안정해서 믿기 어렵습니다. AI 가 더 크다고 해서 무조건 안전한 것도 아닙니다."

이 연구는 우리가 AI 를 더 신뢰할 수 있게 만들기 위해, 단순한 점수 경쟁을 넘어 '언어 변화에 얼마나 강한가'를 평가하는 새로운 기준을 만들어야 한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →