← 최신 논문
💬 NLP

Measuring Representation Robustness in Large Language Models for Geometry

이 논문은 기하학 문제의 표현 방식 (유클리드, 좌표, 벡터) 에 따라 대형 언어 모델의 성능이 크게 달라질 수 있음을 보여주는 'GeoRepEval' 평가 프레임워크를 제안하고, 모델이 추상적인 기하학적 추론보다는 표현에 특화된 휴리스틱에 의존하고 있음을 규명했습니다.

원저자: Vedant Jawandhia, Yash Sinha, Murari Mandal, Ankan Pal, Dhruv Kumar

게시일 2026-04-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vedant Jawandhia, Yash Sinha, Murari Mandal, Ankan Pal, Dhruv Kumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📐 "수학 천재"가 변장만 하면 당황하는 이유: AI 의 기하학 실력 탐구

이 논문은 최근 화제가 되는 **거대 언어 모델 **(LLM, AI)이 수학, 특히 기하학 문제를 풀 때 얼마나 '튼튼한지'를 조사한 연구입니다.

핵심 결론은 매우 흥미롭습니다. "AI 는 문제를 푸는 능력이 부족해서가 아니라, 문제가 '어떤 옷'을 입고 나왔는지에 따라 실력이 극적으로 달라진다"는 것입니다.

이 복잡한 연구를 일상적인 비유로 쉽게 설명해 드릴게요.


1. 연구의 배경: "같은 문제, 다른 옷"

상상해 보세요. 친구가 당신에게 "3+3 은 몇?"이라고 물었습니다. 당신은 "6"이라고 바로 답합니다.
하지만 친구가 갑자기 말투를 바꿔서 "3 더하기 3 과 같은 수는?"이라고 물으면, 혹은 "3 과 3 의 합은?"이라고 물으면, 당신은 잠시 멈칫할 수 있습니다. (물론 인간은 금방 알아채지만, AI 는 여기서 혼란을 겪습니다.)

이 연구는 기하학 문제를 대상으로 했습니다. 같은 기하학 문제도 세 가지 다른 '옷'을 입힐 수 있습니다.

  1. **유클리드 형식 **(Euclidean) "삼각형의 두 변의 길이가 3 과 4 일 때..." (일반적인 말로 설명)
  2. **좌표 형식 **(Coordinate) "점 A 는 (0,0) 에 있고, 점 B 는 (3,0) 에 있다..." (숫자와 좌표로 설명)
  3. **벡터 형식 **(Vector) "벡터 AB 와 벡터 AC 의 외적을 구하라..." (화살표와 기호로 설명)

문제: 이 세 가지는 완전히 같은 수학 문제입니다. 하지만 기존 시험지들은 이 중 하나만 내서 "AI 가 맞췄으니 수학 잘한다"고 평가했습니다. 연구자들은 "아니, 다른 옷을 입히면 어떻게 될까?"라고 궁금해했습니다.

2. 실험 방법: "GeoRepEval"이라는 새로운 시험지

연구팀은 GeoRepEval이라는 새로운 평가 도구를 만들었습니다.

  • 방법: 같은 문제를 유클리드, 좌표, 벡터 세 가지 버전으로 만들어 11 개의 최신 AI 모델에게 풀게 했습니다.
  • 목표: AI 가 세 가지 옷을 모두 입었을 때 똑같이 정답을 내는지, 아니면 옷만 바뀌면 틀리는지 확인했습니다.

3. 주요 발견: "옷"에 따라 실력이 14% 나 달라진다!

결과가 충격적이었습니다.

  • **유클리드 **(일반 말) AI 들은 이 형식을 가장 잘 풀었습니다. 마치 우리가 일상적인 대화로 문제를 풀 때처럼 자연스럽습니다.
  • **벡터 **(기호) AI 들은 이 형식을 가장 못 풀었습니다.
  • 격차: 어떤 AI 모델은 유클리드 형식에서는 60% 를 맞췄지만, 벡터 형식에서는 46% 만 맞춰 14% 포인트나 떨어졌습니다.

비유:

마치 어떤 요리사가 "불고기"라는 이름의 요리는 완벽하게 만들지만, "소고기 간장 볶음"이라는 이름으로 같은 재료를 주면 당황해서 실패하는 것과 같습니다. **요리 실력 **(수학 능력)

4. 왜 이런 일이 일어날까? (4 가지 추측)

연구팀은 AI 가 벡터 문제를 못 푸는 이유를 네 가지로 추측했습니다.

  1. **복잡한 옷 **(표면적 복잡성) 벡터 문제는 기호 (i, j, k 등) 가 너무 많고 문장이 길어서 AI 가 헷갈립니다.
  2. **긴 레시피 **(절차적 길이) 유클리드 문제는 "밑변×높이÷2"로 한 번에 해결되지만, 벡터 문제는 여러 단계를 거쳐 계산해야 합니다. AI 는 긴 레시피를 따라가다 중간에 실수합니다.
  3. 학습 데이터의 편향: AI 가 배운 책이나 인터넷 자료에 '일반적인 기하학'은 많지만, '벡터 기하학'은 상대적으로 적었을 수 있습니다.
  4. 부정확한 계산: 개념은 알지만, 기호를 계산할 때 부호 (+, -) 를 잘못 쓰거나 실수하는 경우가 많습니다.

5. 해결책: "변환 후 풀기" (Convert-Then-Solve)

연구팀은 "AI 가 벡터 문제를 못 풀면, 일단 유클리드 형식으로 바꿔서 풀어보라고 시켜보자"는 실험을 했습니다.

  • 고성능 AI: "벡터 문제를 유클리드 문제로 바꿔서 풀어봐"라고 말해주니, 실력이 52% 포인트나 급상승했습니다!
    • 의미: 이 AI 들은 원래 수학 실력이 있었지만, 벡터라는 옷을 입은 문제를 해석하는 능력이 부족했던 것입니다. 옷만 갈아입히면 천재가 됩니다.
  • 저성능 AI: 작은 모델들은 옷을 바꿔줘도 여전히 못 풀었습니다.
    • 의미: 이 모델들은 아예 수학 실력 자체가 부족해서 옷을 바꿔줘도 소용없었습니다.

6. 결론: 우리가 무엇을 배웠는가?

이 논문은 우리에게 중요한 교훈을 줍니다.

  1. 단일 시험은 믿지 마세요: AI 가 한 가지 형식 (예: 유클리드) 에서 잘한다고 해서 "이 AI 는 수학 천재다"라고 단정할 수 없습니다. 다른 옷을 입히면 무너질 수 있습니다.
  2. 추상적 사고 부족: 현재의 AI 는 진짜 '수학적 추론'을 하기보다는, **자주 본 패턴 **(유클리드 형식)을 외워서 답을 맞추는 경향이 있습니다.
  3. 안전한 AI 를 위해: 만약 AI 를 의료나 공학 같은 중요한 일에 쓴다면, "이 AI 는 다양한 표현 방식에서도 똑똑한가?"를 반드시 확인해야 합니다.

한 줄 요약:

"AI 가 수학 문제를 못 푼 게 아니라, 문제가 '벡터'라는 낯선 옷을 입어서 당황한 것입니다. 옷을 바꿔주면 고수 AI 는 다시 천재가 되지만, 실력이 부족한 AI 는 여전히 못 풉니다."

이 연구는 AI 가 더 똑똑하고 튼튼해지려면, 다양한 방식으로 문제를 접해보며 훈련해야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →