← 최신 논문
💬 NLP

ArithmAttack: Evaluating Robustness of LLMs to Noisy Context in Math Problem Solving

이 논문은 문장 부호 형태의 노이즈가 추가된 맥락에서 LLM 의 수학 문제 해결 능력을 평가하는 'ArithmAttack'을 제안하고, 실험을 통해 모든 모델이 노이즈 양이 증가함에 따라 성능이 저하되는 취약점을 보임을 규명했습니다.

원저자: Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍪 쿠키를 구울 때의 소음: "ArithmAttack"이란 무엇일까요?

상상해 보세요. 아주 똑똑한 요리사 (AI) 가 "설탕 100g, 밀가루 200g"이라는 레시피를 보고 쿠키를 구워낸다고 칩시다. 그런데 요리사에게 건네진 레시피에 불필요한 기호들이 잔뜩 섞여 있다면?

예를 들어, "설탕 100g ! 밀가루 200g ?"처럼 문장 부호 (?, !, ; 등) 가 무작위로 튀어나와 있다면요?

  • 문제: 글자 자체는 바뀌지 않았습니다. '설탕'이 '소금'으로 바뀌거나 사라진 건 아닙니다.
  • 현상: 하지만 AI 는 이 '소음' 때문에 당황해서 엉뚱한 쿠키를 구워내거나, 아예 망쳐버립니다.

이 논문에서는 이 현상을 **ArithmAttack(산수 공격)**이라고 이름 붙였습니다. AI 가 수학 문제를 풀 때, 문장 부호라는 '소음'에 얼마나 취약한지를 테스트한 것입니다.

🧪 실험 내용: 8 명의 요리사와 2 개의 레시피

연구진은 8 가지의 서로 다른 AI 모델 (Llama, Mistral, DeepSeek 등) 을 시험대에 올렸습니다. 그리고 두 가지 유명한 수학 문제집 (GSM8K, MultiArith) 을 준비했습니다.

  1. 깨끗한 상태: 원래 문제 그대로 AI 에게 물어봤습니다. (대부분 잘 풀었습니다.)
  2. 소음 상태: 문제 문장 속에 **10%, 30%, 50%**까지 무작위로 문장 부호를 심었습니다.
    • 예: "티파니는 8 개의 브라우니를 구웠지만, 파티를 위해 ! 17 개가 ; 필요했다."

📉 결과: 소음이 커질수록 AI 는 당황합니다

결과는 매우 명확했습니다. "소음"이 조금만 섞여도 AI 의 실력은 뚝 떨어졌습니다.

  • 비유: 마치 눈이 가려진 상태에서, 귀에는 잡음이 섞인 상태로 수학 문제를 푸는 것과 같습니다.
  • 경향: 소음이 10% 에서 50% 로 늘어날수록, AI 가 정답을 맞히는 확률은 급격히 줄어듭니다.
  • 가장 강한 AI: 여러 AI 중 Llama3.1이 소음 속에서도 가장 잘 버텼습니다. 마치 소음 속에서도 귀를 막고 집중하는 '고양이' 같은 존재였습니다.
  • 가장 약한 AI: Zephyr이라는 모델은 소음만 조금 들어와도 완전히 무너져버렸습니다.

💡 왜 이런 일이 일어날까요?

이 실험의 핵심은 **"의미는 그대로인데, AI 는 왜 망치는가?"**입니다.

  • 의미는 변하지 않음: "설탕 100g"이라는 뜻은 변하지 않았습니다.
  • AI 의 약점: 하지만 AI 는 문장 부호가 섞이면 문장의 흐름 (논리) 을 읽는 데 혼란을 겪습니다. 마치 우리가 글을 읽을 때 쉼표가 없는 문장을 읽다가 숨이 막히는 것처럼, AI 도 논리적 추론의 흐름이 끊기는 것입니다.

🏆 결론 및 시사점

이 연구는 우리에게 중요한 메시지를 줍니다.

  1. AI 는 완벽하지 않다: 우리가 생각할 때 "AI 는 똑똑하니까 소음 정도는 무시하겠지?"라고 생각하지만, 실제로는 아주 사소한 문장 부호 하나에도 매우 약합니다.
  2. 더 복잡한 문제일수록 취약: 쉬운 수학 문제보다는 어려운 문제 (GSM8K) 일수록 소음에 더 취약했습니다.
  3. 미래의 과제: 앞으로 AI 를 더 튼튼하게 만들려면, 이런 '소음' 속에서도 논리를 잃지 않도록 훈련시켜야 합니다.

한 줄 요약:

"AI 는 수학 문제를 풀 때, 문장 부호라는 '잡음'이 조금만 섞여도 논리를 잃고 엉뚱한 답을 내놓는다는 것을 발견했습니다. 마치 소음 속에서 복잡한 계산기를 두드리는 것과 비슷하죠."

이 연구는 AI 가 실제 세상 (여러 가지 오류와 소음이 섞인 환경) 에서 얼마나 견고하게 작동할지 점검하는 중요한 첫걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →