← 최신 논문
💬 NLP

More Agents Improve Math Problem Solving but Adversarial Robustness Gap Persists

이 논문은 다수의 LLM 에이전트가 협업할 때 수학 문제 해결 정확도는 향상되지만, 오타나 구두점 노이즈와 같은 적대적 공격에 대한 견고성 격차는 에이전트 수를 늘려도 여전히 유지된다는 사실을 규명합니다.

원저자: Khashayar Alavi, Zhastay Yeltay, Lucie Flek, Akbar Karimi

게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Khashayar Alavi, Zhastay Yeltay, Lucie Flek, Akbar Karimi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 "수학 문제를 풀 때 AI 여러 대가 힘을 합치면 더 잘 풀까? 그리고 엉뚱한 실수나 오타가 섞여도 여전히 똑똑할까?" 라는 두 가지 질문을 다룹니다.

결론부터 말씀드리면, "AI 여러 대가 모여서 투표하면 정답률은 확실히 올라가지만, 엉뚱한 오타가 섞인 질문에는 여전히 약하다" 는 놀라운 사실을 발견했습니다.

이 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 실험 설정: "수학 올림피아드"와 "AI 팀"

연구진들은 여러 개의 AI 모델 (Qwen, Llama, Mistral 등) 을 데려와서 수학 문제를 풀게 했습니다.

  • 1 인제 (혼자): AI 한 대가 문제를 보고 답을 냅니다.
  • 팀제 (여러 명): 같은 문제를 AI 5 대, 10 대, 심지어 25 대가 각각 풀게 한 뒤, 다수결 투표로 최종 답을 정합니다. (예: 25 대 중 15 대가 '10'이라고 답하면 최종 답은 '10'이 됩니다.)

2. 첫 번째 발견: "여럿이 모이면 더 똑똑해진다" (하지만 한계가 있다)

  • 비유: 혼자 공부하는 학생보다 스터디 그룹을 만들어서 문제를 풀면 실수가 줄어들고 정답률이 높아지는 것과 같습니다.
  • 결과: AI 가 1 대일 때보다 5 대, 10 대가 될수록 정답률이 쑥쑥 올라갔습니다. 특히 1 대에서 5 대로 늘릴 때 효과가 가장 컸습니다.
  • 한계: 하지만 10 대를 넘어 25 대까지 늘려도 정답률은 더 이상 크게 오르지 않았습니다. 이미 '최적의 팀 규모'를 찾은 셈입니다.

3. 두 번째 발견: "엉뚱한 오타에는 팀워크도 무용지물" (핵심 결론)

이 논문에서 가장 중요한 부분은 교란 실험입니다. 연구진들은 수학 문제 속에 고의로 오타불필요한 문장 부호를 섞어서 AI 에게 주었습니다.

  • 상황 A (문장 부호 섞기): "3+5=?" 대신 "3, +, 5, =?" 처럼 쉼표와 물음표를 여기저기 끼워 넣었습니다.
    • 결과: AI 팀이 5 대 이상이면 이 정도는 잘 견뎌냈습니다. 마치 "아, 문장 부호는 무시하고 숫자만 보자"라고 생각할 수 있었기 때문입니다.
  • 상황 B (실제 오타 섞기): "Janet's ducks lay 16 eggs por day" (for 대신 por) 처럼, 사람이 실제로 자주 하는 철자 실수를 섞었습니다.
    • 결과: 여기서 문제가 터졌습니다. AI 가 1 대든 25 대든, 오타가 섞인 질문에는 정답률이 여전히 낮았습니다.
    • 비유: 팀원들이 모두 "이건 'por'이 아니라 'for'야!"라고 알아차리지 못하고, 오타 그대로 해석해서 엉뚱한 답을 내는 경우입니다. 팀원 25 명이 모두 같은 실수를 반복하는 꼴이 된 것입니다.

4. 왜 이런 일이 일어날까? (논문의 해석)

연구진들은 이를 "공감의 역설 (Consensus Paradox)" 이라고 부릅니다.

  • 일반적인 생각: "여러 명이 모이면 서로의 실수를 고쳐주겠지?"
  • 현실: AI 들은 모두 같은 뇌 (모델) 를 공유하고 있습니다. 입력된 질문이 "por"처럼 엉망으로 변하면, 모든 AI 가 똑같이 "아, por 이구나"라고 착각합니다.
  • 결과: 다수결 투표는 "서로 다른 의견 중 가장 많은 것을 고르는 것"인데, 모두가 같은 잘못된 의견을 내면 투표는 그 잘못된 답을 확정해 줄 뿐, 고쳐주지 못합니다.

5. 요약 및 교훈

이 논문의 메시지를 한 문장으로 정리하면 다음과 같습니다.

"AI 를 여러 대 모아 팀을 꾸리면 (여럿이 힘을 합치면) 수학 실력은 확실히 좋아집니다. 하지만, 질문 속에 사람의 실수 (오타) 가 섞여 있다면, 아무리 팀을 많이 꾸려도 그 실수를 고쳐내지 못합니다."

실생활 교훈:
우리가 AI 를 금융, 의료, 법률 같은 중요한 일에 쓸 때, 단순히 "AI 를 100 대나 써보자"라고 생각하면 안 됩니다. AI 가 입력된 텍스트의 작은 오타나 실수에 얼마나 민감한지 (robustness) 를 먼저 개선해야 합니다. AI 팀을 늘리는 것만으로는 해결되지 않는 '근본적인 약점'이 있기 때문입니다.

한 줄 결론:
"여럿이 모이면 더 똑똑해지지만, 엉뚱한 오타 앞에서는 1 인이든 100 인이든 다 똑같이 멍청해질 수 있다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →