← 최신 논문
💬 NLP

ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning

이 논문은 ReasonBench를 소개하며, LLM의 추론 성능이 반복된 실행에 따라 상당하고 구조적인 불안정성을 보인다는 점을 입증함으로써, 단일 지점 평가(single-point evaluation)는 불충분하다고 주장하고 품질, 비용, 신뢰성 사이의 트레이드오프를 정확하게 포착하기 위한 분포 인식 평가(distribution-aware assessment)를 옹호한다.

원저자: Nearchos Potamitis, Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Lars Klein, Akhil Arora

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nearchos Potamitis, Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Lars Klein, Akhil Arora

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "동전 던지기" 문제

당신이 특정 요리를 만들어 달라고 요리사에게 고용했다고 상상해 보세요. 당신은 그에게 그 요리를 30번 만들어 달라고 요청합니다.

  • 기존 방식: 요리를 한 번 시켜보고 맛을 본 뒤, "이 요리사는 10점 만점에 9점이네"라고 말하는 것입니다.
  • 현실: 하지만 그 요리에게 30번을 더 시키다 보면, 어떤 때는 10점짜리 요리가 나오지만, 어떤 때는 4점짜리가 나오고, 또 어떤 때는 주방을 다 태워 먹기도 합니다. 그럼에도 불구하고 평균은 여전히 9점처럼 보일 수 있습니다.

이 논문은 거대 언 언어 모델(LLM)—챗봇의 두뇌 역할을 하는 AI—에 대해, 우리가 평균치만 보고 있었던 것은 스스로를 속이는 일이었다고 주장합니다.

연구진은 AI에게 "탐욕적(greedy)"으로 행동하라고 지시할 때(즉, 무작위성 없이 가장 뻔하고 안전한 답만을 선택하도록 설정할 때), 결과가 여전히 심하게 요동친다는 사실을 발견했습니다. 한 번은 수학 문제를 완벽하게 풀다가도, 다음번에는 똑같은 문제를 틀리기도 합니다.

새로운 도구: ReasonBENCH

이를 증명하기 위해 저자들은 ReasonBENCH라는 테스트 실험실을 구축했습니다. AI에게 문제를 단 한 번 풀게 하는 대신, 동일한 문제를 연속으로 30번 풀게 했습니다. 이 작업은 다음을 대상으로 수행되었습니다:

  • 12가지 서로 다른 AI 모델 (OpenAI, Google, Anthropic 등의 기업 제품 포함).
  • 10가지 서로 다른 사고 전략 ("Chain of Thought", "Tree of Thoughts", 또는 단순히 "묻고 답하기" 등).
  • 6가지 서로 다른 작업 유형 (수학 퍼즐, 코딩, 시 쓰기, 까다로운 질문에 답하기 등).

주요 발견 (아하! 모먼트)

1. "안정성 분류 체계" (네 가지 유형의 요리사)

연구진은 "불안정성"이 단순히 무작위적인 소음이 아니라는 것을 깨달았습니다. 여기에는 패턴이 있습니다. 그들은 두 개의 축을 가진 지도를 만들었습니다:

  • 전역 노이즈(Global Noise): AI의 성능이 어떤 과제를 주느냐에 따라 얼마나 변하는가? (수학은 잘하지만 시 쓰기는 못하는 전문가인가?)
  • 실행 노이즈(Run Noise): 동일한 과제를 두 번 주었을 때 AI의 성능이 얼마나 변하는가? (오늘 국물 맛이 좋을지 결정하기 위해 동전을 던지는 요리사인가?)

그들은 네 가지 유형의 시스템을 찾아냈습니다:

  • 안정적인 제너럴리스트 (Stable Generalists): 모든 것에 능숙하며, 매번 일관적임. (믿음직한 요리사).
  • 노이즈가 섞인 제너럴리스트 (Noisy Generalists): 모든 것에 능숙하지만, 가끔 운이 나쁜 날이 있음.
  • 안정적인 스페셜리스트 (Stable Specialists): 한 가지에는 뛰어나지만 다른 것에는 서툴지만, 일관적임.
  • 이중 노이즈형 (Doubly Noisy): 예측 불가능하고 일관성이 없음.

놀라운 점: AI가 사용하는 "사고 전략"의 유형이 해당 AI가 어떤 카테고리에 속할지를 예측합니다. 어떤 전략은 AI 모델이 얼마나 똑똑한지와 상관없이 본질적으로 더 혼란스러운 경향이 있습니다.

2. "비용 대 품질"의 함정

우리는 흔히 이렇게 생각합니다: "더 똑똑한 AI를 쓰거나 더 복잡한 사고 방식을 사용하면 더 좋은 결과를 얻을 거야."
논문은 다음과 같이 말합니다: 반드시 그렇지는 않습니다.

  • 비싼 실패: 매우 비싸고 고성능인 모델이나 복잡한 전략들은 여러 번 실행했을 때 오히려 더 자주 실패하는 경우가 많습니다. 평균적으로는 정답을 맞힐지 몰라도, 그 과정에서 많은 비용(컴퓨팅 비용)을 소모하며, 때로는 아예 무너지기도 합니다.
  • 저렴한 면역력: 놀랍게도, 단순한 방법(예: AI에게 직접 바로 묻는 방식)은 특정 유형의 실패에 "면역"이 있습니다. 이 방법들은 비용이 거의 들지 않기 때문에, 설령 답을 틀리더라도 돈을 낭비하지는 않습니다.
  • 비유: 복권 구매를 상상해 보세요.
    • 저렴한 방법: 1달러짜리 복권을 삽니다. 꽝이 되어도 1달러만 잃을 뿐입니다.
    • 비싼 방법: 1,000달러짜리 "프리미엄" 복권을 삽니다. 크게 당첨될 수도 있지만, 1,000달러를 통째로 날릴 수도 있습니다. 논문은 이러한 비싼 복권들이 우리가 생각하는 것보다 훨씬 더 자주 꽝이 된다는 것을 보여주었습니다.

3. 왜 이런 일이 발생하는가? (단순한 "무작위성" 때문이 아니다)

여러분은 "AI가 단어를 선택하기 위해 주사위를 굴리고 있는 것뿐이다"라고 생각할 수 있습니다.
연구진은 "주사위 굴리기"를 끄고(온도를 0으로 설정하여 결정론적으로 만듦) 이를 테스트했습니다. 결과적으로 불안정성은 사라지지 않았습니다.

이는 문제가 단순히 AI가 무작위로 단어를 선택하는 데 있는 것이 아님을 의미합니다. 불안정성은 더 깊은 곳의 문제에서 기인합니다:

  • API: AI를 실행하는 서버가 백그라운드에서 데이터를 이동시키며 영향을 줄 수 있습니다.
  • 전략: 여러 가능성을 탐색하는 방식(예: 검색 트리)은 본질적으로 혼란스러울 수 있습니다.
  • 평가자 (Evaluator): 만약 AI가 자신의 작업물을 스스로 채점해야 한다면, 그 채점자가 조금이라도 흔들릴 경우 전체 과정이 흔들리게 됩니다.

우리는 무엇을 해야 하는가? (시사점)

이 논문은 우리가 AI를 판단하는 방식을 바꿔야 한다고 제안합니다:

  1. 단일 숫자에 집착하지 마세요: 단순히 "모델 A의 정확도는 85%이다"라고 말하지 마세요. 대신 "모델 A의 정확도는 85%이지만, 실행할 때마다 60%에서 95% 사이를 오간다"라고 말해야 합니다.
  2. "공동 실패(Joint Failure)"를 확인하세요: AI를 배포할 때, "이 AI가 비싸면서 동시에 틀릴 확률은 얼마인가?"를 알아야 합니다. 논문은 비싼 방법들이 저렴한 방법들보다 '비싸면서 동시에 틀릴' 가능성이 훨씬 높다는 것을 보여줍니다.
  3. AI가 아니라 평가자를 고치세요: 복잡한 전략(예: 검색 트리)을 사용하고 있다면, 시스템을 안정적으로 만드는 가장 좋은 방법은 "심판"(정답을 확인하는 부분)을 완벽하게 만드는 것입니다. AI 모델 자체나 프롬프트를 수정하는 것보다 심판을 고치는 것이 훨씬 효과적입니다.

요약

ReasonBENCH는 하나의 경종을 울립니다. AI의 추론은 전등 스위치처럼 "켜짐" 또는 "꺼짐"이 아니라, 날씨 시스템과 같습니다. 그것은 단순히 켜져 있거나 꺼져 있는 것이 아니라, 끊임없이 변동합니다. 평균적인 일기 예보만 보고 있다면, 갑작스러운 폭풍우에 속수무책으로 당할 수 있습니다. AI가 진정으로 신뢰할 수 있는 것인지, 아니면 그저 운이 좋은 것인지 알기 위해서는 결과의 분포를 살펴봐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →