← 최신 논문
🤖 AI

How Inference Compute Shapes Frontier LLM Evaluation

이 논문은 최첨단 거대언어모델(LLM)의 성능이 추론 시간 연산 예산과 평가 프로토콜에 매우 민감하다는 점을 입증하며, 벤치마크가 모델의 잠재력을 과소평가할 수 있는 제한적인 고정 예산에 의존하기보다 가용 연산량의 함수로서 역량을 보고해야 한다고 주장한다.

원저자: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 최고의 미스터리를 해결하는 팀을 가려내기 위해 천재적인 탐정들을 테스트하고 있다고 상상해 보십시오. 과거에는 당신은 그들에게 엄격한 규칙을 주었을 것입니다. "당신에게는 10분의 시간과 단 한 번의 정답 기회만 주어집니다. 답을 적으세요." 만약 그들이 실패한다면, 당신은 이렇게 말했을 것입니다. "이 탐정은 실력이 부족하군."

하지만 이 논문은 이러한 방식이 불공평하다고 주장합니다. 어떤 탐정들은 단지 시간이 더 필요했거나, 자신의 작업 내용을 확인할 두 번째 기회가 필요했거나, 혹은 첫 번째 추측이 틀렸다는 힌트가 필요했을 뿐이라고 제안합니다. 만약 당신이 그것들을 제공했다면, 그들은 미스터리를 완벽하게 해결했을지도 모릅니다.

연구진들은 이 아이디어를 검증하기 위해 세계에서 가장 진보된 AI 모델들(탐정들)을 사용하여 컴퓨터 코드 작성부터 고급 수학 문제 풀이, 의료 사례 진단, 사이버 보안 해킹에 이르기까지 매우 어려운 7가지 과제를 테스트했습니다.

그 결과는 다음과 같습니다. 이해하기 쉽게 설명해 드리겠습니다.

1. "시간 제한"의 함정

대부분의 AI 테스트는 모델이 사용할 수 있는 "생각하는 시간"(토큰)에 엄격한 제한을 둡니다. 연구진은 많은 어려운 과제에서 이 제한이 AI가 막 무언가를 알아내려는 찰나에 흐름을 끊어버린다는 것을 발견했습니다.

  • 비유: 수학 시험을 치르는 학생을 상상해 보세요. 학생은 문제를 푸는 법을 알고 있지만, 선생님이 10분이 지나자마자 시험을 중단시킵니다. 학생은 수학을 못 해서가 아니라, 시간이 다 되어서 낙제 점수를 받게 됩니다.
  • 결과: 연구진이 AI 모델에게 평소보다 훨씬 많은 시간(최대 30배 더 많은 시간)을 주었을 때, 고급 수학이나 사이버 보안 같은 어려운 과제에서 점수가 크게 향상되었습니다. 하지만 일부 작업(특정 소프트웨어 엔지니어링 문제 등)에서는 AI 모델이 일반적인 시간 제한 내에서 이미 할 수 있는 만큼의 문제를 해결했기 때문에, 시간을 더 주는 것이 큰 도움이 되지 않았습니다.

2. "두 번째 기회" 효과

연구진은 또한 AI가 실패한 시도 후에 다시 시도할 수 있게 했을 때 어떤 일이 일어나는지 테스트했습니다.

  • 비유: 비디오 게임을 생각해보세요. 죽으면 그냥 끝인가요? 아니면 다시 시작해서 다른 전략을 시도할 수 있나요?
  • 결과: AI가 "다시 시작"하거나 새로운 답을 제출할 수 있도록 허용하면 거의 모든 테스트에서 점수가 향상되었습니다.
    • 힌트가 있을 때: 만약 AI에게 "그 답은 틀렸습니다, 다시 시도하세요"라고 알려주면, 특히 길고 복잡한 작업에서 정답을 찾는 능력이 훨씬 좋아졌습니다.
    • 힌트가 없을 때: 만약 AI가 자신이 맞았는지 틀렸는지 모른 채 스스로 추측해야 한다면, 여전히 개선되기는 했지만 그 정도는 크지 않았습니다.
    • 주의점: 어떤 테스트에서는 AI가 단 한두 번의 시도만으로 정답을 맞혔습니다. 반면 어떤 테스트에서는 성공하기 위해 10번 또는 15번을 시도해야 했습니다.

3. 모든 상황에 적용되는 하나의 정답은 없다

가장 중요한 발견은 서로 다른 유형의 문제에는 서로 다른 종류의 "도움"이 필요하다는 것입니다.

  • 비유: 당신에게 공구함이 있다고 상상해 보세요. 망치는 못질에는 좋지만 나사에는 쓸모가 없습니다. 모든 것에 망치를 사용하면서 잘 작동하기를 기대할 수는 없습니다.
  • 결과:
    • 사이버 보안 및 수학: 이 과제들은 더 많은 시간더 많은 시도를 원했습니다. AI는 작업을 오래 지속할수록 계속해서 더 발전했습니다.
    • 의료 진단: 이 작업은 시간을 더 준다고 해서 크게 개선되지 않았습니다. AI가 더 이상의 사고가 도움이 되지 않는 벽에 부딪힌 것처럼 보였습니다.
    • 소프트웨어 엔지니어링: 이 작업들은 시간을 더 주는 것에 따라 조금씩 개선되었지만, 주로 다시 시도할 수 있도록 허용하는 것이 중요했습니다.

4. 최신 모델은 다르다

연구진은 서로 다른 연도의 모델들(구형 vs 신형 세대)을 테스트했습니다.

  • 비유: 구형 모델을 많은 시간과 많은 힌트가 필요한 초보 탐정이라고 생각해보세요. 최신 모델은 숙련된 탐정과 같습니다. 그들은 더 어려운 사건을 해결할 수 있고 더 신뢰할 수 있지만, 그렇다고 해서 시간을 사용하는 속도가 반드시 빨라지는 것은 아닙니다.
  • 결과: 최신 모델들은 단순히 시간을 사용하는 것이 "빨라진" 것이 아니었습니다. 대신, 다음과 같은 점에서 더 뛰어났습니다:
    1. 더 어려운 과제 해결: 구형 모델은 아예 손도 대지 못했던 문제들을 해결할 수 있었습니다.
    2. 더 높은 신뢰성: 문제를 해결했을 때, 두 번째 시도에서 실수할 확률이 낮았습니다.
    • 흥 nghiệm스럽게도, 최신 모델들은 첫 번째 시도에 정답을 맞히는 경우가 더 많았기 때문에 "두 번째 기회"가 덜 필요하기도 했습니다.

핵심 결론

이 논문은 엄격한 시간 제한이 있는 단 한 번의 테스트와 단 하나의 점수만으로는 AI의 진정한 지능을 판단할 수 없다고 주장합니다.

  • 점수는 규칙에 따라 달라진다: AI의 점수는 얼마나 많은 시간을 주는지, 다시 시도할 수 있게 하는지, 그리고 정답 여부를 알려주는지에 따라 달라집니다.
  • 권고 사항: "모델 X의 점수는 80%입니다"라고 말하는 대신, "모델 X는 1분 동안은 80%이지만, 10분 동안은 95%를 기록합니다"라고 말해야 합니다. 이것이 AI의 실제 능력을 훨씬 더 명확하게 보여줍니다. 특히 우리가 시스템의 압박 속에서의 성능뿐만 아니라 최대 잠재력을 알아야 하는 안전 및 정책 결정 분야에서는 더욱 그렇습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →