Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs
이 논문은 대규모 언어 모델의 최대 무오류 추론 범위를 평가하기 위한 제로 에러 호라이즌(Zero-Error Horizon, ZEH) 지표를 도입하여, GPT-5.2와 같은 최첨단 시스템조차 근본적인 과업에서 실패함을 밝히는 동시에 알고리즘적 창발성을 분석하고 그 평가를 확장하기 위한 효율적인 계산 방법을 제안하는 데 있어 ZEH의 유용성을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 원자력 발전소를 운영하거나, 은행을 관리하거나, 수술을 수행하는 데 도움을 줄 수 있는 아주 똑똑하고 천재적인 비서 한 명을 고용한다고 상상해 보십시오. 이 비서는 복잡한 컴퓨터 코드를 작성할 수 있고, 양자 물리학을 설명할 수 있으며, 예술에 대해 대화를 나눌 수도 있습니다. 하지만 여기에는 함정이 있습니다. 이 비서는 가끔 5살 아이도 할 수 있는 일에서 실수한다는 점입니다.
"GPT-5.2조차 5까지 셀 수 없다"라는 논문은 이러한 AI 비서를 테스트하는 새로운 방법인 **제로 에러 호라이즌(Zero-Error Horizon, ZEH)**을 소개합니다. ZEH를 단순한 시험 점수가 아니라 **"안전 울타리"**라고 생각하십시오.
다음은 이 논문의 발견을 쉬운 비유를 사용하여 정리한 내용입니다.
1. "안전 울타리" 개념 (ZEH란 무엇인가?)
대부분의 사람들은 AI를 테스트할 때 쉬운 문제와 어려운 문제를 섞어서 주고 얼마나 맞혔는지 계산합니다(예: 95%의 성적). 저자들은 이것이 안전이 중요한 직업에서는 위험하다고 말합니다. 만약 AI가 수학 문제의 99%를 맞혔더라도, 특정 숫자 하나에서 실패한다면 그 단 한 번의 실패가 재앙을 초래할 수 있기 때문입니다.
ZEH는 AI의 완벽한 영역을 둘러싼 "울타리"입니다.
- 울타리 안쪽: AI가 100% 정확함을 보장받는 구간입니다.
- 울타리 바깥쪽: AI가 실수를 할 수도 있는 구간입니다.
- 울타리의 높이: 만약 어떤 AI의 곱셈 ZEH가 10이라면, 이는 해당 AI가 10까지의 모든 숫자를 완벽하게 곱할 수 있음을 의미합니다. 하지만 11을 곱하라고 요구하는 순간, AI는 실수할 수 있습니다.
2. 충격적인 발견 (어처구니없는 실수들)
저자들은 매우 발전된 모델(GPT-5.2)을 테스트했고, 단순한 작업에 대해 이 모델의 "울타리"가 놀라울 정도로 낮다는 것을 발견했습니다.
- 패리티(Parity) 테스트: AI가
11000과 같은 숫자 문자열에 1이 홀수 개인지 짝수 개 있는지 셀 수 있을까요? AI는 5자리 숫자에서 실패했습니다. 이 모델의 울타리는 4에 머물렀습니다. - 괄호 테스트: AI가
((((())))))가 균형 잡힌 괄호인지 판단할 수 있을까요? AI는 실제로는 "아니오"임에도 불구하고 "예"라고 답했습니다. - 수학 테스트: AI는 복잡한 물리 시뮬레이션을 작성할 수 있었지만,
127 × 82라는 단순한 수학 문제를 틀렸습니다.
비유: 마스터 셰프가 10가지 코스 요리를 만들 수 있지만, 샌드위치를 만들다가 소금 한 알을 바닥에 떨어뜨리는 상황을 상상해 보십시오. 일반적인 주방이라면 그 소금 한 알을 무시하겠지만, 원자력 발전소나 은행에서는 그 소금 한 알(혹은 잘못된 숫자 하나)이 파멸적인 결과를 초라할 수 있습니다.
3. ZEH가 "성적표"보다 더 나은 이유
이 논문은 표준적인 정확도 점수가 **"메뉴를 골라내는 것(cherry-picking)"**과 같다고 주장합니다.
- 함정: 연구자는 "우리의 새로운 AI는 훌륭합니다! 곱셈 문제의 99%를 맞혔습니다!"라고 말할 수 있습니다. 하지만 그들은 숫자 20까지의 문제만 테스트했을 수도 있습니다. 만약 100까지 테스트한다면, AI는 처참하게 실패할 수도 있습니다.
- ZEH의 해결책: ZEH는 당신이 메뉴를 선택하지 못하게 합니다. 대신 AI가 특정 지점까지의 모든 것을 처리할 수 있음을 증명하도록 강제합니다. 만약 AI가 13에서 실패한다면, 울타리는 12에 설정됩니다. "평균 점수"가 아무리 높더라도, 울타리는 어디서부터 위험 지대가 시작되는지를 정확히 알려줍니다.
4. AI가 "학습하는 방식" (암기 vs 이해)
저자들은 다양한 크기의 모델 제품군(Qwen2.5)을 연구하여 규모에 따라 어떻게 개선되는지 살펴보았습니다.
- 작은 모델 (복사기): 작은 AI 모델들은 암기에 의존합니다. 그들은 훈련 데이터에서
2 × 2 = 4라는 답을 이미 "본" 상태입니다. 하지만 만약2 × 3을 본 적이 없다면, 틀린 답을 추측할 수 있습니다. 이들의 "울타리"는 불안정하고 구멍이 많습니다. - 큰 모델 (수학자): 모델이 커질수록, 그들은 단순히 암기하는 것을 넘어 **규칙(알고리즘)**을 배우기 시작합니다.
- 단서: 저자들은 큰 모델들이 "구조적인" 실수를 한다는 것을 발견했습니다. 예를 들어, 정답이 986일 때, 큰 모델은 1006이라고 말할 수 있습니다. 그 차이는 정확히 20입니다. 이는 인간이 긴 곱셈을 할 때 발생하는 "올림(carry-over)" 오류와 매우 흡사합니다.
- 결과: 이는 큰 모델이 단순히 답을 추측하는 것이 아니라 실제로 수학을 하고 있음을 증명합니다. 규칙을 사용하고 있기 때문에, 이들의 "안전 울타리(ZEH)"는 꾸준하고 예측 가능하게 성장합니다.
5. 울타리를 확인하는 비용
저자들은 이 "울타리"를 확인하는 것이 비용이 많이 든다는 점을 인정합니다. AI가 실패하는 정확한 지점을 찾으려면, 1, 2, 3... 순서대로 모든 문제를 테스트해야 합니다.
- 해결책: 그들은 이 테스트 과정을 최대 10배 빠르게 만드는 "가속" 툴킷(트리 구조와 스마트 캐싱 사용)을 개발했습니다. 이는 계단의 모든 단계를 하나씩 걸어 올라가는 대신, 로봇이 몇 초 만에 모든 계단을 체크하는 것과 같습니다.
요약
이 논문은 금융이나 의료와 같이 안전이 중요한 직업을 위해, 우리는 단순히 "이 AI가 얼마나 똑똑한가?"라고 물어서는 안 된다고 주장합니다. 대신, **"이 AI가 완벽함을 멈추는 정확한 지점은 어디인가?"**라고 물어야 합니다.
**제로 에러 호라이즌(Zero-Error Horizon)**이 바로 그 지점입니다. 이는 심지어 가장 똑똑한 AI라도 놀라울 정도로 단순한 작업에서 "사각지대"를 가지고 있음을 드러내며, 우리가 실수를 하기 전까지 그들을 어디까지 신뢰할 수 있는지에 대한 구체적이고 수학적인 방법을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.