← 최신 논문
🤖 AI

Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems

이 논문은 첨단 AI 시스템의 진정한 프런티어 차별화 요소는 능력이 아니라 출력 정밀도(반복된 요청 간의 일관성)라고 주장하며, 교정 가능한 운영 오류와 근본적인 모델 한계를 구분하기 위해 이 "그룹화"를 측정하는 저비용의 비순환적 지표를 제안한다.

원저자: George Andrikopoulos

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: George Andrikopoulos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 전문가들이 코드를 작성하고 문제를 해결하며 텍스트를 생성하는 기계를 판단하는 방식을 바꾸는 조용한 혁명이 일어나고 있습니다. 수년 동안 업계는 단 하나의 질문에 집중해 왔습니다. '이 모델은 얼마나 똑똑한가?' 연구자들은 기계가 만들어낼 수 있는 최선의 답변이나 테스트에서의 평균 점수를 통해 이를 측정해 왔습니다. 이 접근 방식은 모델이 단 한 번이라도 정답을 맞힐 수 있다면 그것을 성공으로 간다고 가정합니다. 하지만 이 도구들을 실제 엔지니어링 작업에 사용하려는 사람들에게 있어, 이 지표는 가장 결정적인 요소를 놓치고 있습니다. 절반의 시간에는 완벽하게 작동하지만 나머지 절반에는 처참하게 실패하는 도구는, 그 최고의 순간들이 아무리 찬란할지라도 신뢰할 수 있는 시스템을 구축하는 데 있어서는 무용지물입니다. 새로운 개척지는 기계가 얼마나 높이 뛰어오를 수 있느냐가 아니라, 얼마나 일관되게 발을 착지시키느냐에 관한 것입니다. 이러한 변화는 가공되지 않은 능력(raw capability)에서 정밀도(precision)로 초점을 옮기며, 단순히 기계가 그 일을 할 수 있는지뿐만 아니라, 매번 요청될 때마다 동일한 방식으로 그 일을 수행할 수 있는지를 묻습니다.

런던에 기반을 둔 독립 연구자인 조지 안드리카풀로스(George Andrikopoulos)는 현재 인공지능 시스템을 비교하는 방식이 잘못된 것을 측정하고 있다고 주장합니다. 그는 가장 진보된 모델들이 매우 정확해졌지만(즉, 평균적인 출력이 목표에 도달하지만), 아직 정밀해지지는 않았다고 제안합니다. 여기서 정밀도란 동일한 요청이 반복될 때 결과가 얼마나 촘촘하게 모여 있는지를 의미합니다. 기계에게 특정 엔지니어링 문제를 열 번 풀어보라고 요청한다고 상상해 보십시오. 정밀한 시스템은 아홉 번 혹은 열 번 모두 정확하고 합리적인 답을 내놓을 것입니다. 반면 불정밀한 시스템은 다섯 번은 정답을 낼 수도 있지만, 나머지 다섯 번은 기괴하거나, 망가지거나, 혹은 완전히 관련 없는 것을 내놓을 수 있습니다. 업계는 현재 '최선의 한 방'을 축하하고 있지만, 이 도구들로 무언가를 만드는 사람들에게 필요한 것은 '집단(the group)'의 모습입니다. 만약 총알이 흩어져 있다면, 집단의 중심이 아무리 좋아도 그 도구는 신뢰할 수 없는 것입니다.

이를 해결하기 위해 안드리카풀로스는 복잡하고 순환적인 채점 시스템에 의존하지 않고도 이러한 일관성을 측정할 수 있는 간단한 방법을 개발했습니다. 다른 인공지능에게 작업을 판단하게 하는 대신(이는 그 자체로 오류를 유입시킬 수 있습니다), 그는 명확한 이진 결과(binary outcome)를 가진 과업을 사용합니다. 즉, 코드가 컴파일되는가, 테스트를 통과하는가, 혹은 파일 형식이 올바르게 확인되는가와 같은 것들입니다. 이것들은 추측 없이 컴퓨터에 의해 검증될 수 있는 사실들입니다. 이 과정은 이러한 검증 가능한 과업들의 작은 세트를 가져와서, 매번 모델의 새로운 인스턴스(fresh instance)에서 여러 번 실행하는 것을 포함합니다. 모델이 성공하는 횟수와 실패하는 횟수를 세어봄으로써, 연구자들은 결과의 형태를 볼 수 있습니다. 만약 모델이 매번 통과하거나 매번 실패한다면, 그것은 정밀한 것입니다. 만약 절반은 통과하고 절반은 실패한다면, 그것은 흩어져 있고 예측 불가능한 것입니다.

이 논문은 이러한 측정치를 바탕으로 명확한 결정 규칙을 제시합니다. 만약 모델이 일관된 방식으로 실패한다면, 그것은 중심에서 약간 벗어나 있을 뿐인 '촘촘한 집단(tight group)'입니다. 이는 좋은 문제인데, 왜냐하면 인간 운영자가 특정 규칙을 작성하여 그 실수를 바로잡음으로써, 기계의 '조준경을 영점 조절(zeroing the sights)'하는 효과를 낼 수 있기 때문입니다. 그러나 만약 모델이 여러 가지 방식으로 실패한다면, 그 집단은 흩어져 있는 상태입니다. 이 경우, 어떤 규칙을 써도 도움이 되지 않는데, 오류가 무작위적이기 때문입니다. 흩어진 집단에 대한 유일한 해결책은 모델 자체를 바꾸거나 결과물을 생성하는 방식을 조정하는 것입니다. 이러한 구분은 엔지니어가 기계에 대한 지침을 쓰는 데 시간을 보낼지, 아니면 단순히 다른 기계로 교체해야 할지를 알려준다는 점에서 매우 중요합니다.

이 방법의 위력을 보여주는 실제 사례 테스트가 있습니다. 연구자들은 특정 코딩 과업 세트를 가져와 선도적인 모델에 아무런 특별한 지침 없이 다섯 번 실행했습니다. 그 모델은 특정 검증 과업을 매번 통과하는 데 실패했습니다. 모델이 매번 정확히 같은 방식으로 실패했기 때문에, 연구자들은 이것이 무작위적인 결함이 아니라 일관된 오류라는 것을 알 수 있었습니다. 그들은 실패를 분석했고, 기계가 너무 큰 숫자를 다룰 때 특정한 논리적 실수를 저지르고 있다는 것을 발견했습니다. 그들은 이 논리를 수정하기 위한 단 하나의 간단한 규칙을 작성했습니다. 그리고 새 규칙을 적용하여 동일한 다섯 가지 과업을 다시 실행했을 때, 모델은 매번 통과했습니다. 성공률은 0에서 100퍼센트로 급등했습니다. 이는 기계가 충분히 정밀하여 수정 가능하다는 것을 증명했습니다. 단지 조준경을 조정할 필요가 있었을 뿐입니다.

또한 이 연구는 작성된 규칙들로 이러한 시스템을 얼마나 개선할 수 있는지에 대한 놀라운 한계를 드러냈습니다. 연구자들은 자신들이 작성한 규칙들을 바탕으로 새로운 테스트 과업 세트를 만들어, 그 규칙들이 얼마나 많은 가치를 더하는지 측정하고자 했습니다. 그들은 가장 진보된 모델들이 이미 이러한 좋은 관행들을 별도의 지시 없이도 자연스럽게 따르고 있다는 것을 발견했습니다. 모델들은 추가 지시 없이도 이러한 '규칙 기반' 테스트를 완벽하게 통과했습니다. 이는 가장 흔한 오류들에 대해서는 기계가 이미 스스로 훈련을 마쳤음을 의미합니다. 따라서 규칙 책(rulebook)의 진정한 가치는 기계에게 이미 알고 있는 것을 가르치는 데 있는 것이 아니라, 기계가 여전히 흩어지거나 일관되게 실패하는 드물고 숨겨진 틈새를 찾아내는 데 있습니다. 이러한 틈새는 미리 예측할 수 없으며, 기계의 실제 작업량을 측정함으로써 발견되어야 합니다.

궁극적으로, 이 연구는 인공지능에 대한 대화를 '누가 더 똑똑한가'의 경쟁에서 '누가 더 신뢰할 수 있는가'에 대한 실질적인 평가로 바꿉니다. 업계는 수년간 모델의 정점 성능에 따라 순위를 매기는 리더보드를 구축해 왔지만, 그러한 순위는 사용자에게 그 도구가 특정 프로젝트에 적합할지를 알려주지 않습니다. 집단의 촘촘함을 측정함으로써, 엔지니어들은 어떤 모델을 사용할지, 그리고 어디에 시간을 투자할지에 대해 정보에 입각한 결정을 내릴 수 있습니다. 만약 모델이 정밀하지만 목표에서 약간 벗어나 있다면, 인간은 규칙을 통해 이를 고칠 수 있습니다. 만약 흩어져 있다면, 어떤 규칙도 구원할 수 없습니다. 이 기계들과 함께 일하는 미래는 완벽한 하나의 답을 찾는 것이 아니라, 답의 패턴을 이해하고, 언제 조준경을 조정해야 하며 언제 소총을 바꿔야 하는지를 아는 것에 달려 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →