Flaws in the LLM Automation Narrative
이 논문은 새로운 코딩 벤치마크를 통해 인간이 평균 정확도와 일관성 모두에서 최첨단 거대언어모델(LLM)보다 우수함을 입증함으로써, 거대언어모델이 인간 전문가의 성능에 부합한다는 서사에 도전하며, 단순히 표준 벤치마크에만 의존하기보다 오류의 크기와 응답의 분산을 평가하는 것이 매우 중요하다는 점을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: "완벽한 학생" vs. "현실 세계"
모든 기출문제의 정답지를 통째로 외워버린 한 학생을 상상해 보세요. 그 특정 시험들에서 이 학생은 매번 100점을 받습니다. 학교 행정가들(그리고 이 학생의 서비스를 판매하는 기술 기업들)은 이 학생이 모든 교사와 의사를 대체할 수 있는 천재라고 주장합니다.
이 논문은 이 학생이 사실 사기꾼이라고 주장합니다. 이 학생이 똑똑해 보이는 이유는 단지 문제를 이미 봤기 때문입니다. 만약 당신이 이 학생에게 본 적 없는 새로운 까다로운 문제를 준다면, 학생은 단순히 작은 실수를 하는 데 그치지 않고, 때로는 재앙적인 오류를 범하며 극도로 일관성 없는 모습을 보일 것입니다.
실험: 반전이 있는 요리 경연 대회
이를 테스트하기 위해 연구진은 독특한 "요리 경연 대회"를 설정했습니다.
- 도전 과제: 연구진은 특정 진실(맛)을 찾기 위해 7,700개의 서로 다른 데이터 세트(재료)를 분석하는 컴퓨터 프로그램(레시피)을 작성해야 했습니다.
- 규칙: 참가자들은 사전에 실제 데이터를 볼 수 없었습니다. 오직 서면으로 된 지침서만 제공되었습니다. 이는 "학생들"이 답을 단순히 암기하는 것을 방지하기 위함이었습니다.
- 참가자:
- 인간 전문가: 박사급 통계학자 팀 (마스터 셰프).
- AI: ChatGPT Codex 5.2라는 이름의 최상위 대규모 언어 모델 (로봇 셰프).
- AI의 전략: 연구진은 AI가 일관성을 유지할 수 있는지 확인하기 위해, 동일한 문제를 해결하는 20개의 서로 다른 "레시피(스크립트)"를 작성하도록 요청했습니다.
발견한 사실: "처참하게 타버린 요리"
결과는 충격적이었습니다. AI가 가끔 괜찮은 요리를 만들어내기도 했지만, 인간은 절대 저지르지 않는 방식으로 실패했습니다.
1. "새카맣게 타버린 문제" (오류의 규모)
일반적인 시험에서 문제를 틀리면 점수를 조금 잃을 뿐입니다. 하지만 이 경연 대회에서 AI는 단순히 점수를 잃는 데 그치지 않았습니다. 때때로 주방 전체에 불을 질렀습니다.
- 비유: 인간 요리사가 수프에 소금을 아주 조금 더 넣었다고 가정해 봅시다. 그것은 작은 실수입니다. 그러나 AI는 때때로 바다 전체를 채울 만큼의 소금을 넣거나, 더 심하게는 재료 데이터베이스 전체를 삭제해 버렸습니다.
- 실제 상황: AI가 만든 스크립트 중 일부는 인간이 저지르는 오류보다 수십억 배나 더 큰 오류를 생성했습니다. 논문은 한 사례에서 AI의 오류가 "1,000억 표준 편차"와 맞먹는다고 언급했습니다. 이해를 돕기 위해 설명하자면, 과학계에서는 0.8 정도의 차이를 "큰" 효과로 간주합니다. 그런데 AI는 수십억 배의 차이를 냈습니다.
2. "롤러코스터" 문제 (변동성)
인간 전문가에게 동일한 문제를 20번 풀도록 요청하면, 그들의 답변은 매우 유사할 것입니다. 즉, 그들은 신뢰할 수 있습니다.
- 비유: 인간 요리사에게 케이크를 20번 만들어 달라고 하면, 약간씩 다른 20개의 케이크를 만들 수는 있겠지만 모두 먹을 수 있는 케이크일 것입니다. 만약 AI 셰프에게 같은 케이크를 20번 만들라고 한다면, 다음과 같은 결과가 나올 수 있습니다:
- 10개는 완벽한 케이크.
- 5개는 그냥 생밀가루 덩어리.
- 3개는 불타고 있는 케이크.
- 2개는 사실 케이크 사진.
- 실제 상황: AI의 성능은 믿을 수 없을 정도로 불안정했습니다. 어떤 스크립트는 잘 작동했지만, 바로 다음 스크립트(몇 초 뒤에 생성된 것)는 완전히 실패했습니다. 이러한 "확률적 특성(stochasticity, 무작위성)"은 당신이 AI에게 똑같은 일을 두 번 연속으로 맡길 수 없음을 의미합니다.
3. "부정행위" 문제 (벤치마크 오염)
이 논문은 대부분의 AI 테스트가 조작되었다고 주장합니다.
- 비유: 이는 학생의 수학 능력을 테스트하면서, 학생이 공부할 때 사용했던 것과 똑같은 종이에 인쇄된 시험지를 사용하는 것과 같습니다. 학생은 A를 받겠지만, 수학을 배운 것이 아니라 시험지를 외운 것뿐입니다.
- 실제 상황: 많은 인기 있는 AI 벤치마크는 AI가 훈련 과정에서 이미 본 질문들을 사용합니다. 연구진이 AI가 보지 못했을 가능성이 높은 "깨끗한" 테스트(2016년 경연 대회 데이터)를 사용했을 때, AI의 성능은 인간에 비해 현저히 떨어졌습니다.
결론: 대체제가 아닌, 위험한 도구
이 논문은 "AI가 인간 전문가만큼 뛰어나다"는 서사가 두 가지 중요한 사실을 간과하고 있기 때문에 잘못되었다고 결론짓습니다.
- 실수의 질: 인간은 작고 관리 가능한 실수를 합니다. AI는 시스템을 파괴할 수 있는 거대하고 "종말론적인" 오류를 범합니다.
- AI의 일관성: 인간은 신뢰할 수 있습니다. AI는 도박입니다.
핵심 요점:
연구진은 AI가 때때로 인간 전문가를 흉내 낼 수는 있지만(특히 인간이 제공한 사전 제작 도구를 사용할 때), 스스로 일관되게 업무를 수행할 수는 없다는 것을 발견했습니다. 고위험 과업에 AI를 의존하는 것은, 햇빛이 쨍한 날에는 운전을 잘하지만 가끔 아무 이유 없이 절벽으로 차를 몰고 가버리는 운전자를 고용하는 것과 같습니다.
이 논문은 AI가 쓸모없다고 말하는 것이 아닙니다. 현재의 열풍은 AI가 얼마나 불안정하고 예측 불가능한 거대한 실패를 일으키기 쉬운지, 즉 AI가 위험한 도구라는 사실을 간과하고 있다는 점을 지적합니다. 따라서 금융, 법률, 의료와 같은 중요한 분야에서 AI를 인간 전문가의 완전한 대체제로 사용하는 것은 위험합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.