Benchmarking Open-Weight Foundation Models for Global AI Technical Governance
본 연구는 검증된 정답 데이터셋(GAID v2)을 사용하여 4개의 오픈 웨이트 파운데이션 모델을 벤치마킹하고, 227개국에 걸친 모델 성능의 격차를 정확하게 측정 및 분석하기 위해 정교화된 5개 범주 응답 분류 체계를 활용함으로써, AI의 지리적 편향에 관한 기존 연구의 방법론적 한계를 다룬다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑하고 박학다식한 네 명의 사서(AI 모델)가 있다고 상상해 보세요. 당신은 그들에게 전 세계 국가들이 인공지능(AI) 분야에서 어떻게 하고 있는지에 대해 백만 개의 질문을 던집니다. 당신은 그들이 진실을 말하고 있는지, 아니면 그저 자신감 있게 보이기 위해 말을 지어내고 있는 것인지 알고 싶습니다.
이 논문은 그 사서들에 대한 성적표입니다. 특히 그들이 특정 국가에 대해 편향되어 있는지, 아니면 단순히 특정 유형의 사실에 대해 혼동을 일으키는 것인지를 확인합니다.
다음은 연구 결과의 내용을 이해하기 쉽게 정리한 내용입니다.
1. 설정: "진실" 대 "추측"
연구진은 실제 227개국의 수치를 담고 있는 거대한 검증된 "정답지"(Global AI Dataset이라고 불림)를 가지고 있었습니다. 연구진은 이 정답지의 구체적인 숫자들을 AI 모델들에게 알려달라고 요청했습니다.
- 목표: AI가 숫자를 제대로 맞히는지 확인하는 것입니다.
- 문제점: 때때로 AI는 답을 모를 때 "모릅로"라고 말하는 대신, 자신 있게 숫자를 지어내곤 합니다. 이것을 환각(Hallucination, 또는 이 논문에서는 "자신감 있는 조작(Confident Fabrication)")이라고 부릅니다.
2. 큰 반전: "글로벌 사우스(Global South)"가 오히려 손해를 보지 않았다
보통 사람들은 AI가 주로 부유한 영어권 국가(미국이나 영국 등)의 데이터로 학습되었기 때문에 편향되어 있다고 생각합니다. 흔한 믿음은 AI가 가난한 국가들(글로벌 사우스)에 대해 아는 것이 적기 때문에 그들에 대해 더 많은 거짓말을 할 것이라는 점입니다.
하지만 결과는 정반대였습니다!
- AI는 가난한 국가들보다 부유한 국가들에 대해 더 많은 거짓말을 했습니다.
- 이유는 무엇일까요? 이렇게 생각해 보세요. 만약 당신이 사서에게 "이 작은 해변에 모래알이 몇 개 있나요?"라고 묻고 사서가 "500개"라고 답한다면, 그 근사치는 어느 정도 맞을 수 있습니다. 하지만 "이 거대한 사막에는 모래알이 몇 개 있나요?"라고 물었을 때 사서가 "500개"라고 답한다면, 그것은 터무니없는 오답입니다.
- 부유한 국가들은 엄청난 숫자들(수백만 개의 특허, 수십억 달러의 컴퓨팅 파워 등)을 가지고 있습니다. AI가 거대한 숫자를 정확하게 맞히는 것은 작은 숫자를 맞히는 것보다 훨씬 어렵습니다. 그래서 AI가 부유한 국가들의 큰 숫자를 지어내다가 더 자주 "들통"이 난 것입니다.
- 참고: 이것이 AI가 가난한 국가들에 대해 모든 것을 안다는 뜻은 아닙니다. 단지 부유한 국가들에 대한 "정답지"의 숫자들이 훨씬 크고 추측하기 어려웠을 뿐입니다.
3. "안전"의 함정: AI는 수학에 형편없다
연구진은 AI에게 "이 모델을 훈련하는 데 사용된 컴퓨팅 파워는 얼마인가?" 또는 "이 모델의 파라미터 수는 몇 개인가?"와 같은 구체적이고 어려운 숫자에 대해 질문했습니다.
- 결과: AI는 거의 완전히 실패했습니다. 이러한 "안전(Safety)" 관련 질문에 대해 98%의 확률로 숫자를 지어냈습니다.
- 비유: 이것은 마치 요리사에게 "이 수프에 소금이 정확히 몇 밀리그램 들어있나요?"라고 묻는 것과 같습니다. 그러면 요리사는 멋져 보이는 숫자를 그냥 대충 지어낼 뿐입니다.
- 교훈: 만약 컴퓨터 칩의 정확한 크기나 슈퍼컴퓨터의 성능을 알아야 한다면, 이 AI들을 믿지 마십시오. 그들은 추측하고 있는 것입니다.
4. "예/아니오"의 성공: AI는 단순한 사실에는 강하다
연구진이 "이 국가는 국가 AI 전략을 발표했습니까?"와 같이 간단한 "예/아니오" 질문을 던졌을 때를 살펴보았습니다.
- 결과: AI는 훨씬 더 잘했습니다. 정답을 맞힐 확률이 약 42%였는데, 이는 AI에게 매우 높은 수치입니다!
- 이유: "14,502개의 특허"와 같은 구체적인 숫자를 지어내는 것보다 "예" 또는 "아니오"를 기억하는 것이 훨씬 쉽기 때문입니다.
5. 사서 비교: 누가 가장 뛰어난가?
연구진은 네 명의 서로 다른 "사서"(AI 모델)를 테스트했습니다.
- Mistral (프랑스): 전체적으로 가장 정확함.
- DeepSeek (중국): 두 번째로 우수함.
- Qwen (중국): 세 번째.
- Llama (미국): 거짓말을 가장 많이 함.
흥미롭게도, 사서의 출신이 미국, 유럽, 혹은 중국인지 여부는 크게 중요하지 않았습니다. 그들은 모두 거의 비슷한 비율로 거짓말을 했습니다. AI의 "국적"이 결과에 큰 영향을 미치지는 않았습니다.
6. "모른다"고 말하지 못하는 문제
연구진은 AI가 답을 모를 경우, 정중하게 "잘 모르겠습니다"라고 말하기를 기대했습니다.
- 현실: AI는 거의 절대로 모른다고 말하지 않았습니다. 심지어 완전히 추측하고 있을 때조차도, 그들은 100% 확신에 찬 어조로 대답했습니다.
- 위험성: 이것은 시험을 치르는 학생이 모든 문제에 답을 추측해서 쓰면서도, 아주 크고 굵은 글씨로 답을 적어놓는 것과 같습니다. 그 학생이 똑똑한 것인지 아니면 그저 운이 좋은 것인지 구분할 방법이 없습니다.
7. 더 나은 질문을 하는 법
연구진은 질문을 어떻게 하느냐에 따라 결과가 달라진다는 것을 발견했습니다.
- 나쁜 방식: "국가 X의 AI 특허 수는 정확히 몇 개인가?" (AI는 숫자를 지어냅니다).
- 더 나은 방식: "국가 X의 특허 수는 해당 지역의 평균과 비교했을 때 어떠한가?"
- 결과: 구체적인 숫자 대신 비교를 요청할 때, AI는 거짓말을 덜 합니다. 이것은 "이 해변에는 모래알이 몇 개 있나요?"라고 묻는 대신 "이 해변이 저 해변보다 더 큰가요?"라고 묻는 것과 같습니다.
결론
만약 당신이 세계를 이해하기 위해 AI를 활용하려는 정부 관료나 연구자라면:
- 숫자를 믿지 마십시오: AI가 AI 파워나 특허에 대해 구체적인 숫자를 준다면, 반드시 사람을 통해 확인하십시오. 그것은 자신감 있게 내뱉은 추측일 가능성이 높습니다.
- 그들은 "안전" 수학에 약합니다: 그들은 얼마나 많은 컴퓨팅 파워가 사용되고 있는지 알려줄 수 없습니다.
- "예/아니오"는 괜찮습니다: 그들은 법의 구체적인 세부 사항을 말하는 것보다 특정 법이 존재하는지 여부를 말하는 데 더 능숙합니다.
- 그들은 무지를 인정하지 않습니다: 그들은 거짓말을 하고 있을 때조차 항상 답변을 내놓을 것입니다.
이 논문은 이러한 AI 모델들이 매우 인상적이긴 하지만, 현재로서는 글로벌 AI 거버넌스에 관한 정밀한 사실을 수집하는 데 있어 신뢰할 수 없는 도구라고 결론짓습니다. 데이터 검증을 위해서는 여전히 인간 전문가가 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.