← 최신 논문
🤖 AI

Is your AI Model Accurate Enough? The Difficult Choices Behind Rigorous AI Development and the EU AI Act

이 논문은 정확도가 순수한 기술적 속성이 아니라 맥락에 따른 규범적 선택에 의존한다는 점을 강조하며, EU AI 법의 '적절한 정확도' 요구사항을 분석함으로써 개발자와 규제 기관이 기술적 구현과 법적 안전 기준을 연결하는 데 필요한 구체적인 지침을 제시합니다.

원저자: Lucas G. Uberti-Bona Marin, Bram Rijsbosch, Kristof Meding, Gerasimos Spanakis, Gijs van Dijck, Konrad Kollnig

게시일 2026-04-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lucas G. Uberti-Bona Marin, Bram Rijsbosch, Kristof Meding, Gerasimos Spanakis, Gijs van Dijck, Konrad Kollnig

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 이 정말로 '충분히' 정확한지 어떻게 알 수 있을까?"**라는 질문에서 출발합니다.

우리는 보통 AI 가 "99% 정확하다"라고 하면 무조건 믿고 안심합니다. 하지만 이 논문은 **"그 99% 라는 숫자 뒤에 숨겨진 복잡한 선택들이 실제로는 매우 위험할 수 있다"**고 경고합니다. 특히 유럽연합 (EU) 이 새로 만든 'AI 법 (AI Act)'이 고위험 AI 에게 "적절한 수준의 정확성"을 요구하는데, 이 '적절한 수준'이 무엇인지 정의하는 과정이 단순한 기술 문제가 아니라 우리가 어떤 실수를 용인할지, 어떤 위험을 감수할지 결정하는 윤리적 선택임을 밝힙니다.

이 복잡한 내용을 4 가지 핵심 선택비유를 통해 쉽게 설명해 드릴게요.


🎒 비유: "나쁜 모자 (악성 흑색종) 찾기 게임"

이 논문은 피부암 (흑색종) 을 찾아주는 AI 앱을 예로 듭니다. 이 앱은 피부의 점 (모반) 을 보고 "이건 암이다"라고 알려줘야 합니다.

1. 첫 번째 선택: "어떤 점수를 잴 것인가?" (지표 선택)

  • 상황: 우리는 AI 의 실력을 측정해야 합니다. 보통은 "맞춘 횟수 / 전체 횟수"인 **정확도 (Accuracy)**를 봅니다.
  • 문제: 피부암은 아주 드뭅니다. 100 명 중 99 명은 암이 없고 1 명만 암입니다.
    • 만약 AI 가 **"모든 사람은 암이 아니다"**라고 100% 확신하며 말하면, 99 명은 맞고 1 명만 틀립니다. **정확도는 99%**가 됩니다!
    • 하지만 이 AI 는 진짜 암 환자 1 명을 놓쳤습니다. 이는 치명적입니다.
  • 핵심: "정확도"라는 숫자 하나만 보면 AI 가 훌륭해 보이지만, 어떤 실수 (암을 놓치는 것 vs 건강한 사람을 불안하게 하는 것) 를 더 중요하게 생각할지에 따라 점수 계산 방식 (지표) 을 바꿔야 합니다.
    • 비유: 시험에서 100 점 만점에 99 점을 맞았지만, 가장 중요한 1 문제 (암 환자 식별) 를 틀렸다면 그 학생은 합격할 수 없습니다. 어떤 문제를 '핵심 문제'로 볼지 정하는 것이 첫 번째 선택입니다.

2. 두 번째 선택: "점수들을 어떻게 섞을 것인가?" (지표 균형)

  • 상황: 우리는 '암을 놓치지 않는 것 (재현율)'과 '건강한 사람을 헛되이 걱정시키지 않는 것 (정밀도)' 두 가지를 모두 원합니다. 하지만 둘 다 완벽하게 잡기는 어렵습니다.
  • 문제: 이 두 가지를 어떻게 섞어서 하나의 점수로 만들까요?
    • "암을 놓치는 것"을 더 중요하게 여겨 점수를 매길까요? 아니면 "불필요한 검사"를 줄이는 것을 더 중요하게 여길까요?
    • 이걸 섞는 공식 (예: F 점수) 을 정하는 순간, 우리가 어떤 위험을 더 감수할지 결정한 것입니다.
  • 핵심: 점수 하나를 합치는 방식 자체가 "우리는 이쪽 실수를 더 용납한다"는 뜻입니다.

3. 세 번째 선택: "시험지를 누구에게 줄 것인가?" (데이터 측정)

  • 상황: AI 의 실력을 시험해 볼 때, 어떤 사람들로 구성된 시험지를 주어야 할까요?
  • 문제: 만약 시험지가 주로 '젊은 백인 남성'으로만 이루어져 있다면, AI 는 그들에게는 잘 작동하지만, '어떤 피부색의 여성'에게는 엉망이 될 수 있습니다.
  • 핵심: 시험 대상 (데이터) 을 어떻게 뽑느냐에 따라 AI 의 실력이 다르게 보입니다. 특정 인종이나 성별이 빠진 시험지는 그들에게는 공정한 시험이 아닙니다. 이는 "누구의 안전을 먼저 보장할 것인가"라는 윤리적 선택입니다.

4. 네 번째 선택: "몇 점 이상이어야 합격인가?" (기준선 설정)

  • 상황: 이제 AI 가 몇 점인지 알았습니다. 몇 점 이상이면 배포 (출시) 해도 될까요?
  • 문제:
    • "의사보다 조금만 나으면 되나?"
    • "의사보다 훨씬 잘해야 하나?"
    • "의사보다 못해도, 의사보다 더 빠르다면 괜찮은가?"
  • 핵심: 이 **합격 기준선 (Threshold)**을 어디에 그을지는 기술적인 계산이 아니라, **"우리가 얼마나 많은 생명을 잃을 용의가 있는가"**를 결정하는 정치적/윤리적 선택입니다. 기준선을 낮게 잡으면 더 많은 사람이 위험에 노출될 수 있습니다.

💡 이 논문이 말하고자 하는 결론

1. "정확성"은 숫자가 아니라 선택입니다.
AI 가 "충분히 정확한가"를 판단하는 것은 단순히 점수를 보는 게 아닙니다. 개발자와 규제 기관이 **"어떤 실수를 용인할지, 누구의 안전을 최우선으로 할지"**를 끊임없이 선택하는 과정입니다.

2. EU AI 법의 딜레마
EU 는 "적절한 수준의 정확성"을 요구하지만, 구체적인 점수 (예: 95% 이상) 를 정해주지 않았습니다.

  • 이유: 병원용 AI 와 범죄 예측용 AI 는 요구하는 '정확성'의 의미가 완전히 다르기 때문입니다.
  • 위험: 구체적인 숫자가 없으니, 개발자들이 가장 계산하기 쉬운 (하지만 위험한) 방법으로 AI 를 만들어서 법을 우회할 수 있습니다.

3. 우리가 해야 할 일
이제부터는 개발자, 규제 기관, 감사자들이 **"왜 이 점수를 썼는지", "왜 이 기준선을 그었는지"**에 대해 질문해야 합니다.

  • 단순히 "99% 정확합니다"라고 말하는 게 아니라, **"우리는 암 환자를 놓치는 실수를 0.1% 로 줄이기 위해, 건강한 사람을 10% 더 불안하게 하는 것을 선택했습니다"**라고 명확히 설명하고 그 선택에 대한 책임을 져야 합니다.

📝 한 줄 요약

"AI 의 정확성은 마법처럼 자동으로 결정되는 숫자가 아니라, 우리가 어떤 실수를 용인할지 정하는 '윤리적 선택'의 결과물입니다. 이제 우리는 그 선택의 과정을 투명하게 드러내야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →