Using predictive multiplicity to measure individual performance within the AI Act
이 논문은 유사한 정확도를 가지면서도 개별 예측은 상충하는 여러 모델의 존재인 예측 다중성(predictive multiplicity)이 고위험 시스템에 대한 EU AI 법의 요구 사항과 모순된다고 주장하며, 준수와 신뢰성을 보장하기 위해 이러한 불일치를 정량화하고 공개할 수 있는 구체적인 지표와 보고 가이드라인을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 대출을 신청하거나, 직장을 구하거나, 혹은 의료 처치를 받는다고 상상해 보십시오. 당신은 결정권을 쥔 컴퓨터 시스템이 진실을 완벽하게 보는 수정구슬이기를 바랍니다. 하지만 만약 그 수정구슬이 단 하나의 물체가 아니라면 어떨까요? 만약 그것이 동일한 회사에서 만들어졌고, 모두 95%의 정확도를 가진다고 주장하지만, 당신의 구체적인 상황에 대해서는 저마다 조금씩 다른 이야기를 하는 서로 다른 수정구슬들이 담긴 상자라면 어떨까요?
이것이 바로 논문 **"AI 법(AI Act) 내에서의 개인별 성능 측정을 위한 예측 다중성(Predictive Multiplicity) 활용"**이 다루는 핵심 문제입니다. 여기 그들의 논거를 일상적인 비유를 사용하여 쉽게 풀어낸 요약이 있습니다.
1. 문제점: "라쇼몽(Rashomon)" 효과
AI의 세계에는 **예측 다중성(Predictive Multiplicity)**이라는 현상이 존재합니다. 이것은 마치 여러 명의 전문가 판사가 동일한 사건 파일을 검토하는 것과 같습니다.
- 시나리오: 당신에게 100명의 전문가 판사가 있습니다. 그들은 사례의 90%에 대해 의견이 일치합니다. 그들은 전체적으로 모두 "정확"합니다.
- 반전: 하지만 그들이 당신의 특정 사례를 볼 때, 50명의 판사는 "예"라고 하고, 나머지 50명은 "아니오"라고 합니다.
- 현실: 단 하나의 "최선"의 모델이 존재하지 않기 때문에, AI 제공자는 자신의 도구 상자에서 당신에게 정반대의 결과를 줄 수도 있었던, 그러나 전체적으로는 똑같이 "정확한" 다른 모델을 아주 쉽게 선택할 수 있었습니다.
저자들은 이러한 **자의성(arbitrariness)**이 위험하다고 주장합니다. 만약 당신의 삶이 그 결정에 달려 있다면, "똑같이 좋은" 모델들 중 컴퓨터가 우연히 어떤 것을 선택했는지는 중요하지 않아야 합니다. 만약 모델들이 당신에 대해 의견이 갈린다면, 그 시스템은 당신의 사례에 대해 사실상 동전 던지기를 하고 있는 셈입니다.
2. 법률: EU AI 법 (EU AI Act)
이 논문은 이 문제를 고위험 AI(채용, 의료, 대출 등)를 규제하는 새로운 유럽 법안인 EU AI 법의 관점에서 살펴봅니다.
- 요구 사항: 이러한 AI 시스템을 구축하는 기업은 시스템이 정확하다는 것을 증로해야 합니다.
- 공백: 보통 기업들은 단순히 "우리 시스템은 전체 데이터셋에 대해 90%의 정확도를 가집니다"라고 말합니다.
- 논문의 통찰: 법은 실제로 제공업체가 집단 평균이 아닌 특정 개인에 대해 보고할 것을 요구합니다. 저자들은 만약 여러 개의 "좋은" 모델들이 특정 개인에 대해 서로 의견이 다르다면, 전체 점수가 아무리 좋아 보이더라도 그 시스템은 해당 개인에게 신뢰할 수 없는 것이라고 주장합니다.
3. 해결책: "불일치" 측정하기
이를 해결하기 위해 저자들은 성능을 측정하는 새로운 방법을 제안합니다. 단순히 "모델이 맞는가?"라고 묻는 대신, **"다른 좋은 모델들이 이 모델과 얼마나 불일치하는가?"**라고 묻습니다.
그들은 이를 측정하기 위해 두 가지 간단한 도구(지표)를 도입합니다.
갈등 비율 (Conflict Ratio - "줄다리기 계측기"):
당신의 특정 사례를 두고 줄다리기를 한다고 상상해 보십시오. 100개의 모델이 줄을 당기고 있다면, 몇 개가 "예"를 당기고 있고 몇 개가 "아니오"를 당기고 있습니까?- 99개가 "예"를 당기고 1개가 "아니오"를 당긴다면, 갈등이 적습니다. 당신은 "예"라는 결과를 믿을 수 있습니다.
- 50개가 "예"를 당기고 50개가 "아니오"를 당긴다면, 갈등이 최대치에 달합니다. 시스템이 당신에 대해 혼란을 느끼고 있는 것입니다.
- 목표: 갈등 비율이 높다면, 시스템은 컴퓨터가 결정하게 두는 대신 사람에게 검토를 요청하도록 표시(flag)를 해야 합니다.
-모호성 (-Ambiguity - "혼란 카운트"):
이것은 전체 집단 내에서 이러한 "혼란스러운" 상태에 있는 사람이 얼마나 많은지 세는 방법입니다. 이는 기업이 자신의 시스템이 전반적으로 신뢰할 수 있는지, 아니면 상당 부분의 사람들에게 엉망인지 파악하는 데 도움을 줍니다.
4. 실행 방법: "애드혹(Ad-Hoc)" 접근법
당신은 이렇게 생각할지도 모릅니다. "이 모든 다른 모델들을 찾으려면 수백만 개를 테스트해야 하나요?" 그러면 시간이 너무 오래 걸릴 것입니다.
저자들은 영리한 지름길을 찾아냈습니다. 모든 가능한 모델을 테스트할 필요는 없습니다. 대신 다음과 같이 프로세스에 아주 작은 무작위 변화를 주어 소수의 모델을 훈련시키기만 하면 됩니다.
- 데이터의 순서를 약간 변경하기.
- 숫자에 아주 작은 "노이즈"(무작위성) 추가하기.
- 약간 다른 설정값 사용하기 (예: 가스레인지의 온도를 조절하듯).
그들은 이를 테스트했고, 이런 방식으로 훈련된 소수의 모델만으로도 시스템이 어디에서 혼란을 겪고 있는지 밝혀내기에 충분하다는 것을 발견했습니다. 이것은 마치 몇 명의 서로 다른 요리사에게 재료를 약간씩 다르게 하여 같은 요리를 만들게 하는 것과 같습니다. 만약 그들이 맛에 대해 모두 동의한다면 괜찮지만, 서로 다투기 시작한다면 무언가 문제가 있다는 것을 알 수 있습니다.
5. 권고 사항: 제작자와 사용자의 악수
논문은 AI 법이 실제 현장에서 어떻게 작동해야 하는지에 대한 실질적인 제안으로 결론을 맺습니다.
- AI 제작자(Providers)를 위하여: 단 하나의 "블랙박스" 모델만 건네주지 마십시오. 시스템을 사용하는 사람들(배포자, Deployers)에게 똑같이 좋은 여러 개의 모델이 담긴 "도구 상자"를 제공하십시오.
- AI 사용자(Deployers)를 위하여: 개인에 대한 최종 결정을 내리기 전에 "갈등 비율"을 확인하십시오.
- 낮은 갈등: 모델들이 일치합니다. 자동화된 결정을 진행해도 좋습니다.
- 높은 갈등: 모델들이 싸우고 있습니다. 멈추십시오. 인간이 최종 결정을 내리도록 하십시오.
요약
이 논문은 정확도란 단순한 숫자가 아니라 일관성에 대한 이야기라고 주장합니다. 만약 AI 시스템이 당신에 대해 스스로 일치된 의견을 내놓지 못한다면, 인간이 옆에서 지켜보지 않는 한 당신의 인생을 바꿀 결정을 내리도록 허용해서는 안 됩니다. 서로 다른 "좋은" 모델들이 얼마나 불일치하는지를 측정함으로써, 우리는 새로운 유럽 법률 아래에서 AI를 더 안전하고 신뢰할 수 있게 만들 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.