Position: Every Ground Truth is a Human Construction, not an Objective Truth
이 포지션 페이퍼는 머신러닝의 그라운드 트루스 데이터셋이 객관적 사실이 아니라 인간에 의해 구성된 인공물임을 주장하며, 모델의 신뢰성, 투명성 및 책임성을 향상시키기 위해 "상황적 신뢰성(situated reliability)"을 통해 데이터셋의 우발적 성격을 인정할 것을 옹호한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 "고양이"를 인식하도록 가르치려 한다고 상상해 보세요. 당신은 수천 장의 사진을 보여주며, 각 사진에 대해 "응, 이건 고양이야" 또는 "아니, 이건 개야"라고 말합니다. 머신러닝의 세계에서 당신이 부여하는 이러한 라벨(label)을 **그라운드 트루스(Ground Truth, 지면 진실)**라고 부릅니다.
오랫동안 과학자들은 이 라벨을 마법의 거울처럼 취급해 왔습니다. 그들은 '그라운드 트루스'가 마치 숨겨진 보물 지도를 찾는 것처럼, 발견되기를 기다리고 있는 완벽하고 객관적인 현실의 반영이라고 생각했습니다.
하지만 이 논문은 보물 지도가 숨겨져 있는 것이 아니라, 우리가 직접 그리고 있는 것이라고 주장합니다.
저자인 샬럿(Charlotte), 에리카(Ericka), 키리(Kiri)는 "그라운드 트루스"가 하늘에서 떨어지는 자연적인 사실이 아니라고 말합니다. 그것은 하나의 인간적 구성물입니다. 그것은 바위라기보다는 레시피에 가깝습니다. 요리사가 소금을 얼마나 넣을지, 언제 저을지, 어떤 재료를 사용할지 결정하는 것과 마찬가지로, 인간과 기계는 AI를 훈련시키는 '진실'을 만들기 위해 방대한 일련의 선택들을 수행합니다.
"레시피" 비유
새로운 블렌더를 테스트하기 위해 거대하고 복잡한 스무디를 만드는 과정을 생각해 보세요.
- 과일: 어떤 과일을 살지 결정해야 합니다. 빨간 사과만 살까요, 아니면 초록색 사과도 포함할까요?
- 절단기: 누가 과일을 자를까요? 전문 요리사일까요? 지친 인턴일까요? 아니면 로봇 팔일까요?
- 블렌더: 칼날을 얼마나 빨리 돌릴까요?
- 맛 테스트: 누가 스무디가 "맛있다"고 결정할까요?
논문은 이 단계 중 어느 하나라도 바꾸면 다른 스무디가 나온다는 점을 지적합니다. 만약 당신이 "진실"(스무디 레시피)을 바꾼다면, 블렌더(AI 모델)는 완전히 다른 것을 배우게 됩니다.
왜 이것이 중요한가 ("픽셀" 문제)
저자들은 이것이 왜 중요한지 보여주기 위해 실제 사례를 제시합니다. 컴퓨터에게 손으로 쓴 숫자를 인식하도록 가르치는 데 사용되는 유명한 데이터셋인 MNIST가 있습니다. 1990년대 당시 컴퓨터는 느리고 메모리도 적었기 때문에, 데이터셋을 만든 사람들은 이미지를 128x128 픽셀에서 28x28 픽셀로 줄이기로 결정했습니다.
수십 년 전 내려진 이 한 번의 선택 때문에, 오늘날 수천 개의 AI 모델은 오직 28x28 픽셀 이미지만을 보도록 훈련되어 있습니다. 만약 오늘날 찍은 고화질 숫자 사진을 보여준다면, 그들은 읽지 못할 것입니다! 그들은 당시 사용 가능한 도구에 맞춰 내린 결정 때문에 과거에 갇혀 버린 것입니다. 그들이 배운 "진실"은 실제 숫자 자체가 아니라, 당시의 도구에 의해 제한되었던 것입니다.
"전문가"라는 신화
때때로 우리는 전문가가 항상 절대적인 진실을 알고 있는 **오라클 신(Oracle Gods)**과 같다고 생각합니다. 혹은 전문가가 사실을 기록할 뿐 감정이 없는 로봇 센서와 같다고 생각하기도 합니다.
논문은 이렇게 말합니다: 그렇지 않습니다. 전문가조차 실수를 할 수 있고, 서로 의견이 다를 수 있으며, 사물을 다르게 봅니다.
- 의료 분야에서 두 의사가 같은 X-ray를 보고 한 명은 "건강함"이라고 하는 반면, 다른 한 명은 "질병 있음"이라고 말할 수 있습니다.
- 크라우드 소싱 프로젝트(인터넷을 통해 수천 명의 사람들에게 사진 라벨링을 요청하는 것)에서는, 어떤 사람은 사진이 "행복하다"고 생각하고 다른 사람은 "슬프다"고 생각할 수 있습니다.
우리가 전문가를 완벽한 로봇이라고 가정한다면, 그들의 "진실"이 사실은 그들의 훈련, 기분, 그리고 주어진 규칙에 의해 형성된 인간의 의견이라는 점을 놓치게 됩니다.
"상황적 신뢰성(Situated Reliability)" 개념
저자들은 우리의 AI가 보편적으로 완벽하다고 가정하는 것을 멈추자고 제안합니다. 대신 **"상황적 신뢰성"**에 대해 이야기해야 한다고 말합니다.
이것은 선글라스와 같습니다.
- 선글라스는 밝은 사막의 태양 아래서(특정 맥락) 아주 잘 작동합니다.
- 하지만 어두운 동굴에서는(다른 맥락) 형편없습니다.
- 물속에서는 쓸모가 없습니다.
선글라스가 "고장 난" 것이 아니라, 단지 상황적인 용도가 있는 것입니다. 논문은 AI 모델도 이와 같다고 주장합니다. 특정 "그라운드 트루스"로 훈련된 모델은 한 병원이나 한 도시에서는 완벽하게 작동할 수 있지만, 다른 곳에서는 처참하게 실패할 수 있습니다. 우리는 모델이 어디서나 작동한다고 주장하기보다, 모델이 어디서 그리고 언제 작동하는지에 대해 정직해져야 합니다.
우리는 무엇을 해야 하는가?
이 논문은 "AI 제작을 멈추라"는 말이 아닙니다. 우리가 정직한 설계자가 되어야 한다는 뜻입니다.
- 진실이 마법이라고 속이지 마십시오. 우리가 데이터를 만들기 위해 선택을 했다는 점을 인정하십시오.
- 레시피를 기록하십시오. 데이터셋을 공유할 때, 그것을 어떻게 만들었는지 정확히 설명해야 합니다. 누가 라벨을 붙였습니까? 어떤 도구를 사용했습니까? 무엇을 빠뜨렸습니까?
- 다양한 레시피를 시도하십시오. 단 하나의 "그라운드 트루스" 대신, AI가 어떻게 변하는지 보기 위해 몇 가지 다른 버전을 만들어 보는 것도 좋습니다.
- 협력하십시오. 머신러닝 전문가들은 실제 세상의 지식을 가진 사람들(의사, 생물학자, 사회학자 등)과 소통하여, 그 "진실"이 실제 세상에서 타당한지 확인해야 합니다.
결론
이 논문은 "그라운드 트루스"가 우주의 고정되고 변하지 않는 사실이 아니라고 제안합니다. 그것은 우리의 선택, 우리의 도구, 그리고 우리의 한계에 의해 형성된 인간이 만든 도구입니다. 이를 인정함으로써, 우리는 모든 것을 완벽하게 보는 신인 척하는 대신, 자신의 한계를 알고 더 나은, 더 안전하며, 더 정직한 AI를 구축할 수 있습니다.
저자들은 우리가 이 문제를 아직 해결했다고 말하는 것이 아닙니다. 우리가 실수로 자신감은 넘치지만 틀린 로봇을 만들거나, 실험실에서는 잘 작동하지만 실제 세상에서는 실패하는 모델을 만들지 않도록, 이 문제에 대해 대화를 시작해야 한다고 말하는 것입니다. 이는 우리가 세상을 보는 방식을 기계에게 가르칠 때, 조금 더 겸손해지고 훨씬 더 주의 깊어져야 한다는 뜻입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.