← 최신 논문
🤖 AI

Position: Fairness Failure in Generative Models is an Evaluation Problem

본 포지션 페이퍼는 생성형 모델의 공정성 실패가 주로 비교 불가능하고 실행 불가능한 결과로 인한 평가 문제에서 비롯된다고 주장하며, 편향성 평가의 재현성, 비교 가능성 및 책임성을 가능하게 하기 위한 표준화된 보고 산출물로서 "페어니스 카드(Fairness Cards)"를 제안한다.

원저자: Mariia Vladimirova, Jean-Yves Franceschi, Thibaut Issenhuth

게시일 2026-08-19
📖 5 분 읽기🧠 심층 분석

원저자: Mariia Vladimirova, Jean-Yves Franceschi, Thibaut Issenhuth

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

지난 10년 동안 컴퓨터는 한때 불가능해 보였던 유창함으로 예술을 창조하고, 이야기를 쓰고, 대화를 나누는 법을 배웠습니다. 이미지, 텍스트, 비디오를 단순한 지시어로부터 생성할 수 있는 이러한 생성형 시스템은 이제 일상생활의 구조 속에 깊숙이 스며들어 있습니다. 그러나 이 도구들이 더욱 강력해짐에 따라, 하나의 지속적인 그림자가 그 뒤를 따르고 있습니다. 바로 사회적 불평등을 재현하고 증폭시키는 경향입니다. 컴퓨터가 의사의 이미지를 생성할 때 종종 남성을 기본값으로 설정하거나, 지도자에 대한 이야기를 쓸 때 특정 성별이나 인종을 선택하는 경우가 빈번합니다. 이는 단순히 코드의 결함이 아니라, 기계가 학습한 데이터, 즉 인류 역사의 편향을 비추는 거울입니다. 수년간 연구자들과 규제 기관들은 이러한 불공정한 패턴을 탐지하고 줄이는 방법을 개발하며 이를 해결하려 노력해 왔습니다. 그 목표는 언제나 이 강력한 도구들이 모든 사람을 동등한 존엄성과 정확성으로 대우하도록 보장하는 것이었습니다.

하지만 새로운 관점은 문제가 더 나은 해결책의 부재가 아니라, 그 해결책이 효과가 있는지 측정하는 방식에 있을 수 있다고 시사합니다. 한 연구팀은 공정성을 판단하는 데 사용되는 테스트가 너무 유연하기 때문에 이 분야가 혼란의 순환에 빠져 있다고 주장합니다. 마치 고무로 만든 자가 어떻게 늘리느냐에 따라 서로 다른 측정을 제공하는 것처럼, 현재의 AI 공정성 테스트 방법들은 연구자들이 내린 작고 흔히 보고되지 않는 선택들에 따라 그 결과를 바꿉니다. 어떤 연구는 특정한 방식으로 질문을 던지고 AI가 공정하다고 결론짓는 반면, 다른 연구는 약간 다른 어구 사용법을 통해 동일한 AI가 매우 편향되었다고 결론지을 수 있습니다. 두 연구 모두 각자의 좁은 규칙 안에서는 기술적으로 옳을 수 있지만, 대중과 정책 입안자들에게는 상반된 이야기를 들려줍니다. 이러한 불일치는 기술이 실제로 개선되고 있는 것인지, 아니면 우리가 단지 문제의 다른 각도만을 보고 있는 것인지 알 수 없게 만듭니다.

이 새로운 연구의 저자인 마리아 블라디미로바(Mariia Vladimirova)와 그녀의 동료들은 왜 생성형 모델에서의 공정성이 이토록 고질적인 문제로 남아 있는지 진단하고자 했습니다. 그들은 단순히 AI를 더 예의 바르게 만드는 새로운 알고리즘을 제안한 것이 아니라, 평가 과정 자체를 조사했습니다. 일련의 통제된 실험을 통해, 그들은 AI가 공정한지 불공정한지에 대한 판결이 종종 그것을 테스트하는 데 사용된 '프로토콜'에 전적으로 달려 있다는 것을 입증했습니다. 한 가지 놀라운 시연에서, 그들은 단일하고 변하지 않는 AI 모델을 가져와 다양한 시나리오의 격자(grid)에 대해 테스트했습니다. 그들은 질문을 던지는 방식, 기대되는 답변의 스타일, 그리고 텍스트를 생성하는 데 사용되는 설정을 변화시켰습니다. 그 결과, 동일한 모델이 한 가지 조건 하에서는 심각한 공정성 문제를 가진 것으로 판단될 수 있는 반면, 다른 조건 하에서는 완벽하게 균형 잡힌 것으로 판단될 수 있음을 발견했습니다.

예를 들어, 연구진이 모델에게 특정 직업에 종사하는 사람에 대한 이야기를 써달라고 요청했을 때, 결과는 고정관념 쪽으로 크게 치우쳐 있었습니다. 하지만 동일한 모델에게 그 사람에 대한 전문적인 메모를 작성하도록 요청하자, 편향은 사라졌습니다. 또 다른 테스트에서, 그들은 컴퓨터가 단어를 선택하는 방식인 '디코딩 레짐(decoding regime)'이라 불리는 설정을 변경했습니다. 다른 연구들에서 흔히 우연이나 기본 설정에 맡겨지는 이 설정을 아주 미세하게 조정하는 것만으로도, 결론을 '편향됨'에서 '편향되지 않음'으로 뒤집기에 충분했습니다. 연구진은 이러한 변동이 무작위적인 노이즈가 아니라, 평가자의 선택에 따라 해악을 숨기거나 드러낼 수 있는 체계적인 변화라는 것을 발견했습니다. 이는 어떤 기업이 특정 테스트 방법이 좋은 결과를 보여주었다는 이유만으로 자신의 모델이 공정하다고 주장하는 보고서를 발표할 수 있으며, 다른 방법을 사용했다면 상당한 문제를 드러냈을 수도 있음을 의미합니다.

논문은 이러한 표준화의 결여가 진정한 병목 현상이라고 주장합니다. 우리가 더 공정한 모델을 구축하는 방법을 모르는 것이 아니라, 우리가 성공했는지 여부를 신뢰할 수 있게 판단할 방법이 없는 것입니다. 현재의 지형은 연구자들이 몇 가지 예시를 골라 테스트하고 결과를 보고하는 '임시방편적(ad-hoc)' 점검으로 가득 차 있습니다. 이러한 접근 방식은 시스템이 좋아 보이도록 설계된 테스트를 통해 시스템이 좋아 보이게 만들거나, 테스트가 너무 좁아서 실제 개선 사항을 놓치게 만드는 '체리 피킹(cherry-picking)'을 허용합니다. 또한, 연구진은 현대 AI 시스템이 특정 질문에 답변을 거부하는 안전 계층을 포함하고 있다는 점을 강조했습니다. 만약 모델이 특정 집단의 질문에는 답변을 거부하면서 다른 집단의 질문에는 답변한다면, 이는 '접근 불균형(access disparity)'이라 불리는 형태의 불공정입니다. 그러나 많은 현재의 테스트는 이러한 거부를 무시하거나 오류로 취급하여 버림으로써, 어떤 사람들은 목소리를 내지 못하고 있는 반면 어떤 사람들은 목소리를 내고 있다는 사실을 효과적으로 은폐합니다.

이를 해결하기 위해, 팀은 '페어니스 카드(Fairness Card)'라는 새로운 표준을 제안합니다. 식품 포장지의 영양 성분표를 상상해 보십시오. AI 시스템을 위한 영양 성분표입니다. 영양 성분표가 식품에 무엇이 들어있는지, 설탕이 얼마나 들어있는지, 어떻게 가공되었는지를 정확히 알려주는 것처럼, 페어니스 카드는 AI가 어떻게 테스트되었는지에 대한 모든 세부 사항을 나열할 것입니다. 이 문서는 '공정함'이 무엇인지를 규정하는 것이 아니라, 공정성을 측정하는 과정을 투명하고 재현 가능하게 만드는 것입니다. 만약 두 명의 서로 다른 연구자가 결과를 비교하고자 한다면, 그들은 어떻게 하면 테스트를 똑같이 재현할 수 있는지 알게 될 것이며, 이를 통해 사과와 오렌지를 비교하는 것이 아니라 사과와 사과를 비교할 수 있게 될 것입니다.

연구진은 자신들의 실험을 위한 상세한 페어니스 카드를 작성함으로써 이 아이디어를 테스트했습니다. 그들은 프롬프트에 사용된 구체적인 단어부터 컴퓨터의 선택에 영향을 미친 무작위 시드(random seed)에 이르기까지 모든 변수를 기록했습니다. 이 세부 사항을 공개했을 때, 그들은 동일한 모델이 카드의 어느 부분을 보느냐에 따라 광범위한 공정성 점수를 생성할 수 있음을 보여주었습니다. 어떤 프롬프트 스타일에서는 모델이 높은 비율의 고정관념적 언어를 나타냈지만, 다른 스타일에서는 거의 나타내지 않았습니다. 이 모든 수치를 단일화된 표준 형식으로 제시함으로써, 그들은 모델의 공정성에 대한 '진실'이 단일한 숫자가 아니라, 모든 변수가 가시화될 때 비로소 명확해지는 복잡한 그림이라는 것을 입증했습니다.

이 접근 방식은 완벽한 '원 사이즈 핏(one-size-fits-all)' 정의를 찾는 것에서 벗어나, 평가 자체가 정직하고 완전한 시스템을 구축하는 데 초점을 맞춥니다. 저자들은 이것이 모든 문제를 해결하지는 못할 것임을 인정합니다. 일부 기업은 여전히 데이터를 숨길 수 있고, 문화마다 공정에 대한 생각이 다를 수 있다는 점을 언급합니다. 그러나 그들은 시스템이 어떻게 테스트되었는지에 대한 공유된 상세 기록 없이는 아무런 진전도 이룰 수 없다고 주장합니다. 일관되게 측정할 수 없는 것은 개선할 수 없으며, 게임의 규칙이 계속 바뀐다면 해결책을 비교하는 것도 불가능합니다.

논문은 연구자, 개발자, 그리고 규제 기관을 향한 행동 촉구를 하며 결론을 맺습니다. 그들은 새로운 AI 시스템이 출시되거나 공정성에 대한 주장이 제기될 때마다 반드시 페어니스 카드가 제공되어야 한다고 촉구합니다. 이 문서는 안전 매뉴얼이나 사용자 가이드처럼 필수적인 부분으로 취급되어야 합니다. 여기에는 테스트된 특정 집단, 질문을 던지는 데 사용된 정확한 방법, 그리고 최악의 시나리오를 포함한 전체 결과의 범위가 상세히 기술되어야 합니다. 이러한 선택들을 명시적으로 드러냄으로써, 이 분야는 모호한 약속에서 벗어나 공정성이 측정 가능하고 추적 가능하며 책임질 수 있는, 이 강력한 도구들이 구축되고 사용되는 방식의 일부가 되는 미래로 나아갈 수 있습니다. 목표는 모든 편향을 제거하는 것(이는 불가능할 수도 있습니다)이 아니라, 우리가 시스템의 사용 여부를 결정할 때 우리 모두가 동일한 증거를 보고 있는지 확인하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →