Whose Art Counts? Model- and Prompt-Dependent Associations in Vision-Language Judgments of Museum Art
이 논문은 메트로폴리탄 미술관 사례 연구를 통해 "영향력(influence)" 프롬프트가 범주 기반의 차이를 가장 일관되게 도출하는 동시에 모델 간 및 프롬프트 간 일반화의 한계를 부각한다는 점을 입증함으로써, 시각-언어 모델과 프롬프트 구조가 예술적 가치를 평가할 때 박물관 메타데이터와 어떻게 상호작용하는지 평가하기 위한 아카이브 조건부 감사 프로토콜을 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 수백만 권의 책을 읽고 수십억 장의 사진을 본 초지능 로봇 사서 한 대를 만들었다고 상상해 보세요. 당신은 로봇에게 "이 그림들 중 어떤 것이 걸작인가요?" 또는 "어떤 것이 역사를 바꿨나요?"라고 묻습니다. 당신은 로봇이 예술을 보고 아름다움과 기술에 근거하여 공정한 답을 내놓기를 기대합니다. 하지만 여기 함정이 있습니다. 이 로봇은 인간처럼 예술을 '보는' 것이 아닙니다. 그것은 패턴을 봅니다. 로봇은 인터넷상의 이미지와 단어를 매칭하며 학습했습니다. 만약 인터넷이 주로 "위대한 예술가"는 남성이라고 말해왔다면, 로봇은 설령 그것이 틀렸을지라도 "위대한 예술"은 남성의 작품처럼 보인다고 학습할 수 있습니다. 이것이 바로 시각-언어 모델(Vision-Language Models, VLMs)의 세계입니다. 즉, 이미지를 단어와 연결하는 컴퓨터입니다. 중요한 질문은 단순히 "로봇이 똑똑한가?"가 아니라, "로봇은 어떤 종류의 세상으로부터 배웠는가?" 그리고 "질문을 다르게 하면 로봇의 답변도 바뀌는가?"입니다. 현재 많은 박물관이 사람들이 예술품을 찾는 데 도움을 주고자 이 로봇들을 활용하고 있지만, 만약 로봇에게 편향성이 있다면 여성과 다른 소외된 창작자들의 이야기를 숨겨 그들을 실제보다 덜 중요한 존재처럼 보이게 만들 수도 있습니다.
그래서 한 연구팀은 이 로봇 사서들에게 매우 구체적인 테스트를 실시하기로 했습니다. 그들은 단순히 로봇에게 추측해보라고 시킨 것이 아니라, 로봇이 공정하게 게임을 하고 있는지 확인하기 위해 엄격한 규칙을 세웠습니다. 그들은 메트로폴리탄 미술관의 디지털 예술 사진 445장을 가져왔습니다. 하지만 반전이 있습니다. 그들은 박물관의 기록이 불완전하다는 것을 알고 있었습니다. 많은 오래된 예술품에는 명확한 이름이 붙어 있지 않습니다. 그래서 그들은 집단을 두 개로 나누었습니다. 창작자의 이름이 알려진(그리고 이름을 바탕으로 성별을 추측한) 작은 그룹 61개와, 창작자가 미상인 거대한 그룹 384개입니다. 그들은 로봇이 이름이 알려진 남성 예술가의 작품에 여성 추정 작가의 작품보다 더 높은 점수를 주는지 확인하고 싶었습니다.
하지만 그들은 단 하나의 질문만 던진 것이 아닙니다. 그들은 네 가지 다른 방식으로 로봇에게 물었습니다: "이것은 **걸작(masterpiece)**인가요?", "이것은 질(quality) 높은 작업인가요?", "**영향력(influential)**이 있나요?", 그리고 로봇이 주의를 기울이고 있는지 확인하기 위한 대조 질문 하나입니다. 그들은 네 가지 서로 다른 로봇의 뇌(OpenAI CLIP, OpenCLIP B/32, OpenCLIP L/14, SigLIP)에 대해 이 테스트를 실행했습니다.
결과는 다음과 같았으며, 이는 약간의 반전이 있는 이야기입니다: 로봇들은 서로 동의하지 않았습니다.
모든 로봇이 "여성 혐오적"이라는 식의 단순한 이야기가 아니었습니다. 대신, 답은 어떤 로봇에게 물었는지, 그리고 어떻게 질문했는지에 따라 완전히 달라졌습니다.
- "영향력"(예술가가 역사를 얼마나 바꾸었는가)에 대해 물었을 때, 두 로봇(OpenAI CLIP과 OpenCLIP L/14)은 명확한 신호를 보냈습니다: 그들은 남성으로 추정되는 작품에 더 높은 점수를 주었습니다. 마치 로봇이 "아, 역사책들이 남성들이 무언가를 변화시켰다고 말하니, 나는 그들에게 더 높은 점수를 주겠다"라고 말하는 것 같았습니다.
- 그러나 **"질(quality)"**이나 **"걸작(masterpiece)"**에 대해 물었을 때, 결과는 엉망이었습니다. 어떤 로봇은 "남성이 더 낫다"고 말하고, 다른 로봇은 "여성이 더 낫다"고 하며, 세 번째 로봇은 "차이를 모르겠다"고 말하기도 했습니다.
- SigLIP이라는 로봇은 실제로 정반대의 결과를 냈는데, 여성 추정 작가의 작품에 더 높은 점수를 주었습니다. 다만 연구진은 이 수치가 다소 불안정하고 확정 짓기 어렵다는 점을 언급했습니다.
이 논문에서 가장 중요한 점은 이 답변들을 단순히 평균 내어서는 안 된다는 것입니다. 만약 네 로봇의 점수를 모두 가져와 하나의 큰 숫자로 합쳐버린다면, 그것은 거짓말이 될 것입니다. 로봇들은 너무나 다릅니다. 한 로봇의 "높은 점수"는 다른 로봇의 "높은 점수"와 같지 않습니다. 연구진은 이 "편향"이 기술의 고정된 결함이 아니라, 하나의 측정 문제라고 주장합니다. 결과는 어떤 도구를 사용하느냐와 정확히 어떤 단어를 입력하느냐에 따라 달라집니다.
또한 이 연구는 박물관의 자체 기록이 큰 역할을 했다는 점을 지적합니다. 445개의 예술품 중 384개가 창작자를 알 수 없었기 때문에, 로봇들은 그들과 비교조차 할 수 없었습니다. "이름이 있는" 예술가들은 박물관 컬렉션의 아주 작고 특정한 부분일 뿐이었습니다. 연구진은 이 로봇들이 일반적으로 여성 예술가를 싫어한다고 말할 수는 없으며, 오직 이 특정 테스트에서, 이 특정 단어들과 이 특정 사진들을 사용했을 때, 일부 로봇이 남성 이름을 선호하는 패턴을 보였다고 말할 수 있을 뿐이라고 경고합니다.
결론적으로, 이 논문은 "로봇이 고장 났다"거나 "로봇이 완벽하다"고 말하지 않습니다. 대신 "주의하라"고 말합니다. 만약 박물관이 예술품의 순위를 매기기 위해 로봇을 사용한다면, 그 순위는 예술의 진정한 가치가 아니라 로봇이 어떻게 훈련되었고 질문이 어떻게 던져졌는지를 반영하는 것일 수 있습니다. 연구진은 하나의 "진실"을 찾는 대신, 로봇들 사이의 불일치에 귀를 기울여야 한다고 제안합니다. 만약 한 로봇이 "이것은 걸작이다"라고 말하고 다른 로봇이 "아니다"라고 말한다면, 그 불일치가 사실 가장 정직한 답입니다. 그것은 질문이 생각보다 훨씬 어렵다는 것, 그리고 로봇의 의견은 매우 시끄러운 방 안에서 들려오는 하나의 노이즈 섞인 목소리일 뿐이라는 것을 우리에게 알려줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.