← 최신 논문
💬 NLP

Privacy Washing: Detecting Internal Contradictions in Privacy Policies

이 논문은 개인정보 보호 약속이 다른 조항들에 의해 훼손되는 내부적 모순인 '프라이버시 워싱(privacy washing)'을 탐지하기 위한 다단계 LLM 기반 파이프라인을 소개하며, 이를 2026년 및 2015년 코퍼스에 적용하여 상당수의 기업에서 반복되는 제3자 공유 관련 모순을 밝혀내는 한편, 인간 전문가의 검증이 결여되어 있어 해당 수치가 하한선임을 명시한다.

원저자: Thomas Brackin

게시일 2026-09-03✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thomas Brackin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

웹사이트를 방문하거나 앱을 다운로드할 때마다 여러분은 개인정보 처리방침에 동의하라는 요청을 받게 됩니다. 이것들은 기업이 여러분의 개인정보를 어떻게 다루는지 설명하는 길고 난해한 문서들입니다. 수십 년 동안 연구자들과 규제 기관들은 단순한 가정을 바탕으로 운영되어 왔습니다. 만약 기업이 그 문서에 약속을 적었다면, 기업은 그 약속을 지킨다는 것입니다. 이 개념은 이러한 정책들이 명확한 고지 역할을 하여 사용자가 데이터에 대해 정보에 입각한 선택을 할 수 있게 해준다는 것입니다. 만약 정책에 "우리는 귀하의 데이터를 판매하지 않습니다"라고 적혀 있다면, 합리적인 사람은 회사가 실제로 데이터를 판매하지 않을 것이라고 기대합니다. 그러나 이 가정은 해당 문서가 내부적으로 일관성을 유지한다는 점에 의존합니다. 만약 어떤 정책이 한 섹션에서는 안심시키는 약속을 하지만, 같은 문서의 다른 섹션에서는 그 약속을 직접적으로 저해하는 관행을 설명한다면 어떤 일이 벌어질까요? 이것이 바로 새로운 연구가 다루고자 하는 질문이며, 저자가 '프라이버시 워싱(privacy washing)'이라고 부르는 현상을 탐구하는 문제입니다.

이 개념은 기업이 작은 환경적 노력을 광고하면서도 계속해서 해로운 관행을 이어가는 '그린워싱(greenwashing)'과 유사합니다. 디지털 세계에서 프라이버시 워싱은 정책 내에 데이터 공유를 제한하겠다는 약속과 같은 공약이 포함되어 있음에도 불구하고, 동일한 문서의 다른 곳에서 실제 데이터 처리 방식에 대한 설명이 이를 모순되게 기술할 때 발생합니다. 이러한 모순은 항상 "X를 수집한다"와 "X를 수집하지 않는다"처럼 단순한 논리적 오류인 것은 아닙니다. 대신, 훨씬 더 미묘한 경우가 많습니다. 예를 들어, "귀하의 개인정보를 판매하지 않습니다"라는 광범하고 위안을 주는 문장이 광고 파트너와 사용자 식별자를 공유한다는 상세한 설명과 나란히 놓여 있는 식입니다. 안심시키는 약속 부분에서 멈춰버린 독자는 문서 하단에 숨겨진 모순된 관행에 도달하지 못할 수 있으며, 이는 안전하다는 오해를 불러일으킬 수 있습니다.

이러가 얼마나 흔한지 조사하기 위해, 토마스 브래킨(Thomas Brackin)이라는 연구자는 개인정보 처리방침에서 이러한 내부 모순을 스캔하는 자동화된 시스템을 개발했습니다. 이 시스템은 인간처럼 처음부터 끝까지 문서를 읽는 방식이 아닙니다. 대신, 텍스트를 아주 작은 개별 문장들로 분해합니다. 먼저 "우리는 귀하의 데이터를 공유하지 않을 것입니다"와 같이 약속이나 공약을 나타내는 문장을 식별합니다. 그다음 "우리는 파트너와 데이터를 공유합니다"와 같이 실제 관행을 설명하는 문장을 찾습니다. 시스템은 이 문장들을 쌍으로 묶어 서로 충돌하는지 확인합니다. 또한 보안에 관한 약속과 데이터 수집에 관한 관행처럼 명백히 관련이 없는 쌍을 제거하기 위해 일련의 필터를 사용합니다. 그 후 인공지능 모델을 사용하여 남은 쌍들이 진정한 모순을 나타내는지 판단합니다. 정확성을 보장하기 위해 시스템은 세 개의 서로 다른 AI 모델 패널을 사용하며, 세 모델 중 최소 두 개가 동의해야만 해당 쌍을 확정된 모순으로 표시합니다.

연구자는 이 시스템을 두 개의 대규모 개인정보 처리방침 컬렉션에 적용했습니다. 2026년에 수집된 한 컬렉션은 다양한 산업 분야의 123개 기업을 포함했습니다. 115개 기업을 포함한 2015년 컬렉션이 다른 하나입니다. 이를 통해 연구자는 이 문제가 새로운 이슈인지, 아니면 이러한 문서가 작성되는 방식의 오래된 특징인지를 확인할 수 있었습니다. 결과는 프라이버시 워싱이 반복되는 패턴임을 보여주었습니다. 2026년 컬렉션에서는 최소 하나의 확정된 모순이 약 12%의 기업에서 나타났습니다. 2015년 컬렉션에서는 그 수치가 더 높아서 약 36%의 기업에서 나타났습니다. 그러나 연구자는 두 컬렉션이 약간 다른 설정으로 분석되었기 때문에, 수치의 차이를 시간의 흐름에 따른 변화로 단정적으로 돌릴 수는 없다고 언급했습니다. 분명한 것은 동일한 유형의 모순이 두 시대 모두에서 나타난다는 점입니다.

가장 빈번한 모순은 제3자 데이터 공유와 관련되었습니다. 흔히 발견된 패턴은 회사가 데이터를 판매하거나 공유하지 않겠다고 약속하면서도, 동시에 광고 파트너와 식별자 및 상업 정보를 어떻게 공유하는지 설명하는 것이었습니다. 이 특정 패턴은 2022년 세포라(Sephora)와 관련된 법적 합의와 일치하는데, 당시 규제 당국은 타겟 광고를 위해 광고 파트너와 데이터를 공유하는 것이 설령 회사가 데이터를 판매하지 않는다고 주장하더라도 캘리포니아 법에 따라 '판매'에 해당할 수 있다고 결정했습니다. 연구에 따르면 이러한 모순은 의도적인 기만에서 발생하는 것이 아니라 구조적인 요인에서 비롯되는 경우가 많습니다. 법이 변함에 따라 기업들은 규제를 준 준수하기 위해 정책에 새로운 섹션을 추가합니다. 예를 들어 캘리포니아의 요구 사항을 충족하기 위해 "우리는 판매하지 않습니다"라는 문구를 추가하는 식입니다. 이러한 새로운 섹션들은 기존의 데이터 공유 관행을 설명하는 이전 섹션들과 조화를 이루지 못한 채 추가되는 경우가 많아 내부적 갈등을 일으킵니다.

또한 연구는 이 시스템이 완벽하지 않으며 많은 모순을 놓칠 가능성이 높다는 점을 밝혀냈습니다. 자동화된 필터는 오경보를 피하기 위해 매우 엄격하게 설계되었기 때문에, 인간 전문가가 모순된다고 간주할 만한 쌍을 폐기할 수 있습니다. 더욱이, 시스템은 모순을 판단하기 위해 인공지능에 의존하고 있으며, 이 AI 모델들은 아직 인간 전문가를 대상으로 검증되지 않았습니다. 연구자는 이 결과들이 최종적인 잘못의 증거라기보다는 추가 검토를 위한 후보군임을 강조합니다. 연구는 기업이 의도적으로 거짓말을 하고 있다고 주장하는 것이 아니라, 이러한 문서가 구성되는 방식—종종 시간이 흐르며 섹션을 추가하는 서로 다른 팀들에 의해 만들어지는 방식—이 안심시키는 약속과 상세한 관행이 서로 쉽게 모순될 수 있는 구조적 환경을 만든다는 점을 시사합니다.

궁극적으로 이 연구는 개인정보 처리방침을 바라보는 새로운 방식을 제공합니다. 단순히 문서가 얼마나 긴지 또는 얼마나 읽기 어려운지를 측정하는 대신, 이 연구는 텍스트가 스스로를 모순시키는지 여부를 측정합니다. 연구 결과는 상당수의 기업에 있어 프라이버시의 약속과 관행에 대한 설명이 하나의 문서 내에서 긴장 관계에 있음을 시사합니다. 이 연구가 사용자들이 실제로 속고 있는지를 판별할 수는 없지만, 개별 문장은 기술적으로 모두 사실일지라도 정책의 '전체적인 인상(net impression)'이 기만적일 수 있는 구체적인 텍스트 조건을 식별해 냅니다. 이 작업은 규제 기관, 기업, 그리고 연구자들이 개인정보 처리방침에서 행해진 약속이 그 안에 기술된 관행과 실제로 일치하는지 검토하기 위한 시작점을 제공하는 도구 역할을 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →