← 최신 논문
💻 computer science

Hidden Errors in Big Data: The Case of Property Records

이 논문은 저명한 중개 부동산 데이터 세트들을 감사하여 경제적 불평등과 재산세 역진성의 핵심 척도들을 편향시키는 체계적인 오류와 범위의 공백을 밝혀내며, 공개된 행정 데이터와 데이터 출처에 관한 투명성 제고의 결정적인 필요성을 강조한다.

원저자: Evelyn Smith, Emma Harvey, Jacob Goldin, Daniel E. Ho

게시일 2026-08-03
📖 5 분 읽기🧠 심층 분석

원저자: Evelyn Smith, Emma Harvey, Jacob Goldin, Daniel E. Ho

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세계 최대 데이터 도서관의 보이지 않는 결함

당신이 거대한 퍼즐을 풀려고 노력하고 있다고 상상해 보십시오. 하지만 실제 퍼즐 조각을 사용하는 대신, 누군가가 만든 복사본의 복사본을 사용하고 있습니다. 이것이 바로 "빅데이터"의 세계입니다. 오늘날 과학자, 정부, 심지어 도시를 운영하는 인공지능 시스템까지도 결정을 내리기 위해 방대한 양의 정보에 의존합니다. 그들은 질병을 치료하는 방법부터 당신의 집에 세금을 부과하는 방법까지 모든 것을 파악하기 위해 이 데이터를 사용합니다. 하지만 여기 함정이 있습니다. 이 데이터 대부분은 과학자들이 직접 수집한 것이 아닙니다. 그것은 "데이터 브로커(data brokers)"로부터 구매한 것입니다. 이들은 수천 개의 서로 다른 곳에서 정보를 모아 깔끔하게 정리한 뒤, 바로 사용할 수 있는 깔끔한 패키지로 만들어 판매하는 회사들입니다.

이 논문이 던지는 핵심 질문은 이것입니다: 만약 그 복사본이 틀렸다면 어떻게 될까요?

데이터셋을 구매할 때, 당신은 브로커가 자신의 일을 완벽하게 수행했을 것이라고 믿습니다. 하지만 만약 그들이 일부 조각을 놓쳤다면 어떨까요? 숫자를 잘못 복사했다면 어떨까요? 혹은 누락된 숫자를 추측하기 위해 이상한 기술을 사용했고, 그 기술 때문에 전체 그림이 왜곡되어 보인다면 어떨까요? 이것은 "빅데이터의 역설(Big Data Paradox)"이라고 알려져 있습니다. 데이터가 많아질수록 더 확신을 갖게 되지만, 그 데이터가 결함이 있다면 그 확신은 사실 함정이 됩니다. 매우 정밀한 답을 얻을 수는 있지만, 그 답이 완전히 오해를 불러일일 수 있기 때문입니다. 이 논문은 이 문제의 한 가지 구체적이고 중대한 영역, 즉 집이 얼마에 팔렸고 세금이 얼마나 부과되는지를 추적하는 데 사용되는 데이터를 깊이 있게 다룹니다. 만약 이 데이터가 고장 난다면, 부유한 사람들이 내야 할 세금을 덜 내거나 가난한 사람들이 너무 많이 내는 상황이 발생할 수 있으며, 아무도 그것을 너무 늦기 전까지는 알지 못할 것입니다.

거대한 주택 가격 탈취 사건: 데이터 브로커가 실수할 때

이 연구에서 저자들은 미국의 두 거대 "데이터 브로커"인 **코탈리티티(Cotality)**와 **애톰(ATTOM)**을 조사하는 디지털 탐정 역할을 수행했습니다. 이 회사들은 부동산 분야의 거물들로, 은행, 정부, 연구 기관에 수백만 채의 주택에 관한 정보를 판매합니다. 저자들은 이들의 작업 내용을 일리노이주 쿠크 카운티(시카고 포함) 정부가 보관하고 있는 "실제 진실(ground truth)", 즉 공식 원본 기록과 대조하여 검증하기로 했습니다. 정부 기록을 상점에서 받은 원본 영수증이라고 한다면, 브로커의 데이터는 제3자 앱에서 받은 복사본과 같습니다.

탐정들은 브로커의 복사본이 결코 완벽하지 않다는 것을 발견했습니다. 그들은 계산을 망치고 있는 두 가지 주요 유형의 오류를 찾아냈습니다.

1. "누락된 조각" 문제 (커버리지 오류)
바구니에 담긴 사과의 개수를 세고 있는데, 목록을 만든 사람이 사과 12%에서 15%를 적는 것을 잊었다고 상상해 보십시오. 그것이 "커버리지 오류"입니다. 저자들은 실제 주택 거래가 100건 발생할 때마다 브로커들이 약 12건에서 15건을 놓치고 있다는 것을 발견했습니다. 왜 그랬을까요? 브로커들이 무엇이 "주택"인지 또는 무엇이 "실제 거래"인지에 대해 혼동했기 때문입니다. 그들은 실수로 주택 매매를 (다른 카테고리인) "압류 매각(foreclosure)"으로 분류하거나, 주소가 약간 다르게 적혀 있다는 이유로 판매 자체를 누락했을 수도 있습니다. 이는 데이터가 단순히 조금 틀린 것이 아니라, 인구의 큰 부분을 놓치고 있어 주택 시장의 그림을 불완전하게 만들었음을 의미합니다.

2. "추측 게임" 문제 (대치 오류)
때때로 브로커들은 주택의 실제 판매 가격을 가지고 있지 않았습니다. 대신 그들은 "모른다"라고 말하는 대신, 수학적 기술을 사용하여 가격을 추측하려고 시도했습니다. 그들은 "양도세(transfer tax)"(집이 팔릴 때 내는 작은 비용)를 살펴보고, 이를 역산하여 가격을 알아내려 했습니다. 하지만 여기서 문제가 발생했습니다. 마을마다 세율이 다르기 때문입니다. 만약 브로커가 엉뚱한 마을의 세율을 사용하여 추측했다면, 그들의 계산은 엄청나게 틀어지게 됩니다.

저자들은 확인한 주택 판매 건수의 약 **1%에서 2%**에 대해, 브로커의 가격이 실제 가격과 크게 달랐으며, 때로는 수십만 달 달러까지 차이가 난다는 것을 발견했습니다! 더욱 이상한 점은, 이러한 오류가 무작위가 아니었다는 것입니다. 브로커들은 종종 똑같은 집들에 대해 정확히 같은 실수를 저질렀습니다. 예를 들어, 어떤 집이 30만 달러에 팔렸을 때, 브로커는 실수로 이를 20만 달러(실제 가격의 2/3)로 기록하거나 60만 달러(두 배)로 기록할 수 있습니다. 이는 마치 계속해서 잘못된 숫자를 찍어내는 스탬프 기계와 같았습니다.

도미노 효과: 이것이 당신의 지갑에 중요한 이유

당신은 "그래서 집값 몇 개가 틀렸다고? 그게 무슨 상관이야?"라고 생각할지도 모릅니다. 저자들은 이 숫자들이 **재산세 역진성(property tax regressivity)**을 계산하는 데 사용되기 때문에 매우 중요하다고 설명합니다.

재산세를 그룹 식사 비용 계산이라고 생각해 보십시오. 각자 주문한 만큼 비용을 지불해야 합니다. "역진성(regressivity)"이란 저렴한 식사를 주문한 사람들이 비싼 스테이크를 주문한 사람들보다 더 높은 비율의 비용을 지불하게 되는 상황을 뜻하는 멋진 단어입니다. 현실 세계에서 연구들은 종종 가난한 동네가 부유한 동네보다 더 높은 실효 세율로 세금을 부과받는다고 보여줍니다.

저자들은 브로커의 데이터를 사용하여 이 세금의 공정성을 계산했습니다. 결과는 어떠했을까요? 브로커의 데이터는 실제 정부 데이터와 완전히 다른 답을 내놓았습니다.

  • 코탈리티의 데이터는 세금 시스템이 실제보다 더 공정하게 보이도록 만들었습니다 (불공정함을 과소평가함).
  • 애톰의 데이터는 세금 시스템이 실제보다 더 불공정하게 보이도록 만들었습니다 (불공정함을 과대평가함).

브로커의 데이터에 이러한 숨겨진 오류가 있었기 때문에, 누가 얼마를 내는지에 대한 "진실"은 당신이 어떤 데이터를 구매하느냐에 따라 극적으로 달라졌습니다. 만약 정부 관리가 잘못된 데이터를 사용한다면, 세금 시스템이 실제로 가난한 가족들에게 피해를 주고 있음에도 불구하고 시스템이 괜찮다고 생각하거나, 그 반대의 상황이 벌어질 수 있습니다.

"복사-붙여넣기" 음모

가장 놀라운 발견 중 하나는 두 거대 브로커인 코탈리티와 애톰이 똑같은 실수를 저지르고 있었다는 점입니다. 그들은 똑같은 집들을 놓쳤고, 똑같은 거래에 대해 똑같은 이상한 수학적 오류를 범했습니다. 알고 보니 이 회사들은 종-종 서로 데이터를 공유하고 있었습니다. 이것은 마치 두 뉴스 방송국이 모두 동일한 통신사로부터 속보를 받았는데, 그 통신사에 오타가 있었던 것과 같습니다. 두 방송국 모두 동일한 틀린 뉴스를 보도할 것이고, 두 곳이 서로 일치하기 때문에 아무도 그것이 실수라는 것을 깨닫지 못할 것입니다.

저자들은 브로커가 가격을 틀리게 기록한 집들에 대해, 99.8%의 확률로 두 브로커가 정확히 똑같은 틀린 숫자를 가지고 있음을 발견했습니다. 이는 과학자들에게 큰 문제입니다. 보통 서로 다른 두 출처가 일치하면, 당신은 "좋아, 이게 사실임에 틀림없어!"라고 생각합니다. 하지만 이 경우에는 그들의 일치가 함정이었습니다. 그들은 똑같은 이유로 둘 다 틀렸던 것입니다.

결론

이 논문은 단순히 몇 개의 오타를 지적하는 것이 아닙니다. 이는 우리가 경제를 이해하는 토대에 생긴 균열을 드러냅는 것입니다. 저자들은 우리가 브로커들이 판매하는 "깔끔한 패키지"를 맹목적으로 신뢰해서는 안 된다고 결론짓습니다. 이 회사들이 자신들의 숫자를 어떻게 정리하거나 추측했는지 항상 밝히지는 않기 때문에, 우리는 눈을 가린 채 비행하고 있는 셈입니다.

해결책은 무엇일까요? 우리에게는 **공공 데이터(open data)**가 필요합니다. 정부는 이미 원래의 정확한 기록(실제 진실)을 보유하고 있습니다. 저자들은 값비싸고 불투명한 브로커에 의존하는 대신, 연구자와 정책 입안자들이 무료로 공개된 데이터를 직접 사용해야 한다고 주장합니다. 만약 우리가 데이터가 어떻게 만들어졌는지 볼 수 없다면, 그 데이터로부터 도출한 결론을 신뢰할 수 없습니다. AI와 빅데이터가 세상을 움직이는 시대에, 우리가 할 수 있는 가장 중요한 일은 데이터가 단순히 '방대한' 것뿐만 아니라 '정확한' 것이 되도록 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →