← 최신 논문
🤖 machine learning

Auditing Recorded Predictive Lead Service-Line Classifications Against Physical Verification: A Statewide Study of New York

뉴욕의 이 주 단위 연구는 대부분의 유틸리티 기업의 예측 납 서비스 라인 모델이 물리적 검증과 일치하는 반면, 뉴욕시의 시스템은 물리적 굴착을 통해 약 121,000곳의 주소에서 납이 확인되었음에도 불구하고 모델이 43,000개 이상의 주소를 "알려진 기타(Known Other)"로 분류하는 통계적으로 유의미한 불일치를 보이고 있으며, 일부 공공 측 결정이 고객 측 모델 출력값으로부터 잘못 복사되었다는 증거와 함께 나타난다는 사실을 밝히고 있다.

원저자: Muhammad Sarmad Sohail

게시일 2026-08-21
📖 5 분 읽기🧠 심층 분석

원저자: Muhammad Sarmad Sohail

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

미국에서는 '납 및 구리 규칙 개정안(Lead and Copper Rule Revisions)'이라는 연방 규칙에 따라 모든 지역 사회 수도 시스템이 개별 가정으로 물을 운반하는 관인 서비스 라인의 완전한 지도를 작성해야 합니다. 이 목표는 특히 어린이들에게 심각한 건강 문제를 일으킬 수 있는 독성 금속인 납으로 된 파이프를 찾아 교체하는 것입니다. 수십 년 동안 유틸리티 기업들은 오래된 종이 기록을 가지고 있거나 직접 땅을 파서 확인했기 때문에 어디에 납 파이프가 있는지 알고 있었습니다. 하지만 기록이 존재하지 않는 수백만 개의 주소에 대해, 새로운 규칙은 수도 회사들이 파이프를 파헤치는 대신 컴퓨터 모델을 사용하여 파이프의 재질을 추측하는 것을 허용했습니다. 이 모델들은 집의 연도나 동네와 같은 데이터를 분석하여 해당 파이프가 납, 구리 또는 플라스틱일 가능성을 예측합니다. 이는 모든 파이프를 파헤는 것이 엄청나게 비용이 많이 들기 때문에 시간과 비용을 절약하려는 의도였습니다. 그러나 이러한 모델은 추측에 기반하기 때문에, 규칙은 유틸리티 기업들이 물리적으로 샘플 파이프를 검사하여 그 정확성을 확인하도록 요구합니다. 대중의 이익은 이 컴퓨터의 추측이 공중 보건을 신뢰할 만큼 충분히 믿을 만한지, 아니면 통계적 확신이라는 층 아래에 위험한 수의 납 파이프를 숨기고 있는지에 달려 있습니다.

무함마드 사르마드 소헤일(Muhammad Sarmad Sohail)이라는 연구자는 뉴욕주 전역의 수도 유틸리티가 제출한 공공 기록을 조사함으로써 이 시스템을 테스트하기로 했습니다. 뉴욕은 유틸리티가 각 주소에 대해 파이프 재질을 어떻게 결정했는지(직접 팠는지, 종이 기록을 확인했는지, 또는 컴퓨터 모델을 사용했는지)를 상세히 공개한다는 점에서 독특합니다. 소헤일은 컴퓨터 모델이 일반적인 의미에서 틀렸다는 것을 증명하려 한 것이 아니라, 유틸리티가 제출한 구체적인 수치들을 보고 그것이 타당한지를 살펴보았습니다. 그는 컴퓨터 모델을 최소 100개 이상의 주소에 사용한 뉴욕의 153개 지역에 집중했습니다. 그의 첫 번째 단계는 간단한 확인이었습니다. 그는 모델이 얼마나 다양한 답변을 내놓았는지 세었습니다. 건전한 시스템이라면 모델은 특정 가구에 따라 때로는 "납", 때로는 "구리", 때로는 "알 수 없음"이라고 답해야 합니다. 하지만 75개 지역(약 126,000개 주소 포함)에서는 모델이 모든 가구에 대해 단 하나의 동일한 답변만을 내놓았습니다. 이는 마치 기상 예보관이 계절이나 위치에 상관없이 일 년 내내 매일 비가 올 것이라고 예측하는 것과 같았습니다.

이러한 다양성의 결여는 자동으로 부정행위의 징후는 아니지만, 무언가 잘못되었다는 경고 신호입니다. 소해일은 이 "단일 답변" 목록을 동일한 수도 유틸리티가 같은 마을에서 수행한 물리적 검사와 비교했습니다. 대부분의 경우, 모델이 제시한 단일 답변은 작업자들이 땅에서 발견한 것과 일치했습니다. 그러나 7곳의 특정 장소에서는 모델의 단일 답변이 작업자들이 본 것과 정면으로 배치되었습니다. 가장 놀라운 사례는 뉴 York 시였습니다. 뉴욕시는 43,215개의 주소를 분류하기 위해 컴퓨터 모델을 사용했습니다. 이 모든 주소에 대해 모델은 파이프가 "알려진 기타(Known Other)"라고 답했는데, 이는 파이프 재질이 확실히 납은 아니지만 구체적인 재질은 알 수 없다는 범주를 의미합니다. 뉴-욕시는 다른 방법을 통해 수천 곳에서 납 파이프를 발견했으며, 120,000개 이상의 다른 주소에 대해서는 "알 수 없음" 범주를 사용했습니다. 그러나 이 거대한 43,000가구 그룹에 대해서는 모델이 단 한 번도 납이거나 혹은 알 수 없는 상태일 가능성을 제시하지 않았습니다. 이는 납 파이프가 흔했던 시기인 1940년 이전에 지어진 집들을 포함하고 있음에도 불구하고, "납이 아님"이라는 완벽하고 끊김 없는 기록을 보여주었습니다.

이 모순은 단순한 통계적 우연이 아니었습니다. 이는 시의 자체 작업자들에 의해 확인되었습니다. 뉴욕시 5개 구의 작업자들은 수만 개의 파이프를 실제로 파내어 검사했으며, 상당한 수의 납을 발견했습니다. 만약 컴퓨터 모델이 제대로 작동했다면, 이 43,000개의 주소 중 일부를 잠재적 납 파이프로 표시했어야 합니다. 하지만 모델은 그들을 모두 통과시켰습니다. 똑같이 이상한 패턴이 550km 떨어진 완전히 다른 수도 회사가 있는 작은 마을 이스트 로체스터(East Rochester)에서도 나타났습니다. 그곳에서도 모델은 분류된 모든 집에 대해 단 하나의 "납 아님" 답변을 내놓았는데, 정작 작업자들이 그 마을에서 파이프를 팠을 때는 납을 거의 10%에서 발견했습니다. 연구자는 또한 시의 공공 기록이 독립적으로 생성되지 않았음을 발견했습니다. 데이터에 따르면, 시는 고객 측 파이프에 대한 컴퓨터 추측을 그대로 복사하여 도시가 소유한 공공 측 파이프에 붙여넣기 했다는 것을 보여주었습니다. 이는 공공 측 파이프가 도시 소유의 별개 파이프임에도 불구하고, 해당 결정이 새로운 분석이 아닌 복사-붙여넣기 오류였음을 시사합니다.

그 43,215개 주소에 얼마나 많은 납 파이프가 숨겨져 있을지 이해하기 위해, 연구자는 건물의 연령을 살펴보았습니다. 모델은 주로 납 파이프가 적은 것이 자연스러운 신축 건물들에 적용되었습니다. 그러나 건물의 연령을 조정한 후에도 숫자는 맞지 않았습니다. 다른 방법으로 납이 발견되었던 오래된 건물들에서도 모델은 아무것도 찾아내지 못했습니다. 연구자는 동일한 지역의 물리적 검사 결과를 가이드로 사용하여, 43,215개 주소 중 1,150개에서 1,450개 사이가 잘못도 안전하다고 라벨링된 납 파이프를 가지고 있을 것으로 추정했습니다. 이 추정치는 작업자들이 파이프를 팠을 때 편향되지 않았다는 가정을 전제로 하지만, 이러한 불확실성을 고려하더라도 모델의 완벽한 기록과 실제 지표 사이의 격차는 무시하기에는 너무 큽니다.

이 연구는 컴퓨터 모델이 결코 작동할 수 없다고 주장하거나 모든 유틸리티가 실패하고 있다고 말하는 것이 아닙니다. 연구는 많은 곳에서 모델이 물리적 현실과 일치하는 다양한 답변을 생성했다는 것을 발견했습니다. 문제는 이 데이터가 보고되는 방식에 국한된 특정 지역의 문제였습니다. 연구자는 문제가 반드시 컴퓨터 코드 자체에 있는 것이 아니라, 결과가 발표되기 전 처리되는 방식에 있다고 주장합니다. 즉, 모델이 다양한 답변을 생성했을 수도 있지만, 어떤 컴퓨터 프로그램이나 인간의 과정이 제출 전 단계에서 명확한 "안전" 결과가 아닌 것들을 걸러냈을 가능성이 있다는 것입니다. 이는 공공 기록이 모델이 실제로 가졌던 불확실성을 숨긴 채 깨끗하고 확신에 찬 목록을 보여주고 있음을 의미합니다. 주의 규정은 유틸리티 기업이 신뢰 구간(얼마나 확신하는지에 대한 척도)을 제공하고 결과를 확인할 계획을 세울 것을 요구합니다. 하지만 이 유틸리티들이 제출한 기록에는 그러한 내용이 전혀 없었습니다.

이 감사는 뉴욕이 각 주소에 사용된 방법을 공개하기 때문에 가능했습니다. 대부분의 다른 주에서는 공공이 파이프 분류가 삽질을 통한 것인지 스프레드시트를 통한 것인지 알 수 없습니다. 연구자는 이러한 수준의 세부 정보를 전국적으로 요구하는 것이 비용이 들지 않으면서도, 유틸리티가 단 하나의 변하지 않는 답변 뒤에 불확실성을 숨기고 있는지 누구나 확인할 수 있게 할 것이라고 제안합니다. 이 연구 결과는 모델이 수천 가구에 걸쳐 완벽하고 변하지 않는 결과를 만들어낸다면, 그것은 완벽한 모델의 징후가 아니라 프로세스가 진실을 보는 능력을 상실했다는 신호라는 경고를 담고 있습니다. 데이터에 따르면 가장 큰 사례의 경우, 제출된 자료는 해당 라벨을 사용하는 데 필요한 조건을 충족하지 못했습니다. 연구자들은 인벤토리가 단순히 최종 추측만이 아니라 모델의 불확실성도 기록해야 하며, 규제 기관은 변화가 없는 목록을 즉각적인 조사가 필요한 적색 신호로 취급해야 한다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →