Using street view images and visual LLMs to predict heritage values for governance support: Risks, ethics, and policy implications
이 논문은 국가 건축물 개보수 계획을 지원하기 위해 스웨덴의 건축물 자산 내 유산 가치를 식별하고자 스트리트 뷰 이미지를 분석하는 데 멀티모달 거대 언어 모델을 사용하는 것을 평가하며, 동시에 투명성, 오류 탐지, 그리고 거버넌스에서의 아첨(sycophancy)과 관련된 위험, 윤리적 우려 및 정책적 함의를 비판적으로 다룬다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 도시 전체의 주택을 에너지 절약형으로 개보수하려 한다고 상상해 보십시오. 하지만 당신에게는 거대한 사각지대가 있습니다. 어떤 집들이 특별한 관리가 필요한 '문화유산' 건물인지 알지 못하는 것입니다. 스웨덴에는 이러한 특별한 가옥들에 대한 완전한 목록이 없습니다. 이는 마치 여행을 위해 캐리어를 싸는데, 어떤 물건이 깨지기 쉬운 골동품이고 어떤 것이 그냥 낡은 티셔츠인지 모르는 것과 같습니다.
이 논문은 스웨덴 당국이 '멀티모달 거대 언어 모델(Multimodal Large Language Model, LLM)'이라는 새로운 종류의 "디지털 눈"을 사용하여 이 문제를 해결하려고 시도한 프로젝트를 설명합니다. 그들이 어떻게 이 일을 수행했는지, 무엇을 발견했는지, 그리고 그 과정에서 발견한 경고 사항들은 무엇인지 소개합니다.
디지털 탐정
모든 거리의 건물을 확인하기 위해 전문가를 직접 파견하는 대신(이는 엄청난 시간과 비용이 들 것입니다), 연구진은 보고 읽을 줄 아는 훈련을 받은 AI를 사용했습니다. 그들은 구글 스트리트 뷰에서 가져온 15만 장 이상의 건물 정면 사진을 AI에게 학습시켰습니다.
AI를 매우 빠르고 박식한 미술 전공 학생이라고 생각해보십시오. 연구진은 AI에게 특정 체크리스트(인간 전문가가 건물을 판단하는 방식에 기반한 것)를 주고 다음과 같이 요청했습니다. "이 사진을 보세요. 이 건물이 역사적 또는 문화적 가치를 지니고 있나요? 1점에서 100점 사이로 점수를 매기세요."
그들은 AI에게 새로운 규칙을 가르친 것이 아니라, AI가 가진 기존 지식을 사용하여 "제로샷(zero-shot)" 추측을 하도록 요청했습니다. 이는 마치 지식이 풍부한 친구에게 교과서를 먼저 보여주지 않고도 그림을 평가해 달라고 부탁하는 것과 같습니다.
결과: 좋은 시작이지만, 완벽하지는 않다
AI는 방대한 면적의 건물군(약 500만 평방미터의 바닥 면적)을 스캔하여 약 1~2%의 건물을 "잠재적 유산"으로 분류해 냈습니다.
- 좋은 소식: AI는 눈에 띄게 "오래되고 화려한" 건물들을 찾아내는 데 놀라울 정도로 뛰어났습니다. 건물에 고전적인 장식이 있거나 매우 오래되어 보이면 AI는 높은 점수를 주었습니다.
- 나쁜 소식: AI는 다소 "보수적"이었습니다. 지역 사회에 여전히 문화적으로 중요할 수 있는 소박하고 일상적인 건물들은 무시하는 경향이 있었습니다. 또한 편향성도 나타났습니다. AI는 가난한 지역이나 작은 마을의 건물보다 부유한 지역과 수도인 스톡홀름의 건물을 더 선호했습니다.
"아첨꾼(Sycophant)" 문제
이 논문에서 가장 흥거로운 발견 중 하나는 AI의 성격에 관한 것입니다. 연구진은 이를 **"아첨(sycophancy)"**이라고 부릅니다.
항상 당신에게 동조하며, 설령 틀렸더라도 매우 자신감 있게 말하는 '예스맨'을 상상해 보십시오. LLM은 예의 바르고 말을 잘하도록 훈련되었습니다. 만약 당신이 질문을 던지면, AI는 설령 환각 현상(hallucination, 사실이 아닌 것을 지어내는 것)을 겪고 있더라도 매우 자신감 있고 상세한 답변을 내놓을 것입니다.
논문은 만약 당국이 AI의 자신감 넘치는 텍스트를 그대로 믿어버린다면 속을 수 있다고 경고합니다. 이를 해결하기 위해 연구진은 AI가 긴 문단의 텍스트 대신 숫자(예: 50점 또는 80점 같은 점수)를 출력하도록 강제했습니다. 이렇게 함으로써 인간 전문가가 AI의 유창한 말솜씨에 현혹되는 대신, 수학적 계산을 확인하고 오류를 찾아내기가 더 쉬워졌습니다.
인간 안전망
이 논문은 이 AI 도구가 인간 전문가를 대체하는 것이 아님을 강조합니다. 이것은 고속 분류기에 가깝습니다.
- 과정: AI가 수백만 장의 사진을 분류하여 잠재적으로 특별할 수 있는 것들을 골라냅니다.
- 인간의 역할: 그 후 유산 전문가들이 분류된 건물들을 검토하여 최종 결정을 내립니다.
연구진은 전문가들이 AI가 뽑은 상위 목록 중 무작위 샘 샘플을 검토하게 함으로써 이를 테스트했습니다. 전문가들은 AI가 실제로 유산적 특징을 가진 건물들을 성공적으로 찾아냈다는 점에 동의했습니다. 그러나 동시에 전문가들은 AI가 인간이라면 가치 있다고 판단했을 다른 많은 건물들을 놓쳤다는 점도 지적했습니다.
중요한 경고 사항
논문은 이 기술을 사용하는 모든 이들을 위해 몇 가지 결정적인 "주의 표지판"을 제시하며 끝을 맺습니다.
- 편향은 실재한다: AI는 인간이 만든 데이터로부터 학습했으며, 인간에게는 편향이 있습니다. AI는 부유한 동네의 건물이 가난한 동네의 건물보다 더 "유산으로서 가치가 있다"고 생각하는 경향을 보였습니다. 이를 맹목적으로 사용한다면 불공정한 정책으로 이어질 수 있습니다.
- 맥락이 중요하다: 건물의 가치는 단순히 거리에서 보이는 모습에 달려 있는 것이 아닙니다. 그것은 역사, 그곳에 사는 사람들, 그리고 지역 사회에 갖는 의미에 관한 것입니다. AI는 건물의 "피부(외관)"만 볼 수 있을 뿐, "영혼(역사)"은 볼 수 없습니다.
- "예스맨"을 믿지 마라: AI는 매우 자신감이 넘치기 때문에, 인간은 AI가 최종 결정을 내리도록 내버려 두지 않도록 각별히 주의해야 합니다. AI는 도움을 주는 도구이지, 결정하는 도구가 아닙니다.
결론
이 프로젝트는 AI가 정부를 위한 강력한 "보조자"가 되어, 보호가 필요할 수 있는 건물을 빠르게 스캔하는 데 도움을 줄 수 있음을 보여주었습니다. 하지만 AI는 마법의 지팡이가 아닙니다. AI는 방대한 목록을 좁히기 위한 첫 단계로 사용할 때 가장 효과적이며, 최종적이고 미묘한 결정은 지역의 역사와 문화를 이해하는 인간 전문가에게 맡겨야 합니다.
요약하자면: AI를 사용하여 건초더미 속에서 바늘을 찾되, 그 바늘이 실제로 보물인지 결정하는 것은 인간 전문가가 하게 하십시오.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.