Public acceptance of artificial intelligence in health care: a cumulative hierarchy in a 16-item instrument, German–Italian measurement equivalence, and a five-item short form
본 연구는 의료 분야에서의 인공지능에 대한 대중의 수용도가 임상적 결과에 따라 순차적인 위계 구조를 따르며, 독일어 및 이탈리아어 사용 인구 집단 전반에 걸쳐 불변하고, 고유하게 결정된 문항 세트가 부재함에도 불구하고 5개 문항의 단축형으로 효과적으로 포착될 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
병원 대기실에 서서 컴퓨터 프로그램이 생성한 의사의 진단 결과가 화면에 표시되는 것을 지켜보고 있다고 상상해 보십시오. 어떤 이들에게 이것은 유용한 조수처럼 느껴지겠지만, 다른 이들에게는 위험한 침입처럼 느껴질 것입니다. 인공지능이 연구실을 넘어 실제 병원과 약국으로 이동함에 따라, 한 가지 중요한 질문이 제기됩니다. 바로 이 시스템이 봉사하고자 하는 대상인 사람들이 실제로 이를 수용하느냐는 것입니다. 그 답은 모든 과업에 대해 단순히 "예" 또는 "아니오"로 나타나지는 않습니다. 대신, 대중의 의견은 종종 하나의 패턴을 형성합니다. 사람들은 기계가 진료 예약을 잡는 것에는 안심할 수 있지만, 기계가 생사가 걸린 치료를 결정하는 것에는 깊은 불안감을 느낄 수 있습니다. 이러한 패턴을 이해하는 것은 매우 중요합니다. 왜냐하면 이는 사람들이 무엇을 생각하는지뿐만 아니라, 다양한 유형의 의료 업무 전반에 걸쳐 신뢰가 어떻게 구축되거나 무너지는지를 알려주기 때문입니다.
독일어와 이탈리아어가 공존하는 북부 이탈리아의 이중 언어 지역인 사우스 티롤의 한 연구팀은 이 신뢰의 지형도를 그려내고자 했습니다. 그들은 인공지능에 대한 대중의 수용도가 예측 가능한 순서를 따르는지, 그 순서가 문화적 차이에도 불구하고 두 언어 집단 모두에서 유효한지, 그리고 이를 측정할 수 있는 더 짧고 단순한 방법을 만들 수 있는지 알고 싶었습니다. 연구진은 일반 인구 중 성인 901명을 대상으로 설문 조사를 실시하여, 인공지능이 의료 분야에서 활용될 수 있는 16가지의 서로 다른 방식에 대해 평가하도록 했습니다. 이 방식들은 환자 기록 정리 및 복약 알림 발송과 같은 행정적 업무부터, 의료 비상 상황 시 의사를 지원하거나 복잡한 질병을 진단하는 데 도움을 주는 것과 같은 고도의 임상적 결정에 이르기까지 다양했습니다.
연구진은 대중의 수용도가 명확한 누적형 사다리를 따른다는 것을 발견했습니다. 수용도가 가장 높은 사다리의 맨 아래에는 행정적 업무가 있었습니다. 설문에 참여한 사람들의 약 80%가 인공지능이 약 복용 알림을 자동으로 보내는 것에 대해 편안함을 느낀다고 답했습니다. 그보다 조금 낮지만 여전히 널리 수용되는 수준은 진료 예약 및 전자 건강 기록 관리와 같은 업무였습니다. 과업이 더 임상적이고 환자 케어에 직접적으로 관여하게 될수록 수용도는 떨어지기 시작했습니다. 사람들은 인공지능이 임상 데이터를 분석하거나 진단을 지원하는 것에 대해 덜 편안함을 느꼈습니다. 수용도가 가장 낮은 사다리의 맨 꼭대기에는 시간 제약이 있고 압박감이 큰 결정들이 있었습니다. 응답자의 약 3분의 1만이 의료 비상 상황이나 트리아지(triage, 환자 분류) 중에 인공지능의 지원을 받는 것을 수용하겠다고 답했으며, 긴급한 결정을 내리는 데 인공지능을 사용하는 것에 동의하는 비율은 그보다 더 낮았습니다. 이 계층 구조는 대중이 인공지능을 하나의 단일한 기술 덩어리로 보는 것이 아니라, 특정 과업이 얼마나 많은 임상적 결과(consequence)를 초래하느냐에 따라 판단한다는 점을 시사합니다. 과업이 직접적인 의료 결정처럼 느껴질수록, 사람들은 기계가 이를 처리하도록 두는 것에 더 주저하게 됩니다.
결정적으로, 이 수용의 사다리는 연구에 참여한 독일어 사용자와 이탈리아어 사용 인구 모두에게 동일했습니다. 설문 질문이 각 언어 집단의 문화적 뉘앙스에 맞게 번역되고 조정되었음에도 불구하고, 사람들이 과업을 순위 매기는 방식은 정확히 일치했습니다. 이 결과는 사람들이 이러한 기술을 평가하는 방식이 단순히 언어나 지역 문화의 문제가 아니라, 의료 과업의 본질에 대한 공유된 인간적 반응임을 입в니다. 이는 여러 언어를 사용하는 의료 체계가 각 집단을 근본적으로 다르게 취급할 필요 없이, 동일한 도구를 사용하여 신뢰를 측정할 수 있음을 의미합니다.
연구진은 또한 16개의 질문을 단 5개로 줄이면서도 이 패턴을 파악하는 능력을 잃지 않을 수 있다는 것을 발견했습니다. 쉬운 행정 업무부터 어려운 응급 결정까지 전체 범위를 포괄하는 5개의 특정 질문을 신중하게 선택함으로써, 연구진은 긴 설문지와 똑같이 정확한 짧은 양식을 만들어냈습니다. 이 짧은 버전은 시간이 제한된 바쁜 설문 조사에서 특히 유용하며, 응답자를 압도하지 않고도 대중의 정서를 빠르게 파악할 수 있게 해줍니다. 다만, 연구진은 복약 알림과 긴급 결정이라는 두 가지 극단적인 질문이 필수적인 기준점(anchors)인 반면, 중간에 위치한 세 가지 질문은 전체적인 난이도의 범위를 유지하는 한 구체적인 맥락에 따라 약간씩 변할 수 있다고 언급했습니다.
연구는 또한 이러한 견해를 가진 사람들의 유형을 더 깊이 살펴보았습니다. 대부분의 사람의 의견은 일반적인 사다리를 따랐지만, 약 30%의 응답자는 별개의 집단을 형성했습니다. 이들은 인공지능이 행정 업무를 처리하는 것에는 거부감이 없었으나, 임상적 결정에 손을 대는 것에 대해서는 단호하고 범주적인 선을 그었습니다. 이들에게 기계가 파일을 정리하는 것과 기계가 의사를 돕는 것의 차이는 정도의 문제가 아니라 종류의 문제였습니다. 이들은 두 영역을 별개로 보았으며, 하나는 수용하면서 다른 하나는 완전히 거부했습니다. 이는 상당수의 인구에게 있어 행정적 지원과 임상적 케어 사이의 경계는 기술이 넘을 수 없는 뚜렷한 선이라는 점을 시사합니다.
마지막으로, 연구진은 연령과 디지털 경험이 이러한 견해에 어떤 영향을 미치는지 조사했습니다. 단순한 데이터 집계에서는 고령층이 양 극단에 더 많이 분포하는 것처럼 보였습니다. 즉, 모든 AI를 거부하는 집단과 AI를 폭넓게 수용하는 집단 모두에서 고령층이 과잉 대표되었습니다. 그러나 연구진이 사람들이 일상생활에서 실제로 기술을 얼마나 사용하는지를 기준으로 조정했을 때, 이 패턴은 변화했습니다. 고령층의 겉으로 드러난 양극화 현상은 주로 그들의 디지털 경험 수준에 의해 설명되었습니다. 기술을 자주 사용하는 사람들은 연령에 관계없이 AI를 거부할 가능성이 낮았습니다. 이는 연령 그 자체보다 기술에 대한 친숙도가 수용도를 결정하는 더 강력한 동인임을 나타냅니다.
연구는 대중의 의료 인공지능에 대한 신뢰가 무작위적인 의견의 혼란스러운 조합이 아니라, 과업의 임상적 무게에 기반한 구조화된 계층 구조라는 결론을 내립니다. 이 구조는 견고하며, 다양한 언어와 문화권에서도 유효하며, 매우 짧은 질문 세트로 효과적으로 측정될 수 있습니다. 연구진은 이 지도가 현재의 일반 대중에게 적용된다는 점을 분명히 하면서도, 이 시스템을 매일 사용하는 의사와 간호사들도 동일한 신뢰의 사다리를 따르는지는 향-후 연구 과제로 남겨두었습니다. 현재로서는, 이 데이터가 대중의 경계를 존중하면서 의료 현장에 인공지능을 도입하는 방법에 대한 확실한 토대를 제공하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.