Language Models Reproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment
이 연구는 거대언어모델이 인간 전문가보다 더 높은 지적 겸손을 보임에도 불구하고, 사회적 욕구보다 생물학적 생존을 우선시함으로써 인간의 결정 불일치와 신경발달 장애 평가에서의 환원주의적 편향을 여전히 재현하고 있다는 점을 밝히며, 이는 AI가 고위험 정신 건강 결정에서 실행하는 개념적 틀을 비판적으로 평가할 필요가 있음을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 정신 건강 관리의 세계에서 의사와 심리학자들은 종종 어려운 과제에 직면합니다. 바로 한 개인의 상태가 정부 지원을 받기에 충분히 심각한지를 결정하는 일입니다. 이것은 단순히 질병을 진단하는 문제가 아닙니다. 한 사람이 자신의 삶을 얼마나 스스로 관리할 수 있는지를 판단하는 문제입니다. 많은 곳에서 이 판단은 한 가족이 돌봄을 위한 자금을 받을지, 특수 주거 시설을 이용할 수 있을지, 혹은 부모가 집에 머물며 도울 수 있는 권리를 가질지를 결정합니다. 이 결정은 특정 질문에 달려 있습니다. 이 사람이 독립적으로 살 수 있는가, 아니면 기본적인 욕구를 충족하기 위해 지속적인 도움이 필요한가? 자폐증이나 주의력 결핍 과잉 행동 장애(ADHD)와 같은 신경 발달 장애를 가진 사람들에게 그 답은 결코 단순하지 않습니다. 그들의 고충은 의사의 진료실에서는 보이지 않을 수 있지만, 실제 세상에서는 압도적일 수 있습니다. 이러한 결정은 매우 중대한 무게를 지니기 때문에, 인공지능이 이러한 과정을 더 공정하고 일관되게 만드는 데 도움을 줄 수 있다는 희망이 커지고 있습니다. 글을 쓰고 추론할 수 있는 강력한 컴퓨터 프로그램인 대규모 언어 모델은 인간과 같은 공정한 심판 역할을 할 수 있는지 테스트되고 있습니다. 하지만 우리가 이토록 중대한 선택을 이들에게 맡기기 전에, 우리는 그들이 세상을 어떻게 바라보는지 이해해야 합니다. 그들은 인간의 필요를 인간과 같은 방식으로 해석할까요, 아니면 독립을 가능하게 하는 삶의 미묘하고 사회적인 부분들을 놓치고 있는 것일까요?
폴란드의 한 연구팀은 인간 전문가와 인공지능을 모두 엄격한 일련의 시험에 투입하여 이를 테스트하기로 했습니다. 연구진은 장애 평가 위원회(누가 지원을 받을지 결정하는 위원회)에서 정기적으로 활동하는 의사 18명과 심리학자 17명을 포함한 총 35명의 인간 전문가를 모았습니다. 이들과 공정하게 비교하기 위해, 연구진은 선도적인 기술 기업들의 서로 다른 7가지 대규모 언어 모델을 선정했습니다. 목표는 기계가 인간과 같은 실수를 저지를 것인지, 아니면 새로운 종류의 편향성을 가져올 것인지를 확인하는 것이었습니다. 연구진은 세 가지 구체적인 사항을 조사하는 연구를 설계했습니다. 첫째, 결정권자들이 정보의 순서나 오해를 불러일으키는 사진에 의해 속을 수 있는지, 둘째, 자신의 지식에 대해 얼마나 겸손한지, 그리고 가장 중요한 셋째, 그들이 "기본적인 생활 욕구"라는 문구를 어떻게 정의하는지였습니다.
실험은 일련의 가상의 사례 연구와 함께 시작되었습니다. 인간 전문가와 컴퓨터 모델들은 다양한 질환을 가진 사람들에 대한 설명을 읽고 두 가지 질문에 답하도록 요청받았습니다. 먼저, 그들은 해당 인물의 기능 수준을 평가해야 했습니다. 둘째, 그 사람은 독립적으로 살기 위해 지속적인 돌봄이나 도움이 필요한지 결정해야 했습니다. 결정권자들이 무관한 세부 사항에 쉽게 휘둘리는지 테스트하기 위해, 연구진은 몇 가지 속임수를 사용했습니다. 어떤 경우에는 사람의 어려움에 대한 부정적인 정보를 이야기의 맨 처음에 배치하여, 독자가 그 나쁜 첫인상에 갇히기를 기대했습니다. 또 다른 경우에는, 중립적인 사진이 담긴 이야기와 동일한 내용이지만 슬프거나 괴로워 보이는 얼굴의 사진을 첨부하기도 했습니다. 연구진은 슬픈 얼굴을 보는 것이, 설령 텍스트에서 그 사람이 잘 지내고 있다고 말하더라도 전문가들로 하여금 더 많은 지원을 승인하게 만드는지 보고 싶었습니다.
이러한 속임수에 대한 결과는 양측 모두에서 놀라울 정도로 일관적이었습니다. 인간 전문가와 인공지능 모델 모두 텍스트의 순서나 사진의 감정에 따라 결정이 유의미하게 변하지 않았습니다. 두 집단 모두 이러한 방해 요소들을 넘어 핵심 사실에 집중하는 듯 보였습니다. 이는 모델들이 인간을 곤혹스럽게 만들 수 있는 시각적 또는 텍스트적 단서에 쉽게 속지 않는다는 것을 시사하며, 이는 안도감을 주는 결과였습니다. 그러나 연구진이 실제 결정 내용을 더 깊이 들여다보았을 때, 다른 종류의 문제가 나타났습니다. 인간과 기계 모두 논리적으로 매우 일관되지 못하다는 점을 발견했습니다. 어떤 사람은 기능 수준이 "현저히 저하됨"으로 평가되었음에도 불구하고, 정작 그 사람은 필요한 지원을 받지 못할 수도 있었습니다. 반대로, "평균적"인 기능 수준을 가진 사람이 도움을 받을 수도 있었습니다. 기능 수준에 대한 평가는 지원 여부를 신뢰할 만하게 예측하지 못했습니다. 이러한 불일치는 인간 의사와 컴퓨터 모델 모두에게서 나타났으며, 이는 문제를 설명하는 것에서 해결책을 승인하는 단계로 넘어가는 과정이 기계가 물려받은 복잡하고 인간적인 과정임을 시사합니다.
아마도 연구의 가장 드러나는 부분은 연구진이 참가자들에게 자신의 생각을 설명해 달라고 요청했을 때였을 것입니다. 연구진은 인간과 기계에게 "기본적인 생활 욕구"가 실제로 무엇을 의미하는지 정의하도록 했습니다. 여기서 명확한 차이가 나타났습니다. 인간 심리학자들은 더 넓은 관점을 갖는 경향이 있었습니다. 그들은 정서적 안녕, 의사소통 능력, 사회적 연결을 필수적인 기본 생활의 일부로 포함했습니다. 만약 어떤 사람이 타인과 대화할 수 없거나 사회적 신호를 이해하지 못한다면, 심리학자들은 그것을 기본적 욕구의 미충족으로 보았습니다. 반면, 인간 의사들은 더 좁은 관점을 취했습니다. 그들은 전적으로 신체적 생존, 즉 먹고, 입고, 걷고, 화장실을 사용하는 능력에 집중했습니다. 인공지능 모델들은 놀랍게도 의사들의 편을 들었습니다. 모델들은 기본 욕구를 거의 전적으로 생물학적 생존과 자기 돌봄의 관점에서 정의했습니다. 그들은 신체적 안전과 직접적으로 연결되지 않는 한 의사소통이나 사회적 상호작용을 거의 언급하지 않았습니다.
이러한 정의의 차이는 최종 결정에 직접적인 영향을 미쳤습니다. 심리학자들은 사회적, 의사소통적 어려움을 "기본적 욕구"의 정의에 포함했기 때문에, 가상의 환자들에게 지원을 승인할 가능성이 훨씬 높았습니다. 의사와 인공지능 모델들은 엄격한 생물학적 체크리스트를 고수하며 지원을 덜 승인했습니다. 모델들은 자신들의 지식에 대해 매우 겸손하다고 주장하며 인간 의사들보다 지적 겸손도 테스트에서 높은 점수를 받았지만, 이러한 겸손함이 결정의 일관성을 높이거나 인간 전문가와 일치하게 만들지는 못했습니다. 사실, 모델들의 높은 겸손 점수는 인간의 복잡성을 깊이 있게 이해하는 것이 아니라, 표면적인 특성에 불과했습니다. 기계들은 자신이 틀릴 수 있다고 말할 용의는 있었지만, 여전히 인간의 복잡성을 놓친 좁은 의료적 프레임워크 안에서 작동하고 있었습니다.
연구는 인공지능이 슬픈 사진이나 혼란스러운 문장 순서와 같은 단순한 속임수는 무시할 수 있을지 몰라도, 이러한 민감한 영역에서 인간의 판단을 대체할 준비는 아직 되지 않았다고 결론짓습니다. 모델들은 신체적 독립보다 사회적, 의사소통적 연결을 더 가치 있게 여기는 환원주의적 관점을 재현하고 있습니다. 신체의 기능 능력에만 집중함으로써, 기계는 상호작용과 이해의 영역에서 가장 큰 어려움을 겪는 사람들에게 지원을 거부할 위험이 있습니다. 연구진은 인공지능이 정신 건강 및 장애 평가에서 진정으로 유용해지려면, 단순히 생물학적 기계가 아닌 '전체적인 사람'을 보는 법을 배워야 한다고 제언합니다. 기술이 인간의 삶이 갖는 온전한 무게를 파악할 수 있을 때까지, 이 결정을 인공지능에 맡기는 것은 인간 전문가들의 업무를 오랫동안 복잡하게 만들어온 좁은 관점을 단순히 강화하는 일이 될 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.