On Benchmarking Human-Like Intelligence in Machines
이 논문은 현재의 AI 평가 패러다임이 검증되지 않은 레이블과 생태학적으로 타당하지 않은 과업과 같은 문제들로 인해 인간과 유사한 인지 능력을 정확하게 평가하는 데 실패한다고 주장하며, 기존 9개 벤치마크에 대한 인간 평가 연구를 바탕으로 더욱 엄격한 벤치마킹을 위한 다섯 가지 구체적인 권고안을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 인간처럼 행동하는 법을 가르치려 한다고 상상해 보십시오. 단순히 수학을 아주 잘하거나 날씨를 예측할 수 있는 수준을 원하는 것이 아니라, 당신이 하는 것처럼 생각하고, 느끼고, 반응하기를 원하는 것입니다. 이것이 바로 '인간다운 지능(human-like intelligence)'의 세계입니다. 수십 년 동안 과학자들은 단순히 문제를 해결하는 것을 넘어, 인간이 세상을 다루는 복잡하고 혼란스러우며 때로는 모순적인 방식을 이해하는 기계를 만들기 위해 이러한 디지털 정신을 구축해 왔습니다. 하지만 여기에 까다로운 문제가 있습니다. 로봇이 실제로 인간처럼 행동하고 있는 것인지, 아니면 그저 연기를 아주 잘하는 배우처럼 흉내를 내고 있는 것인지 어떻게 알 수 있을까요? 이를 알아내기 위해 연구자들은 보통 로봇에게 테스트를 실시합니다. 그런데 만약 그 테스트 자체가 고장 난 것이라면 어떨까요? 실제 인간이라면 수십 가지의 서로 다른, 약간은 불확실한 답변을 내놓을 상황에서, 테스트가 단 하나의 완벽한 정답만을 기대하고 있다면 어떨까요? 이 논문은 바로 그 문제에 대해 파고들며, 현재의 AI 테스트 방식이 마치 재즈 즉흥 연주가에게 단 하나의 완벽한 음을 연주하라고 요구하며서 음악성을 평가하는 것과 같다고 주장합니다.
이 논문의 저자인 유수 대학의 연구진은 우리가 현재 '인간다운' 지능을 올바르게 측정하는 데 실패하고 있다고 주장합니다. 그들은 많은 인기 있는 AI 테스트들이 너무 단순하며, 실제 사람들의 사고방식과 일치하지 않는 '정답(ground truth)' 라벨에 의존하고 있다고 제안합니다. 이 점을 증명하기 위해, 그들은 117명의 실제 인간에게 9가지의 서로 다른 AI 테스트를 수행하게 하는 대규모 실험을 진행했습니다. 이 테스트들은 비꼬는 말투(sarcasm) 포착하기, 농담이 재미있는지 결정하기, 혹은 사회적 상황이 얼마나 지지적인지 판단하기 등의 내용을 포함했습니다. 인간들은 단순히 "A, B, 또는 C"를 선택하는 대신, 슬라이더를 사용하여 자신의 느낌이 얼마나 강한지, 그리고 그 느낌에 대해 얼마나 확신하는지를 나타냈습니다.
결과는 놀라웠습니다. 논문은 이러한 많은 테스트에서 AI가 학습한 '정답'이 실제 대부분의 사람들이 생각하는 것과는 달랐다고 시사합니다. 예를 들어, '사회적 지지(social support)'에 관한 과제에서, 테스트는 특정 문장을 '지지적이지 않음'이라고 규정했지만, 인간들은 평균적으로 그것을 '어느 정도 지지적임'이라고 평가했습니다. 더욱 흥별하게도, 인간들은 단순히 테스트와 의견이 달랐던 것이 아니라, 서로 '구조적인 방식'으로 의견이 엇갈렸습니다. 어떤 사람들은 자신의 답변에 매우 확신을 가졌던 반면, 어떤 이들은 불확실했으며, 그들의 의견은 넓은 스펙트럼에 걸쳐 다양했습니다. 논문은 현재의 AI 벤치마크가 이러한 '무질서함(messiness)'을 간과하고 있다고 밝힙니다. 그들은 인간의 판단을 하나의 정답이 있는 수학 문제처럼 취급하지만, 실제로는 모두가 조금씩 다른 관점을 가진 대화에 더 가깝습니다.
저자들은 더 나은 테스트를 구축하기 위한 다섯 가지 새로운 규칙을 제안합니다. 첫째, 인간이 무엇을 생각하는지 추측하는 것을 멈추고, 실제로 사람들에게 물어보고 실제 데이터를 수집하여 이를 '골드 스탠다드(gold standard)'로 사용해야 합니다. 둘째, 하나의 정답을 찾는 대신, AI가 인간 답변의 전체 '분포(distribution)'와 비교되도록 해야 합니다. 즉, 어떤 사람은 이렇게 생각하고 어떤 사람은 저렇게 생각한다는 사실을 AI가 포착할 수 있는지 확인해야 합니다. 셋째, 우리는 '단계성(gradedness)'을 측정해야 합니다. 인간은 결코 100% 확신하거나 0% 확신하지 않습니다. 그들은 '대체로 그렇다'거나 '약간 아니다'라고 느낍니다. 논문은 단순한 예/아니오의 선택을 강요하기보다 슬라이더와 확신도 측정을 사용하여 이러한 미묘함을 포착해야 한다고 제안합니다. 넷째, 테스트는 무작위 질문이 아니라 깊은 심리학적 이론에 기반해야 합니다. 아이가 '틀린 믿음(false belief)' 테스트를 통과한다고 해서 로봇이 같은 테스트를 통과하는 것이 곧 진정한 '마음 이론(Theory of Mind)'을 가졌음을 의미하는 것은 아닙니다. 테스트는 그 기술의 복잡한 부분을 실제로 측정할 수 있도록 설계되어야 합니다. 다섯째, 과제 자체는 실제 삶과 더 닮아야 합니다. 실제 삶은 모호하고, 혼란스러우며, 맥락으로 가득 차 있습니다. 만약 테스트가 너무 깔끔하고 단순하다면, 그것은 AI가 실제 세상을 다룰 수 있는지 알려주지 못합니다.
요컨대, 이 논문은 우리가 인간과 같이 생각하는 AI를 구축하려면 인간의 지능을 객관식 퀴즈처럼 취급하는 것을 멈춰야 한다고 제안합니다. 우리는 불확실성, 의견의 불일치, 그리고 회색 지대를 받아들여야 합니다. 인간 사고의 풍부하고 다양하며 때로는 혼란스러운 본질을 반영하는 테스트를 설계함으로써, 우리는 마침내 단순히 똑똑해 보이는 것이 아니라 실제로 인간처럼 느껴지는 기계를 만들기 시작할 수 있을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.