A Rigorous Turing Test: a Foundation for Evaluating Artificial General Intelligence
이 논문은 거대 언어 모델이 튜링 테스트를 통과했다는 주장이 성급하다고 주장하는데, 이는 엄격하고 제약 없는 튜링의 원래 모방 게임 구현을 통해 인간 판별자들이 이전 연구들에서 사용했을 수 있는 짧은 시간 제한과는 달리 AI를 인간으로부터 쉽게 구별해 낼 수 있었기 때문이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 메시지를 읽는 것만으로는 상대가 실제 사람인지 아니면 매우 똑똑한 로봇인지 구별할 수 없는 세상을 상상해 보십시오. 이것이 바로 수십 년 동안 과학자, 철학자, 그리고 호기심 많은 이들 사이에서 논쟁을 불러일으킨 유명한 개념인 '튜링 테스트(Turing Test)'의 핵심입니다. 이것을 궁극의 '임포스터 게임(imposter game, 정체를 숨긴 자 찾기 게임)'이라고 생각해 보십시오. 이 게임에서 인간 심판은 화면을 통해 두 명의 숨겨진 플레이어와 대화를 나눕니다. 한 명은 인간이고, 다른 한 명은 기계입니다. 심판의 임무는 어느 쪽이 누구인지 알아내는 것입니다. 만약 기계가 심판을 속여 자신이 인간이라고 믿게 만든다면, 그 기계는 테스트를 통과하게 됩니다. 이것은 단순한 유희가 아닙니다. 기계가 정말로 우리처럼 '생각'할 수 있는지에 대한 진지한 질문입니다. 인공지능이 이야기를 쓰고, 수학 문제를 풀고, 친구처럼 대화하는 능력이 향상됨에 따라, 사람들은 묻고 있습니다. "우리는 마침내 우리를 속일 수 있는 기계를 만들어낸 것인가?" 만약 그렇다면, 그것은 우리가 기술, 법, 그리고 인간이라는 존재의 의미를 바라보는 방식을 완전히 바꿔 놓을 것입니다.
이제, 이 논쟁을 아주 엄격하고 신중한 실험으로 종결시키기로 결심한 한 연구팀을 만나보십시오. 그들은 최고 수준의 AI인 GPT-4-Turbo가 실제로 튜링 테스트를 통과할 수 있는지 확인하고 싶었습니다. 하지만 여기서 반전이 있습니다. 그들은 단순히 게임을 수행한 것이 아니라, 1950년 테스트의 창시자인 앨런 튜링이 작성한 원래의 엄격한 규칙에 따라 게임을 진행했습니다. 이전의 많은 연구는 AI가 테스트를 통과했다고 주장했지만, 연구진은 그 게임들이 대화를 단 5분 만에 끝내는 것과 같은 지름길을 사용했을 것이라고 의심했습니다. 그들은 시간 제한을 없애고 대화가 실제 친구 사이의 대화처럼 자연스럽게 흐르도록 했을 때 어떤 일이 일어나는지 보고 싶었습니다.
결과는 놀라웠으며, AI에 대한 과장된 기대에 대한 현실적인 점검이 되었습니다. 이 엄격한 실험에서 인간 심판들은 로봇을 대부분의 경우 더 자주 식별해 냈지만, 완벽한 점수를 얻을 정도로 쉽게 찾아내지는 못했습니다. AI가 인간인 척 시도한 37번의 게임 중, 심판들은 16번의 사례에서 컴퓨터를 정확히 식별했습니다. 이는 인간의 성공률이 43%임을 의미하며, 즉 AI가 심판을 속이는 데 성공한 경우가 과반수(57%)였다는 뜻입니다. 그러나 연구진은 심판들의 성과가 무작위 추측과 비교했을 때 통계적으로 유의미했음에도 불구하고, AI가 여전히 대부분의 시도에서 심판들을 속여냈다는 것을 발견했습니다. 이 연구는 AI가 아무리 인상적으로 들릴지라도, 적어도 이러한 엄격한 조건 하에서는 아직 인간이 되는 기술을 완전히 터득하지 못했음을 시사합니다. 왜냐하면 AI가 발각되는 것보다 심판을 속이는 경우가 더 많았기 때문입니다.
연구의 가장 흥ered한 부분 중 하나는 게임이 얼마나 오래 걸렸는가 하는 점이었습니다. 이전의 실험들은 종종 심판들에게 단 5분 안에 결정을 내리도록 강요했습니다. 연구진은 심판들이 충분한 시간을 갖도록 했을 때 게임이 훨씬 더 오래 지속된다는 것을 발견했습니다. 평균적으로 '인간 대 로봇' 게임은 약 14분이 걸렸고, '남성 대 여성' 게임은 약 24분으로 더 오래 걸렸습니다. 이는 다른 연구에서 사용된 5분의 제한 시간이 너무 짧아서, 심판들이 정체를 파악하기도 전에 빠르게 추측하도록 강요했을 수 있음을 말해줍니다. 충분한 시간이 주어졌을 때, 심판들은 로봇을 더 자주 잡아낼 만큼 예리해졌지만, 그럼에도 AI는 대부분의 대화에서 제 몫을 다했습니다.
연구진은 또한 AI가 일부 초기 연구에서 시도했던 것처럼, 어린 십 대와 같은 특정 유형의 사람처럼 행동함으로써 사람들을 속일 수 있는지도 살펴보았습니다. 이러한 기술을 사용하더라도, AI는 긴 호흡의 서두르지 않는 대화 속에서는 이전의 짧은 테스트들에서만큼 자주 심판들을 속이지 못했습니다. 연구는 AI가 이미 튜링 테스트를 통과했다는 주장은 시기상조일 가능성이 높다고 결론짓습니다. AI가 멍청해서가 아니라, 인간에게 생각하고 대화할 충분한 시간을 주면 로봇의 '가면'이 완전히 벗겨지지는 않더라도 서서히 드러나기 시작하기 때문입니다.
그렇다면 이것이 미래에는 무엇을 의미할까요? 연구진은 튜링 테스트가 기계가 진정으로 지능적인지를 확인하는 데 여전히 중요한 도구라고 믿습니다. 그들은 우리가 벌써 AI의 승리를 선언해서는 안 된다고 제안합니다. 대신, 우리는 계속 테스트하고, 규칙을 계속 개선하며, 어려운 질문들을 계속 던져야 합니다. 한 연구원이 언급했듯이, 이 테스트는 앞으로도 수년간 우리가 기계 지능을 이해하는 방식의 중심적인 역할을 할 것입니다. AI가 시간 압박 없이 길고 편안한 대화 속에서 인간 심판을 일관되게 속일 수 있을 때까지, "기계가 생각할 수 있는가?"라는 질문은 열려 있을 것이며, 로봇은 여전히 그 방 안의 임포스터로 남을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.