← 최신 논문
💻 computer science

Position: We Need Practical AI Alignment Methods to Mirror Human Reasoning

본 포지션 페이퍼는 AI 시스템이 인간 사용자와 유사하게 추론하고 소통하는 인지적 정렬(cognitive alignment)을 달una하는 것이 신뢰할 수 있는 고위험 의사결정 도구를 구축하는 데 필수적이라고 주장하며, 현재의 방법론과 이 중요한 목표 사이의 간극을 메우기 위한 연구 의제를 제시한다.

원저자: Vijay Keswani, Breanna K. Nguyen, Cyrus Cousins, Vincent Conitzer, Walter Sinnott-Armstrong, Jana Schaich Borg

게시일 2026-08-14
📖 5 분 읽기🧠 심층 분석

원저자: Vijay Keswani, Breanna K. Nguyen, Cyrus Cousins, Vincent Conitzer, Walter Sinnott-Armstrong, Jana Schaich Borg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 결정을 내리는 법을 가르치려 한다고 상상해 보십시오. 컴퓨터 과학에서는 이를 "AI 정렬(AI alignment)"이라고 부릅니다. 이는 기계의 목표와 행동이 인간이 실제로 원하는 것과 일치하도록 만드는 기술입니다. 이것은 매우 똑똑하고 매우 빠른 개를 훈련시키는 것과 비슷합니다. 당신은 개가 공을 가져오기를 원하지, 다람쥐를 쫓아다니기를 원하지 않으며, 당신이 왜 공을 가져오라고 말했는지 그 이유까지 이해하기를 바랍니다. 하지만 여기에 까다로운 점이 있습니다. 때때로 로봇은 정답(공을 가져오는 것)을 맞히지만, 전혀 다른 이상한 논리를 사용하여 그 결과에 도달할 수 있습니다(예를 들어 공을 다람쥐라고 생각하는 경우). 이를 "인지적 불일치(cognitive misalignment)"라고 합니다.

대부분의 사람들은 로봇이 정확하기만 하면 만족할 것이라고 가정합니다. 하지만 만약 로봇의 사고방식이 우리에게 완전히 이질적으로 느껴진다면 어떨까요? 만약 로봇이 수학 문제를 풀 때, 정답은 맞더라도 인간에게는 마법처럼 보이는 방식으로 해결한다면 어떨까요? 이 논문은 중요한 질문을 던집니다. 생명이나 중대한 가치가 걸려 있는 상황에서, 우리는 정말로 로봇이 '어떻게' 생각하는지에 관심을 가질까요, 아니면 단지 '무엇'을 결정하는지에 관심을 가질까요? 저자들은 많은 이들에게 있어 '어떻게'가 '무엇'만큼이나 중요하다고 제안합니다. 우리는 우리의 AI가 단순히 초고속 계산기가 아니라, 사려 깊은 인간처럼 생각하기를 원합니다.

이 논문의 핵심 아이디어: 우리는 우리처럼 생각하는 로봇을 원한다

이 논문은 AI를 구축하는 과학자들을 향한 행동 촉구입니다. 저자들은 우리가 "인지적으로 정렬된(cognitively-aligned)" AI를 구축해야 한다고 주장합니다. 이는 단순히 AI가 정답을 내놓는 것을 의미하는 것이 아니라, AI가 인간에게 친숙하고 이해 가능한 방식으로 문제를 추론하며, 자신의 단계를 명확하게 설명할 수 있어야 함을 의미합니다.

이 아이디어를 테스트하기 위해, 연구진은 150명을 대상으로 설문 조사를 실시했습니다. 참가자들에게 세 가지 유형의 AI를 상상해 보라고 요청했습니다:

  1. 과정 은닉형 AI (Process-Hidden AI): 블랙박스 형태입니다. 답은 주지만, 어떻게 그 답에 도달했는지는 알 수 없습니다.
  2. 기계적 추론 AI (Machine-Reasoning AI): 답을 설명해주기는 하지만, 그 논리가 기이하고 생소하여 인간이 따라가기 어렵습니다(마치 모르는 언어로 쓰인 수학 증명처럼 말이죠).
  3. 인간적 추론 AI (Human-Reasoning AI): 사려 깊고 식견 있는 인간이 생각하는 방식과 유사한 논리를 사용하여 답을 설명합니다.

연구진은 세 가지 AI 모두 동일하게 정확하다는 점을 참가자들에게 분명히 전달했습니다. 그리고 물었습니다: "세 AI가 모두 정답을 맞힌다면, 당신은 어떤 AI를 신뢰하겠습니까?"

연구 결과: 우리는 "인간적인" 논리를 갈망한다

결과는 매우 명확했습니다, 특히 상황이 심각해질수록 더욱 그러했습니다. 날씨를 예측하거나 회의 일정을 잡는 것과 같이 이해관계가 낮은 작업에서는 사람들이 어떤 AI를 사용하든 크게 개의치 않았습니다. 하지만 신장 이식을 받을 환자를 결정하거나, 보석 허가 여부를 결정하거나, 군사 미사일의 조준 방향을 결정하는 것과 같이 이해관계가 높은 상황에서는 사람들은 강력하게 인간적 추론 AI를 선호했습니다.

실제로 테스트된 16가지 고위험 시나리오 중 5가지 상황에서, 통계적으로 유의미한 다수의 사람들이 인간처럼 생각하는 AI를 선택했습니다. 저자들은 25% 이상의 사람들이 "충분한 시간과 정보가 있다면 당신이 할 법한 방식으로 의사결정을 내린다"라는 품질 항목을 "필수적(essential)"이라고 평가했다는 것을 발견했습니다. 또한 25%는 이를 "매우 바람직함(very desirable)"이라고 평가했습니다.

이 논문은 생명이 걸려 있을 때, 우리는 단지 정답만을 원하는 것이 아니라 '왜'를 알고 싶어 한다는 점을 시사합니다. 우리는 AI가 공감, 공정성 또는 구체적인 의료적 세부 사항과 같이 우리가 고려할 법한 요소들을 고려했는지 알고 싶어 합니다. 만약 AI가 "외래적인" 논리를 사용한다면, 설령 그것이 옳더라도 위험하고 신뢰할 수 없게 느껴집니다. 그것은 마치 당신의 생명을 구했지만, 한 번도 본 적 없고 가족에게 설명할 수도 없는 수술 기법을 사용하는 외과의를 둔 것과 같습니다. 당신은 살아남을 수는 있겠지만, 아마도 매우 공포스러울 것입니다.

현재 AI의 문제점

저자들은 오늘날 대부분의 AI가 "상향식(bottom-up)" 방식으로 구축된다고 지적합니다. 과학자들은 인간의 선택 사례 수백만 개를 AI에게 입력하여 그 결과를 복제하도록 가르칩니다. 이는 앵무새에게 "사랑해"라는 문구를 수천 번 반복하게 하여 그 말을 배우게 하는 것과 같습니다. 앵무새는 맞는 말을 내뱉지만, 그 뒤에 담긴 감정은 실제로 이해하지 못합니다.

현재의 AI 정렬 방식은 종종 AI의 추론이 인간의 추론과 일치하는지 확인하는 데 실패합니다. 그들은 단지 최종 결과가 맞는지만을 확인합니다. 논문은 이것이 다음과 같은 이유로 문제가 된다고 주장합니다:

  • 검증 불가능한 설명: 현대의 많은 AI 모델(심층 신경망 등)은 "블랙박스"입니다. 설령 스스로를 설명하려고 시도하더라도, 우리는 그것이 실제로 어떻게 결정을 내렸는지에 대해 진실을 말하고 있는지 확신할 수 없습니다.
  • 인지적 불일치: AI가 어떻게 생각하는지 관찰할 수 있는 경우에도, AI는 종별로 인간과는 완전히 이질적인 논리를 사용하는 경우가 많습니다. 예를 들어, AI는 인간이 실생활에서 사용하지 않는 복잡한 수학 공식을 바탕으로 결정을 내릴 수 있습니다 있습니다.

앞으로 나아가야 할 방향

이 논문은 우리가 이 문제를 해결했다고 주장하는 것이 아닙니다. 대신, 이를 해결하기 위한 연구 과제를 제시합니다. 저자들은 다음과 같은 작업이 필요하다고 제안합니다:

  • 정렬 측정: AI의 사고 과정이 실제로 인간의 사고와 일치하는지 테스트하는 새로운 방법을 개발해야 합니다. 이는 사람들에게 자신의 선택을 설명하게 하거나, 눈 추적(eye-tracking)을 통해 그들이 무엇에 관심을 두는지 관찰하는 방식이 될 수 있습니다.
  • 더 나은 도구 구축: 특정 개인이나 집단처럼 생각하도록 "조율(tuning)"할 수 있는 AI를 만들어야 합니다. 의사가 질병을 진단하는 특유의 방식이나 판사가 증거를 검토하는 방식에 맞춰 조정할 수 있는 AI를 상상해 보십시오.
  • 갈등 처리: 때때로 사람들은 공정성과 같은 것을 원한다고 말하면서도, 실제 선택에서는 속도와 같은 다른 것을 원하기도 합니다. 논문은 인간이 과거의 선택을 바탕으로 무엇을 원하는지 단순히 추측하는 것이 아니라, 인간이 진정으로 AI가 무엇을 하길 원하는지 파악할 수 있도록 돕는 상호작용 도구가 필요하다고 제안합니다.

결론

이 논문은 의료, 법률, 군사 결정과 같이 이해관계가 높은 상황에서 AI가 진정한 신뢰할 수 있는 파트너가 되기 위해서는 단순히 똑똑한 것 이상의 것이 필요하다고 제안합니다. AI는 "인지적으로 정렬"되어야 합니다. AI는 인간처럼 느껴지는 방식으로 추론하고, 우리가 이해할 수 있는 방식으로 단계를 설명하며, 그 논리가 우리의 가치와 일치하는지 우리가 확인할 수 있게 해주어야 합니다. 저자들은 만약 이 과정이 없다면, AI가 아무리 정확하다고 주장하더라도 많은 사람이 AI에게 중대한 결정을 맡길 만큼 충분한 신뢰를 보내지 않을 것이라고 주장합니다. 이는 단지 정답을 얻는 문제가 아닙니다. 그것은 우리에게 말이 통하는 방식으로 기계와 대화를 나누는 것에 관한 문제입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →