← 최신 논문
💻 computer science

The Intent Gap: A Taxonomy of Real-User Failure Modes in Frontier AI Agents

이 논문은 프런티어 AI 모델들이 문구 그대로의 프롬프트 준수에도 불구하고 실제 사용자의 요구를 충족하지 못하는 결정적인 '의도 격차(intent gap)'를 식별하며, 연구자들이 설계한 현재의 벤치마크들이 대규모 대화 코퍼스 마이닝을 통해 저자가 도출한 새로운 분류 체계로 정량화한 현상, 즉 실제 사용자들이 자신의 불만족을 거의 말로 표현하지 않는다는 점 때문에 이러한 배포 관련 실패들을 놓치고 있음을 밝히고 있다.

원저자: Kanupriya Yakhmi

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Kanupriya Yakhmi

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 오해: AI가 단어는 맞게 말하지만 의미는 틀릴 때

당신이 매우 똑똑하고 매우 문자 그대로만 이해하는 로봇에게 케이크를 굽는 법을 가르치고 있다고 상상해 보세요. 교실 환경에서 선생님은 로봇에게 완벽한 레시피 카드를 줄 수 있습니다: "밀가루 2컵, 달걀 3개를 섞고, 350도에서 구우세요." 로봇은 지시를 완벽하게 수행하여 당신에게 케이크를 건넵니다. 이것이 현재 대부분의 과학자들이 AI를 테스트하는 방식입니다. 그들은 수학 문제나 코딩 과제처럼 정답이 하나뿐인 명확하고 서술된 과제를 제시합니다. 이러한 테스트를 "벤치마크"라고 부르며, 이는 마치 시험관이 당신에게 정확히 어느 차선에서 회전하고 언제 멈춰야 하는지 알려주는 운전 면허 시험과 같습니다.

하지만 현실 세계는 운전 면허 시험이 아닙니다. 현실은 마음을 계속 바꾸는 승객과 함께하는 혼란스러운 자동차 여행에 더 가깝습니다. 당신이 "배고파"라고 말하면 승객은 샌드위치를 가져다줍니다. 당신이 "아니, 달콤한 게 먹고 싶었다는 뜻이었어"라고 말하면 그들은 쿠키를 가져옵니다. 그러다 당신이 한숨을 쉬며 "사실, 그냥 이야기하고 싶었던 거야"라고 말하면 그들은 이야기를 시작합니다. 인간이 실제로 대화하는 이 복잡하고 주고받는 방식은 AI에게 까다로운 영역입니다. 과학자들은 로봇이 문자 그대로 듣는 것과 인간이 실제로 의도하는 것 사이의 간극을 "의도 격차(intent gap)"라고 부릅니다. 이것은 로봇이 대본을 따르는 것과 로봇이 인간의 영혼을 이해하는 것 사이의 차이입니다. 만약 우리가 로봇을 완벽한 대본으로만 테스트한다면, 우리는 로봇이 세상을 맞이할 준비가 되었다고 생각했다가, 인간이 "잠깐, 내 말은 그 뜻이 아니었어"라고 말하는 순간 실패를 목격하게 될 것입니다.


논문: AI가 핵심을 놓칠 때를 포착하다

"의도 격차(The Intent Gap)"라는 제목의 이 연구 논문은 왜 AI 에이전트들이 모든 학교 시험을 통과하고도 실제 세상에서는 종종 실패하는지에 대한 탐정 이야기입니다. 저자인 카누프리야 야크미(Kanupriya Yakhmi)는 현재의 AI 테스트 방식이 연구자가 아닌 실제 사람들에 의해 설계되지 않았기 때문에 고장 났다고 주장합니다. 연구자들은 깨끗하고 선언적인 작업(예: "비에 관한 시를 써라")을 작성하지만, 실제 사용자는 무질서하고 대화적인 방식으로 말합니다. 사용자들은 AI가 말하지 않은 것을 알고 있다고 가정하고, 문장 중간에 생각을 바꾸며, 말 없이 좌절감을 느끼기도 합니다.

논문은 가장 큰 문제가 AI가 거짓말을 하거나(환각 현상) 답변을 거부하는 것이 아니라고 제안합니다. 가장 큰 문제는 바로 **의도 격차(Intent Gap)**입니다. 즉, AI가 프롬프트에는 완벽하게 답했지만 사용자가 실제로 원했던 것을 완전히 놓치는 순간입니다.

범인을 잡는 방법

이러한 실패를 찾아내기 위해 연구진은 단순히 AI에게 퍼즐을 풀라고 요청하지 않았습니다. 대신, 그들은 두 개의 거대한 실제 인간 대화의 바다(WildChat 및 LMS-Chat)에서 헤엄치며 좌절의 흔적을 찾았습니다. 그들은 사용자가 오해를 바로잡으려고 시도할 때를 포착하기 위해 "좌절 신호 필터(frustration-signal filter)"를 구축했습니다.

이것은 마치 누군가 "잠깐, 멈춰!" 또는 "다시 해봐!" 또는 "아니, 그게 아니야!"라고 말할 때만 녹화하는 보안 카메라와 같습니다. 연구진은 이러한 순간들을 찾기 위해 3단계 과정을 사용했습니다:

  1. 키워드 스캔: "내 뜻은", "당신이 오해했습니다", "쓸모없음"과 같은 특정 문구를 찾았습니다.
  2. 바이브 체크(Vibe Check): 컴퓨터 수학을 사용하여 사용자의 새로운 문장이 AI가 방금 말한 내용과 완전히 다른지 확인했습니다.
  3. 판사: 초지능 AI에게 대화를 검토하게 하여 "네, 첫 번째 AI가 핵심을 놓쳤습니다"라고 확인하게 했습니다.

발견한 사실: 침묵의 포기

결과는 놀라웠고, AI가 실전에 투입될 준비가 되었다고 기대하는 사람들에게는 다소 무서운 결과였습니다.

1. 대부분의 사람은 그냥 포기합니다.
연구진은 50,000개의 대화를 조사했습니다. 그 결과, 영어 대화의 **52.8%**가 단 한 번의 교환 후에 종료되었습니다. 사용자가 질문을 던졌고, AI가 답을 했으며, 사용자는 떠나버렸습니다. 연구진은 이들 중 상당수가 행복한 결말이 아니라 "침묵의 포기(silent abandonments)"였을 것이라고 추측합니다. 사용자는 적절하지 않은 답변을 받고 한숨을 쉬며, "당신이 틀렸다"라고 말하지 않고 떠난 것입니다. 사용자가 리뷰를 남기거나 불평을 하지 않았기 때문에, 우리의 품질 관리 시스템은 이들을 인지하지 못합니다. AI는 자신이 잘했다고 생각하지만, 사용자는 그냥 AI를 '읽씹(ghosting)'한 것입니다.

2. 실제 사람들은 "예의 바른" 수정 단어를 사용하지 않습니다.
사람들이 오해를 바로잡는 방식에 대한 기존 연구들은 "다시 설명하겠습니다"나 "당신이 오해했습니다"와 같은 문구 목록을 사용했습니다. 연구진은 이것들이 가장 흔한 좌절의 징후일 것이라고 생각했습니다. 하지만 틀렸습니다. 실제 데이터를 스캔했을 때, 가장 흔한 문구들은 짧고, 직설적이며, 매우 인간적이었습니다:

  • "i meant" (92회)
  • "can you please" (62회)
  • "try again" (53회)
  • "useless" (20회)
  • "hmm" (17회)

학술적인 목록들은 핵심을 놓쳤습니다. 화가 났을 때 실제 사람들은 교과서처럼 말하지 않습니다. 그들은 듣고 있지 않은 친구에게 말하듯 말합니다.

3. "아첨(Sycophancy)"의 미스터리.
AI 업계에는 AI가 친절해 보이기 위해 사용자가 틀렸을 때조차 동조하는 "아첨"에 대한 많은 이야기가 있습니다. 연구진은 데이터에서 이를 많이 발견할 것으로 예상했습니다. 하지만 발견하지 못했습니다. 확인된 실패 사례 중에서 아첨으로 인한 경우는 0건이었습니다.
이는 무서운 가능성을 시사합니다: 어쩌면 아첨은 너무 눈에 띄지 않아서 사용자 피드백으로는 감지할 수 없는 것일지도 모릅니다. AI가 당신에게 동조한다면, 당신은 아마 "아니, 그건 틀렸어!"라고 말하지 않고 그냥 받아들일 것입니다. 즉, AI가 우리에게 거짓말을 하거나 잘못된 아이디어에 동의하고 있을지라도, 우리가 불평하지 않기 때문에 우리는 영원히 알 수 없다는 뜻입니다.

4. 안전 필터 문제.
연구진이 AI 판사에게 이러한 대화들을 채점하도록 시도했을 때, 판사는 대화의 **62%**를 검토하기를 거부했습니다. 왜일까요? 실제 대화에 자극적이거나, 역할극, 또는 NSFW(업무 부적합) 콘텐츠가 포함되어 안전 필터가 이를 차단했기 때문입니다. 이는 큰 문제입니다. AI는 가장 "허용적인" 부분의 인간 대화에서 실패하고 있지만, 우리의 안전 도구들이 우리가 그 실패를 보는 것을 막고 있습니다.

새로운 실패 목록

연구진은 포착된 대화들을 바탕으로 AI가 실패하는 방식에 대한 새로운 "분류 체계(Taxonomy)"를 만들었습니다. 그들은 가장 흔한 실패가 무례하거나 거짓말을 하는 것이 아니라, 맥락을 놓치는 것이라는 점을 발견했습니다. 주요 카테지는 다음과 같습니다:

  • 암묵적 맥락 맹목성(Implicit-context blindness): AI가 단어는 답했지만 숨겨진 맥락을 놓침 (예: "작은" 파티를 위한 레시피를 요청했는데, "작은"이라는 말을 명시적으로 하지 않았다는 이유로 50인분 레시피를 제공함).
  • 목표 붕괴(Goal collapse): AI가 작은 세부 사항에 집중하다가 큰 그림을 잊어버림.
  • 구체성 불일치(Specificity mismatch): 사용자는 날카롭고 구체적인 답변을 원했지만, AI는 일반적이고 모호한 답변을 제공함.

시사점

이 논문은 우리가 AI를 잘못된 렌즈로 바라보고 있다고 결론짓습니다. 우리는 AI를 깨끗하고 완벽한 과제로 테스트하고 있지만, AI는 무질서한 실제 세상의 대화 속에서 사용되고 있습니다. "의도 격차"는 왜 78%의 기업이 AI 에이전트를 도입하려 노력함에도 불구하고 단 14%만이 성공하는지에 대한 이유입니다. AI는 글자 그대로 프롬프트에 답하고 있지만, 인간의 의도는 놓치고 있습니다.

연구진은 이를 해결하기 위해 AI를 서술형 시험을 치르는 학생처럼 테스트하는 것을 멈추고, 대화를 나누는 친구처럼 테스트하기 시작해야 한다고 제안합니다. 우리는 예의 바른 불평뿐만 아니라, "침묵의 포기"와 직설적인 "다시 해봐"라는 말에 귀를 기울여야 합니다. 그렇지 않으면 AI는 계속해서 단어는 맞게 말하면서도 핵심은 완전히 놓치게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →