← 최신 논문
💬 NLP

Reasoning about Intent for Ambiguous Requests

이 논문은 추가적인 상호작용 단계나 명시적인 감독 없이도 커버리지와 투명성을 개선하기 위해, 모호한 요청에 대한 여러 가지 유효한 해석을 나열하는 단일 구조화된 응답을 생성하는 강화 학습 기반의 방법을 제안한다.

원저자: Irina Saparina, Mirella Lapata

게시일 2026-08-11
📖 7 분 읽기🧠 심층 분석

원저자: Irina Saparina, Mirella Lapata

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거의 모든 것을 알고 있는 초지능 로봇과 대화하고 있다고 상상해 보세요. 당신은 질문을 던졌지만, 연도나 구체적인 대상의 종류 같은 아주 작은 세부 사항을 말하는 것을 깜빡했습니다. 인공지능의 세계에서 이것을 "모호성(ambiguity)"이라고 부릅니다. 이것은 마치 친구에게 "가장 좋은 영화가 뭐야?"라고 물으면서, 무서운 공포 영화를 원하는지 아니면 재미있는 코미디를 원하는지 말해주지 않는 것과 같습니다. 로봇은 당신이 무엇을 의미하는지 추측해야 합니다. 보통 로봇은 그냥 하나의 추측을 선택해 답변을 내놓고, 잘 맞기를 바랍니다. 만약 로봇이 잘못 추측한다면, 당신은 답답한 답변을 받게 되거나, 더 나쁘게는 의도를 오해하여 실수로 위험한 것을 제공할 수도 있습니다. 에든버러 대학교의 연구진들이 작성한 이 논문은, 로봇에게 추측하는 것을 멈추고 모든 옵션을 한꺼번에 나열하도록 가르침으로써 이 "잘못된 추측" 문제를 해결합니다.

연구자 이리나 사파리나(Irina Saparina)와 미렐라 라파타(Mirella Lapata)는 이러한 까다로운 질문을 처리하기 위한 새로운 방법을 제안합니다. 이들의 방법인 IntentRL은 모델이 조용히 하나의 해석에 몰두하는 대신, 마치 도움이 되는 사서처럼 행동하도록 강제합니다. 사서는 이렇게 말할 것입니다. "당신이 '가장 좋은 영화'를 요청하신 것을 확인했습니다. 여기 세 가지 다른 해석 방식이 있습니다: 1) 가장 좋은 공포 영화, 2) 가장 좋은 코미디, 3) 역대 최고의 영화. 각 경우에 대한 답변은 다음과 같습니다." 이 논문은 모델이 이러한 다양한 의미와 그에 상응하는 답변을 한 번에 명시적으로 나열하도록 훈련함으로써, 혼란을 피하고 AI를 더 안전하고 투명하게 만들 수 있다고 제안합니다. 연구진은 대화형 질문 답변과 컴퓨터 코드 작성(특히 데이터베이스를 위한 SQL 쿼리) 작업에서 이 방법을 테스트했으며, 사용자의 명확한 설명을 요구하거나 단순히 로봇이 맞기를 바라는 기존의 기술들보다 더 많은 정답을 찾아낸다는 것을 발견했습니다.

문제점: 로봇의 "한 번에 끝내는" 추측

당신이 로봇과 "스무고개" 게임을 하고 있다고 상상해 보세요. 당신이 "빨간색 과일을 생각하고 있어"라고 말합니다. 로봇은 즉시 "사과!"라고 외치며 멈춥니다. 하지만 잠깐만요! 당신은 사실 딸기를 생각하고 있었거나, 체리, 또는 빨간 피망을 생각하고 있었을 수도 있습니다. 로봇은 "베리를 말하는 건가요?" 혹은 "채소를 말하는 건가요?"라고 묻지 않았습니다. 로봇은 단지 자신의 디지털 머릿속에 가장 먼저 떠오른 것을 선택했을 뿐입니다.

현실 세계에서는 이런 일이 항상 일어납니다. 사람들은 컴퓨터와 대화할 때 종종 말을 짧게 하거나 세부 사항을 빠뜨립니다. 사용자가 "예산이 2천만 달러인 영화를 보여줘"라고 요청할 수 있는데, 이때 사용자는 "공포와 스릴러 둘 다 해당하면서 예산이 2천만 달러인 영화"를 의미할 수도 있고, "공포 또는 스릴러 중 하나에 해당하는 예산 2천만 달러인 영화"를 의미할 수도 있습니다. 만약 로봇이 잘못된 의미를 선택한다면, 그 답변은 쓸모가 없게 됩니다. 더 심각하게는, 만약 로봇이 "추론 모델"(오랫동안 생각하는 모델)이라면, 잘못된 아이디어를 쫓느라 수천 개의 "토큰"(생각 단계의 단위)을 낭비하며 에너지를 소모하고 자신의 실수를 강화할 수도 있습니다.

기존의 방식들: 질문하기 또는 장황하게 말하기

이 새로운 방법이 나오기 전, 과학자들은 이를 해결하기 위해 두 가지 주요 방법을 시도했습니다:

  1. 명확화 질문(The Clarification Question): 로봇이 멈춰서 "공포 영화를 원하시나요, 아니면 스 thriller인가요?"라고 묻는 방식입니다. 이는 효과적이지만 번거롭습니다. 빠른 질문을 긴 주고받기 대화로 만들어 버리기 때문입니다. 이는 마치 친구에게 과일을 물어볼 때마다 "잠깐, 빨간 사과를 원하는 거야, 아니면 빨간 딸기를 원하는 거야?"라고 매번 묻는 것과 같습니다.
  2. 장문 답변(The Long-Form Answer): 로봇이 매우 도움이 되기 위해 모든 것을 다루는 거대한 단락을 쓰는 방식입니다. "만약 공포 영화를 의미한다면 X이고, 스릴러를 의미한다면 Y이며, 둘 다라면 Z입니다." 이는 종종 지저분하고 읽기 어렵습니다. 이는 마치 친구가 간단한 질문에 답하기 위해 10페이지짜리 에세이를 주는 것과 같습니다. 게다가, 의미가 서로 충돌하는 경우(예: "공포와 스릴러 둘 다인 영화를 보여줘" vs "공포 또는 스릴러 중 하나인 영화를 보여줘") 이를 하나의 매끄러운 이야기로 합치기가 어렵습니다.

새로운 해결책: "메뉴" 접근법

이 논문의 저자들은 세 번째 방법인 **구조화된 메뉴(The Structured Menu)**를 제안합니다. 로봇은 추측하거나 장황하게 설명하는 대신, 깔끔한 "해석-답변 쌍(Interpretation-Answer Pairs)"의 목록을 생성합니다.

이것은 메뉴가 모호한 레스토랑에서 주문하는 상황을 생각해보면 쉽습니다. 만약 당신이 "스페셜 메뉴로 할게요"라고 말했는데, 그 스페셜이 버거일 수도 있고 샐러드일 수도 있다면, 일반적인 웨이터는 그냥 버거를 가져다줄 것입니다. 하지만 IntentRL 로봇은 세 개의 작은 접시가 놓인 쟁반을 가져옵와 같습니다:

  • 접시 1: "만약 버거 스페셜을 의미하셨다면, 여기 버거가 있습니다."
  • 접시 2: "만 if 샐러드 스페셜을 의미하셨다면, 여기 샐러드가 있습니다."
  • 접시 3: "만약 스프 스페셜을 의미하셨다면, 여기 스프가 있습니다."

로봇은 이 과정을 단 한 번의 단계로 수행합니다. 당신이 "아니요, 샐드를 원했어요"라고 말할 때까지 기다리지 않습니다. 그냥 모든 옵션을 명확하게 라벨을 붙여 한 번에 제공합니다. 이는 다음과 같은 이유로 매우 좋습니다:

  • 투명성: 로봇이 왜 그런 답변을 냈는지 그 이유를 알 수 있습니다.
  • 속ness: 두 번째 대화를 위해 기다릴 필요가 없습니다.
  • 안전성: 만약 어떤 답변이 위험하다면, 다른 옵션들도 함께 보고 있기 때문에 즉시 알아챌 수 있습니다.

로봇을 가르치는 법: "이중 목표" 게임

로봇에게 이렇게 하는 법을 가르치는 것은 까다롭습니다. 단순히 질문과 답변의 목록을 보여주는 것만으로는 부족합니다. 로봇은 언제 여러 가지를 나열해야 하고, 언제 단 하나의 답변만 내놓아야 하는지를 배워야 하기 때문입니다. 만약 항상 다섯 가지 옵션을 나열하도록 가르친다면, "2+2는?" 같은 단순한 질문을 했을 때도 로봇은 당신을 짜증 나게 할 것입니다.

연구진은 강화 학습(Reinforcement Learning)(강아지에게 간식을 주며 훈련시키는 것을 생각하세요) 기술을 사용했습니다. 그들은 로봇에게 특별한 "이중 보상" 시스템을 부여했습니다:

  1. "모두 잡기" 보상 (재현율, Recall): 질문이 모호할 때(예: "다른 주(state)가 통치했던 곳은 어디인가요?"), 로봇이 가능한 모든 유효한 답변을 나열하면 큰 보상을 받습니다. 이는 낚시 게임에서 단 한 종류의 물고기만 잡는 것이 아니라, 연못에 있는 모든 종류의 물고기를 잡아야 점수를 얻는 것과 같습니다.
  2. "정밀도" 보상 (Precision): 질문이 명확할 때(예: "프랑스의 수도는 어디인가요?"), 로봇은 단 하나의 정답만을 제시해야 보상을 받습니다. 만약 여러 수도를 나열하려고 하면 보상을 받지 못하거나 벌점을 받습니다.

결정적으로, 그들은 로봇에게 "해석(interpretations)"이 무엇인지 가르칠 필요가 없었습니다. 오직 정답 목록만 있으면 되었습니다. 로봇은 보상을 극대화하기 위해 노력하는 과정에서 스스로 나머지 부분을 깨달았습니다. 로봇은 "음, 이 질문은 A, B, 또는 C를 의미할 수 있겠군. 안전하게 세 가지를 모두 나열하자"라거나 "이 질문은 단순하네. 그냥 하나의 답만 주자"라고 말하는 법을 배웠습니다.

결과: 명확한 승자

연구팀은 이 새로운 방법을 두 가지 유형의 작업에 테스트했습니다:

  1. 대화형 질문 답변: 이야기나 대화를 바탕으로 질문에 답하기.
  2. Text-to-SQL: 영어 질문을 데이터베이스를 조회하기 위한 컴퓨터 코드(SQL)로 변환하기.

그들은 자신들의 방법(IntentRL)을 다음 대상들과 비교했습니다:

  • 로봇에게 추측하도록 유도하기 (Prompting).
  • 예시를 보여주며 가르치기 (Supervised Fine-Tuning).
  • "명확화 질문" 방식 (사용자에게 묻기).
  • 최고 수준의 폐쇄형 모델들 (GPT-5.4 및 Gemini 2.5 Pro 등).

결과는 놀라웠습니다:

  • 더 높은 커버리지: IntentRL은 모호한 경우의 **74.1%**에서 정답을 찾아냈습니다(전체 커버리지). 반면 가장 뛰어난 폐쇄형 모델들은 약 16% 정도에 그쳤습니다. "생각하는(Thinking)" 모델들도 일반 모델보다 크게 나아지지 않았습니다.
  • "과잉 사고" 방지: 연구진은 단순히 로봇을 더 오래 "생각하게" 만드는 것이 더 많은 답을 찾는 데 도움이 되지 않는다는 것을 발견했습니다. 로봇은 종종 똑같은 잘못된 생각에 갇히곤 했습니다. 그러나 IntentRL은 다양한 경로를 체계적으로 탐색하는 법을 배웠습니다.
  • 일반화 능력: 이전에 본 적 없는 완전히 새로운 유형의 데이터베이스에 대해 테스트했을 때도 IntentRL은 잘 작동했습니다. 다른 방식들(표준 훈련 등)은 이전 데이터베이스 패턴을 단순히 암기했기 때문에 실패했습니다. 이는 IntentRL이 단순히 답을 암기하는 것이 아니라, "사용자가 무엇을 의도하는가"를 생각하는 일반적인 기술을 배웠음을 시사합니다.
  • 인간의 승인: 인간이 로봇의 답변을 검토했을 때, 해석이 타당하다는 것에 90% 동의했습니다. 로봇은 단순히 무작위 목록을 만드는 것이 아니라, 실제로 자신의 논리를 설명하고 있었습니다.

이것이 미래에 갖는 의미

이 논문은 로봇을 더 크고 똑똑하게 만들거나, 더 많이 "생각하게" 만드는 것이 모호성을 해결하는 핵심이 아니라는 점을 시사합니다. 핵심은 로봇에게 의도를 추론하는 법을 가르치는 것입니다. 모델이 구조화된 가능성의 목록을 생성하도록 강제함으로써, 우리는 AI가 자신이 무엇을 알고 무엇을 모르는지에 대해 더 정직하게 말하는 시스템을 얻을 수 있습니다.

저자들은 이 방법이 훌륭하지만 완벽하지는 않다고 언급합니다. 때때로 로봇이 너무 많은 옵션(최대 5개)을 나열하기도 하며, 극도로 모호한 질문에 대해서는 여전히 인간의 개입이 필요할 수 있습니다. 또한, 인간이 이 "메뉴 스타일"을 단순한 대화 방식보다 선호하는지에 대해서는 테스트하지 않았지만, 코딩과 같은 기술적인 작업에서는 매우 유용할 것이라고 추측합니다.

요약하자면, 이 논문은 AI에게 "당신의 질문을 이해할 수 있는 모든 방법은 다음과 같으며, 각 경우에 대한 답변은 이렇습니다"라고 말하도록 가르침으로써, 우리가 더 잘 이해받고, 시간을 낭비하지 않으며, 장기적으로 훨씬 더 도움이 되는 로봇을 구축할 수 있음을 보여줍니다. 이는 "추측하고 희망하는 것"에서 "목록을 만들고 명확히 하는 것"으로의 전환이며, 이를 단 한 번의 효율적인 단계로 수행하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →