← 최신 논문
💬 NLP

DiscoverLLM: From Executing Intents to Discovering Them

DiscoverLLM은 인지 상태 기반 사용자 시뮬레이터를 통해 사용자의 모호한 의도를 발견하고 구체화하도록 대규모 언어 모델을 학습시키는 새로운 프레임워크로, 창의적, 기술적, 시각적 작업 전반에서 작업 수행 능력의 현저한 향상, 대화 길이 단축, 그리고 사용자 만족도 제고를 실현합니다.

원저자: Tae Soo Kim, Yoonjoo Lee, Jaesang Yu, John Joon Young Chung, Juho Kim

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tae Soo Kim, Yoonjoo Lee, Jaesang Yu, John Joon Young Chung, Juho Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어떤 셰프에게 매우 구체적인 식사를 주문하려고 하지만, 정작 무엇을 먹고 싶은지 아직 모른다고 상상해 보세요. 그저 배가 고프고 "맛있는" 무언가를 원한다는 것만 알 뿐입니다.

만약 표준적인 AI 셰프에게 "나에게 맛있는 걸 만들어줘"라고 요청한다면, 그 셰프는 스테이크를 추측해 낼지도 모릅니다. 한 입 베어 물고 "흠, 좀 아닌 것 같아"라고 말하면, 셰프는 "더 매운 걸 원하세요?"라고 묻습니다. 당신은 "모르겠어요"라고 답합니다. 셰프는 다시 추측을 해, 아마도 샐러드를 내놓을지도 모릅니다. 당신은 "아니요, 너무 차가워요"라고 말합니다. 이 주고받음은 셰프가 당신이 무엇을 원하는지 정확히 알 때까지 기다리기 때문에 영원히 계속될 수 있습니다.

DISCOVERLLM은 AI 셰프들이 음식을 직접 보기 전까지는 자신이 무엇을 원하는지 모를 수도 있다는 사실을 깨닫도록 훈련하는 새로운 방법입니다.

다음은 이 논문이 간단한 비유를 사용하여 이를 설명하는 방식입니다:

1. 문제: "숨겨진 메뉴"

일반적으로 AI 모델은 사용자가 머릿속에 완전한 주문을 가지고 있다고 (완성된 의도) 가정합니다. 그들은 자신의 일이 "뜨거운 걸 원하시나요, 아니면 차가운 걸 원하시나요?"와 같은 명확화 질문을 하는 것이라고 생각합니다.

하지만 현실에서, 특히 이야기를 쓰거나 그림을 그리는 것과 같은 창의적인 작업에서는 예시를 보기 전까지는 정답을 알지 못하는 경우가 많습니다. 아직 매운 음식을 맛보지 못했다면 셰프에게 "매운 걸 원한다"고 말할 수 없습니다. 매운 음식을 먹어보면서 비로소 매운 음식을 좋아한다는 것을 발견해야 합니다.

2. 해결책: "테이스팅 메뉴" 시뮬레이터

연구자들은 AI 를 훈련시키기 위해 특별한 "시뮬레이션된 사용자" (인간처럼 행동하는 로봇) 를 구축했습니다. 이 로봇은 자신이 아직 가지고 있지 않은 비밀스러운 숨겨진 메뉴 (선호도 목록) 를 가지고 있습니다.

  • 숨겨진 메뉴: 로봇이 비밀스러운 욕망 목록을 가지고 있다고 상상해 보세요: "시를 원해", "동물을 원해", "고양이를 원해", "자는 고양이를 원해".
  • 발견 과정: 처음에는 로봇이 "시"를 원한다는 것만 알고 있습니다. 고양이를 원한다는 것은 아직 모릅니다.
  • AI 의 역할: 로봇이 아직 답할 수 없는 "어떤 동물을 원하세요?"라고 단순히 묻는 대신, AI 는 다양한 옵션을 제시해 봅니다.
    • AI 시도: "개에 관한 시를 하나 보여드릴게요."
    • 로봇 생각: "오, 개는 괜찮지만, 뭔가 더 부드러운 걸 원할지도 몰라." (로봇은 반려동물을 선호한다는 것을 발견함).
    • AI 시도: "자는 고양이에 관한 시를 하나 보여드릴게요."
    • 로봇 생각: "그래! 바로 그거야!" (로봇은 이제 자신의 진정한 의도를 발견함).

3. 훈련: "부드러운 유도" 학습하기

AI 는 보상 시스템을 통해 훈련됩니다. AI 는 정답을 주는 것뿐만 아니라 사용자가 자신이 무엇을 원하는지 파악하도록 돕는 것에도 점수를 받습니다.

  • 나쁜 수: 사용자가 모르는 상태에서 AI 가 "고양이를 원하시나요, 개를 원하시나요?"라고 묻는다면, AI 는 점수를 받지 못합니다. 사용자가 막히게 됩니다.
  • 좋은 수: AI 가 개의 사진을 보여주고 사용자가 "아니요, 뭔가 더 작은 걸로요"라고 말하면, AI 는 점수를 받습니다. AI 는 성공적으로 사용자를 새로운 선호도를 발견하도록 "부드럽게 유도"한 것입니다.

이 논문은 이를 다양성 (탐색하기 위해 다양한 옵션을 보여주는 것) 과 수렴성 (사용자가 무엇을 좋아하는지 알게 되면 좁혀가는 것) 의 균형이라고 부릅니다.

4. 결과: 더 많은 말보다 더 많은 행동

연구자들은 이 새로운 AI 를 이야기 쓰기, 기술 기사 작성, 디지털 이미지 그리기 등의 작업으로 테스트했습니다.

  • 더 빠른 발견: 새로운 AI 는 이전 모델들보다 사용자가 원하는 것을 찾는 데 약 10% 더 빠른 속도를 보였습니다.
  • 짧은 대화: AI 가 쓸모없는 질문을 멈추고 도움이 되는 예시를 보여주기 시작하면서, 대화 길이는 40% 단축되었습니다.
  • 더 행복한 사용자: 실제 인간을 대상으로 한 연구에서, 사람들은 새로운 AI 가 더 도움이 되며, 심지어 사용자가 자신도 무엇을 원하는지 확신하지 못할 때에도 그들의 필요를 "예측"하는 것처럼 느꼈습니다.

큰 그림

옛날 AI 를 메뉴 전체를 읽고 주문할 때까지 기다리는 웨이터라고 생각하세요.
새로운 DISCOVERLLM은 다양한 요리의 작은 샘플을 가져오는 테이스팅 셰프라고 생각하세요. 여러분이 그걸 맛보면서 "아, 사실 나는 매운 걸 정말 좋아했어!" 또는 "차가운 수프는 싫어"라고 깨닫게 됩니다.

이 논문은 AI 에게 지시를 기다리기만 하는 것이 아니라, 탐색을 통해 자신의 선호도를 발견하도록 돕는 테이스팅 셰프가 되도록 가르침으로써, 창의적이고 열린 과제를 처리하는 데 AI 를 훨씬 더 효과적으로 만들 수 있다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →