← 최신 논문
💬 NLP

Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation

본 논문은 모호한 대화에서 정확성과 전략 충실도를 표준 프롬프팅보다 향상시키기 위해, 다중 샘플링 응답에서 도출된 LLM 의 고유한 신념 상태를 활용하여 답변, 명확화, 또는 유보를 자율적으로 결정하는 베리프 증강 생성 (BAG) 프레임워크를 제안한다.

원저자: Joris Baan, Wilker Aziz, Barbara Plank, Raquel Fernández

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Joris Baan, Wilker Aziz, Barbara Plank, Raquel Fernández

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation"이라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어보겠습니다.

핵심 문제: "과신하는" AI

거대 언어 모델 (LLM) 에게 까다로운 질문을 한다고 상상해 보세요. 예를 들어, *"Gimme Shelter 의 여성 보컬은 누가 불렀나요?"*라고 묻는 것입니다.

일반적인 AI 에게 물어보면, 추측일지라도 단 하나의 답변을 선택해 완전히 확신에 차서 말해버립니다. 예를 들어, "Merry Clayton 이 불렀습니다"라고 말하지만, 만약 사용자가 라이브 투어 버전을 의미했다면 정답은 실제로 "Lisa Fischer"라는 사실을 인지하지 못합니다. AI 는 자신이 불확실하다는 것을 모릅니다. 그저 모든 것을 아는 것처럼 행동할 뿐입니다.

연구자들은 이러한 모델들이 "어떤 것을 의미하는지 확실하지 않습니다"나 "정답을 모릅니다"라고 거의 말하지 않는다는 사실을 발견했습니다. 그들은 그저 추측할 뿐입니다.

해결책: "Belief-Augmented Generation (BAG)"

저자들은 **Belief-Augmented Generation(BAG)**이라는 새로운 방법을 제안합니다. 이는 AI 가 말을 하기 전에 "생각할 공간"을 갖게 해주는 것과 같습니다.

AI 는 하나의 답변만 생성하는 대신, 동일한 질문에 대해 먼저 10 가지의 서로 다른 가능한 답변을 생성하도록 요청받습니다. 그런 다음 이 10 가지 답변 목록 (논문에서는 이를 **"Belief State"**라고 부릅니다) 을 살펴보고 스스로에게 질문합니다: "이 10 가지 답변이 내 확신도에 대해 무엇을 말해주고 있을까?"

그 목록에서 무엇을 보느냐에 따라 AI 는 세 가지 전략 중 하나를 선택합니다.

  1. 직접 답변하기: 10 가지 답변이 모두 기본적으로 같다면 (예: 10 개 모두 "Merry Clayton"이라고 말함), AI 는 자신이 확신한다는 것을 압니다. 따라서 직접 답변합니다.
    • 비유: 배심원 10 명이 모두 유죄 평결에 동의하는 것과 같습니다. 배심원 대표가 단순히 결과를 발표할 뿐입니다.
  2. 명확히 하기 (Clarify): 10 가지 답변이 두 개의 뚜렷한 그룹으로 나뉘어 있다면 (예: 5 개는 "Merry Clayton", 5 개는 "Lisa Fischer"라고 말함), AI 는 질문이 모호하다는 것을 깨닫습니다. 추측하는 대신 사용자에게 명확히 해달라고 요청합니다.
    • 비유: 웨이터가 테이블에서 "오늘의 특별 메뉴"를 주문받았지만 메뉴판에 두 가지 다른 특별 메뉴가 있는 것을 발견한 상황과 같습니다. 추측하는 대신 웨이터는 "스테이크를 말씀하신 건가요, 아니면 생선을 말씀하신 건가요?"라고 묻습니다.
  3. 답변 거부하기 (Abstain, "모릅니다"라고 말하기): 10 가지 답변이 제각각이고 서로 극단적으로 모순된다면 (예: 하나는 "Merry Clayton", 다른 하나는 "The Beatles", 또 다른 하나는 "로봇"이라고 말함), AI 는 자신이 사실을 모른다는 것을 깨닫습니다. 정중하게 답변을 거절합니다.
    • 비유: 형사가 범죄와 연결된 증거가 전혀 없는 10 명의 다른 용의자를 발견한 상황과 같습니다. 형사는 무작정 누군가를 체포하기보다 "아직 이 사건을 해결할 수 없습니다"라고 인정합니다.

테스트 방법

연구자들은 "모호한 질문"(여러 가지 의미를 가질 수 있는 질문) 데이터셋으로 이를 테스트했습니다. 비교 대상은 다음과 같습니다.

  • 일반 AI: 그냥 직접 답변합니다.
  • 프롬프트 전용 AI: "조심하라"고 지시받았지만 자신의 추측 목록을 보지 못합니다.
  • BAG AI: 자신의 10 가지 추측 목록을 보고 이를 통해 추론합니다.

결과

  • 더 높은 정확도: BAG 방법은 여섯 가지 다른 AI 모델의 답변 정확도를 모두 향상시켰습니다.
  • 더 똑똑한 선택: BAG AI 는 언제 질문을 해야 하고 언제 모른다고 인정해야 할지 아는 데 훨씬 능했습니다. 반면 일반 AI 는 거의 도움을 요청하거나 무지를 인정하지 않았습니다.
  • 신뢰성: BAG AI 의 선택은 다른 방법들보다 자신의 내부 "확신도"(10 가지 추측의 다양성) 와 훨씬 더 잘 일치했습니다. 혼란스러우면 혼란스러운 것처럼 행동했고, 확신하면 확신하는 것처럼 행동했습니다.

한계점

시스템이 잘 작동하지만, AI 가 여전히 다음 두 가지를 완벽하게 구분하기는 어렵습니다.

  • 실제 모호성: "영화인지 책인지 모르겠습니다." (명확히 하기 필요)
  • 할루시네이션 (환각): "모르니까 사실을 지어내고 있습니다." (답변 거부 필요)

때로는 AI 가 실제로 지어내고 있는 것을 모호한 질문으로 오인하거나, 그 반대의 경우가 발생하기도 합니다. 하지만 전반적으로 AI 가 말을 하기 전에 "자신의 작업을 살펴볼 기회"를 주는 것은 AI 를 훨씬 더 정직하고 도움이 되는 대화 상대로 만들어 줍니다.

요약

이 논문은 AI 모델들이 과신하는 것을 줄이는 방법을 제시합니다. 여러 가지 답변을 먼저 생성하게 한 후 그 차이를 분석하도록 강제함으로써, 모델들은 혼란스러울 때는 **명확히 하기 (Clarify)**를, 무지할 때는 **답변 거부 (Abstain)**를, 확신할 때만 **답변 (Answer)**을 하도록 학습합니다. 이는 AI 가 까다로운 현실 세계의 질문을 처리하는 능력을 향상시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →