← 최신 논문
💬 NLP

SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment

이 논문은 대규모 언어 모델의 언어적 불확실성 표현을 실제 샘플링된 행동과 정렬하여 다양한 추론 작업 전반에서 보정 능력을 향리고 과잉 확신을 줄이기 위해, 의미론적 답변 유도 엔트로피 타겟(SAGE)을 그룹 불확실성 선호 최적화(GUPO)와 결합하는 것을 제안한다.

원저자: Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

게시일 2026-06-11
📖 5 분 읽기🧠 심층 분석

원저자: Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

SAGE: 언어적 불확실성 정렬을 위한 답변 조건부 불확실성 타겟 (SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment)에 대한 설명입니다.

거대한 문제: 자신만만한 거짓말쟁이

매우 똑똑하지만 약간은 불안해하는 로봇에게 질문을 한다고 상상해 보세요. 때때로 로봇은 정답을 완벽하게 알고 있습니다. 하지만 어떤 때는 추측을 하고 있으면서도, 자신이 추측하고 있다는 사실조차 깨닫지 못합니다.

문제는 단순히 로봇이 틀린 답을 내놓는 것만이 아닙니다. 로봇이 틀렸을 때도 맞았을 때와 똑같이 자신감 넘치는 목소리로 말한다는 점입니다. 로봇은 "프랑스의 수도는 런던이라고 100% 확신합니다"라고 아주 매끄러운 어조로 말할 수 있습니다. 이는 매우 위험합니다. 사용자가 로봇을 믿게 되어 잘못된 결정을 내리게 만들기 때문입니다.

연구자들은 로봇이 정말로 확신이 없을 때 "잘 모르겠습니다"라고 말하도록 가르치고 싶어 합니다. 하지만 로봇에게 자신의 혼란스러움에 대해 정직해지는 법을 어떻게 가르칠 수 있을까요?

기존 방식: 로봇에게 추측하라고 시키기

이전에는 연구자들이 "정직한" 답변의 예시를 보여주며 로봇을 훈련시키려 했습니다. 그들은 "불확실할 때는 '잘 모르겠습니다'라고 말하세요"라고 가르쳤습니다.

결함: 이것은 마치 학생에게 특정 시험 문제 하나만을 보여주며 "모르겠어요"라고 말하는 법을 가르치는 것과 같습니다. 만약 학생이 자신이 알고 있다고 생각하는 질문을 받게 되면, 여전히 자신만만하게 추측할 수 있습니다. 기존 방식은 로봇이 어떻게 행동하는지에 대한 전체적인 그림을 보지 못했습니다. 그들은 단 하나의 답변만을 보고 그것을 고치려 했으며, 로봇이 내부적으로 동전 던지기를 하고 있을 수도 있다는 사실을 놓쳤습니다.

새로운 아이디어: "그룹 롤아웃 (Group Rollout)"

저자들은 로봇이 정말로 불확실한지 알기 위해서는 같은 질문을 20번 반복해서 물어보고 어떤 일이 일어나는지 확인해야 한다는 것을 깨달았습니다.

  • 안정적인 그룹 (Stable Group): 로봇에게 20번 물었을 때 20번 모두 같은 답을 준다면, 로봇은 확신이 있는 상태입니다. 이때는 "확신합니다"라고 말해야 합니다.
  • 분산된 그룹 (Dispersed Group): 20번을 물었을 때 20번 모두 다른 답을 주거나(또는 10개의 서로 다른 답을 주는 등) 혼란스러워한다면, 로봇은 불확실한 상태입니다. 이때는 "잘 모르겠습니다"라고 말해야 합니다.

이것을 **그룹 롤아웃 (Group Rollout)**이라고 부릅니다. 이것은 마치 20명의 위원회에 같은 질문을 던지는 것과 같습니다. 위원들이 모두 동의하면 그룹은 확신하는 것이고, 위원들 사이에서 논쟁이 벌어지면 그룹은 불확실한 것입니다.

함정: "나쁜 성적표"

여기서 이 논문은 영리해집니다. 단순히 20개의 답변 그룹을 갖는 것만으로는 충분하지 않습니다. 로봇이 얼마나 불확실하다고 말해야 하는지 알려줄 점수 산정 방식이 필요합니다. 저자들은 기존의 점수 산정 방식들이 고장 났다는 것을 발견했습니다.

  1. "정확한 일치" 점수 (MAF): 이 방식은 정확히 똑같은 단어가 몇 번 나타났는지만 계산합니다.
    • 비유: 위원회가 색깔에 대해 투표한다고 상상해 보세요. 10명이 "빨강"이라고 하고 10명이 "진홍색"이라고 한다면, 이 성적표는 두 단어가 다르기 때문에 의견이 완전히 갈린 것(50/50)으로 간주합니다. 하지만 실제로는 둘 다 같은 색을 의미하죠! 이 성적표는 너무 엄격하며 미묘한 차이를 놓칩니다.
  2. "의미적 클러스터" 점수 (SE): 유사한 의미들을 하나로 묶습니다.
    • 비유: 이것은 더 낫지만, 마치 엄격한 명단을 가진 클럽의 문지기와 같습니다. 당신이 명단에서 아주 조금만 벗어나도 즉시 "예(Yes)" 그룹에서 쫓겨나 "아니오(No)" 그룹으로 던져집니다. 점수가 깨진 엘리베이터처럼 급격하게 오르락내리락하여 로봇이 부드럽게 학습하는 것을 방해합니다.
  3. "일반적 유사성" 점수 (KLE): 문장이 얼마나 비슷하게 들리는지를 봅니다.
    • 비유: 이것이 가장 위험합니다. 위원회가 수학 문제에 대해 투표한다고 상상해 보세요. 한 사람은 "52"라고 하고, 다른 사람은 "53"이라고 합니다. 일반적인 귀에는 이 숫자들은 매우 비슷하게 들립니다. 이 성적표는 "오, 거의 비슷하네, 그러니 그룹이 확신하고 있어!"라고 생각합니다. 하지만 수학에서 52와 53은 완전히 다른 답입니다. 이 성적표는 로봇이 실제로 틀렸음에도 불구하고 스스로 확신하고 있다고 속입니다.

해결책: SAGE (스마트 성적표)

저자들은 SAGE (Semantic-Answer Guided Entropy)라고 불리는 새로운 점수 산정 시스템을 만들었습니다.

SAGE를 두 가지를 동시에 이해하는 스마트 성적표라고 생각하세요:

  1. 분위기 (The Vibe): 문장이 어떻게 들리는지(언어적 유사성)를 봅니다.
  2. 진실 (The Truth): 실제 답변들이 서로 호환되는지(답변 등가성)를 확인합니다.

작동 방식:

  • 만약 위원회가 "빨강"과 "진홍색"이라고 말한다면, SAGE는 이들이 같은 의미임을 인지하고 낮은 불확실성 점수를 줍니다 (좋은 결과!).
  • 만약 위원회가 "52"와 "53"이라고 말한다면, SAGE는 이들이 소리는 비슷할지라도 수학적으로는 다르다는 것을 인지합니다. 따라서 높은 불확식성 점수를 줍니다 (좋은 결과!).
  • SAGE는 이를 부드럽게 처리하여, 로봇이 당황스러운 신호를 받는 대신 명확하고 안정적인 신호를 받아 자신의 확신도를 조절할 수 있게 합니다.

훈련 방법: GUPO

SAGE라는 완벽한 성적표를 갖춘 후, 저자들은 GUPO라는 새로운 훈련 방법을 사용합니다.

로봇의 전체 답변(이야기, 추론, 최종 사실)을 고치려고 하는 대신, GUPO는 오직 확신 부분에만 집중합니다.

  • 비유: 선생님이 학생의 에세이를 교정한다고 상상해 보세요. 선생님이 이야기 전체를 다시 쓰는 대신, 학생이 "저는 100% 확신합니다"라고 말한 문장에 동그라미를 치고 이렇게 말하는 것입니다. "사실, 네 다른 초안들을 좀 봐봐. 너는 추측하고 있었어. 이 문장을 '잘 모르겠습니다'로 바꿔보렴."
  • GUPO가 바로 이 일을 합니다. 로봇의 추론과 사실은 그대로 둔 채, 로봇의 "불확실성 진술"이 실제 그룹의 결과와 일치하도록 훈련시킵니다.

결과

저자들은 세 가지 유형의 과업에서 테스트를 진행했습니다:

  1. 사실: (예: "이 책을 쓴 사람은 누구인가?")
  2. 수학: (예: "52 + 3은 무엇인가?")
  3. 객관식: (예: "정답이 A, B, C, D 중 무엇인가?")

이 모든 경우에서, SAGE와 GUPO로 훈련받은 로봇들은 자신이 언제 불확실한지 훨씬 더 잘 알게 되었습니다. 그들은 과도하게 자신만만한 거짓말쟁이가 되는 것을 멈췄습니다. 답변 그룹이 엉망일 때는 "모르겠습니다"라고 말하고, 그룹의 의견이 일치할 때는 "알고 있습니다"라고 말하는 법을 배웠습니다.

요약

이 논문은 로봇에게 불확실성에 대해 정직해지도록 가르치려면 단 하나의 답변만 봐서는 안 된다고 주장합니다. 반드시 답변의 그룹을 봐야 합니다. 하지만 또한 "빨강"과 "진홍색"은 같지만 "52"와 "53"은 다르다는 것을 이해하는 특별한 "성적표(SAGE)"도 필요합니다. 이 스마트한 성적표를 통해, 로봇은 자신의 확신을 실제 능력과 일치시키는 법을 배우며, 결과적으로 더욱 신뢰할 수 있는 파트너가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →