← 최신 논문
📊 statistics

Don't Throw Away Your Beams: Improving Consistency-based Uncertainties in LLMs via Beam Search

본 논문은 대규모 언어 모델에서 일관성 기반 불확실성 정량화를 위한 후보 생성에 다항 샘플링 대신 빔 서치를 사용하는 것을 제안하며, 이 접근 방식이 분산을 감소시키고 단답형 QA 작업에서 최첨단 성능을 달성함을 보여줍니다.

원저자: Ekaterina Fadeeva, Maiya Goloburda, Aleksandr Rubashevskii, Roman Vashurin, Artem Shelmanov, Preslav Nakov, Mrinmaya Sachan, Maxim Panov

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ekaterina Fadeeva, Maiya Goloburda, Aleksandr Rubashevskii, Roman Vashurin, Artem Shelmanov, Preslav Nakov, Mrinmaya Sachan, Maxim Panov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

'Don't Throw Away Your Beams' 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

큰 문제: AI 응답의 '에코 챔버'

간단한 질문을 대규모 언어 모델 (LLM) 에게 던져본다고 상상해 보세요. 예를 들어, "'Thriller'를 부른 사람은 누구인가요?"라고 묻는 것입니다.

AI 가 답변에 대해 얼마나 확신을 가지고 있는지 판단하기 위해 연구자들은 보통 AI 에게 동일한 질문을 여러 번 (예: 10 번) 답변하도록 요청하고, 답변들이 얼마나 일치하는지 관찰합니다. 이를 일관성 기반 불확실성이라고 합니다.

  • 구식 방법 (다항 샘플링): 이는 조작된 주사위를 던지는 것과 같습니다. AI 가 답변이 '마이클 잭슨'일 것이라고 90% 확신한다면, 주사위를 던질 때마다 '마이클 잭슨'이 나옵니다. 10 개의 답변을 받으면 그중 9 개 또는 10 개가 동일합니다.
    • 단점: AI 가 계속 정확히 같은 답변을 주기 때문에, 당신은 "와, 정말 확신에 찬 답변이네!"라고 생각할 수 있습니다. 하지만 실제로는 AI 가 단순히 루프에 갇혀 있을 뿐입니다. 다른 가능성을 탐색하지 않은 것입니다. 만약 정답이 실제로 '프린스' (잘못된 가설) 라 하더라도, AI 는 여전히 '프린스'라고 10 번 말하며 당신을 속여 확신 있는 것처럼 보이게 할 수 있습니다. 또한, 10 개의 동일한 답변을 얻는 것은 컴퓨팅 파워의 낭비입니다.

새로운 해결책: 탐정 '빔 서치'

저자들은 이 10 개의 답변을 얻는 새로운 방식을 제안합니다. 주사위를 던지는 대신 **빔 서치 (Beam Search)**라는 전략을 사용합니다.

  • 비유: 당신이 도시에서 용의자를 찾는 탐정이라고 상상해 보세요.
    • 다항 샘플링은 10 명의 사람을 무작위로 보내 길거리의 무작위 사람에게 물어보게 하는 것입니다. 만약 군중이 대다수 '마이클 잭슨'이라고 말하면, 10 명 모두 '마이클 잭슨'이라고 말하며 돌아옵니다.
    • 빔 서치는 10 명의 탐정을 동시에 가장 확률이 높은 10 개의 거리로 보내는 것입니다. '마이클 잭슨'이 가장 인기 있는 답변이라 하더라도, 빔 서치는 탐정들에게 두 번째, 세 번째, 네 번째로 확률이 높은 거리도 확인하도록 강요합니다.
    • 결과: 당신은 10 개의 서로 다른 답변 목록을 얻게 됩니다 (예: '마이클 잭슨', 'M. 잭슨', '프린스', '브루노 마스').

왜 더 나은가: '다양성'의 이점

이 논문은 빔 서치를 사용하면 두 가지 주요 이점이 있다고 주장합니다.

  1. 중복의 종식: 10 번이나 같은 답변을 얻느라 시간을 낭비하지 않게 됩니다. AI 가 생각하는 진정한 다양성을 얻을 수 있습니다.
  2. 정직한 확신 점수:
    • AI 가 10 개의 서로 다른 답변 (일부는 정확하고 일부는 틀림) 을 제공하면, 시스템은 "이봐, AI 는 확신이 없네!"라고 인식하고 낮은 확신 점수를 부여합니다.
    • AI 가 10 개의 매우 유사한 답변 (비록 같은 아이디어의 미세한 변형일지라도) 을 제공하면, 시스템은 "알겠어, AI 는 꽤 확신하는구나"라고 인식하고 높은 확신 점수를 부여합니다.

비밀 재료: 답변 가중치 부여

이 논문은 또 다른 영리한 트릭을 소개합니다. 빔 서치가 10 개의 서로 다른 경로를 찾았다고 해서 모두 동일한 확률을 가진다는 뜻은 아닙니다.

  • 비유: AI 를 기상 예보관이라고 상상해 보세요.
    • 경로 A (빔 1): "비가 올 것이다" (90% 확률).
    • 경로 B (빔 10): "비가 올 것이다" (0.01% 확률).
    • 두 경로를 동등하게 취급하면 수학을 왜곡하게 됩니다.
    • 해결책: 저자들은 "경로 A 의 '비가 올 것이다'라는 답변을 90 표로, 경로 B 의 '비가 올 것이다'라는 답변을 0.01 표로 계산하자"고 말합니다. 그들은 확률 가중 추정기를 사용합니다. 이는 AI 의 확신 점수가 답변의 진짜 확률을 반영하도록 보장하며, 단순히 답변이 서로 다르다는 사실만 반영하지 않도록 합니다.

증거: 효과가 있을까?

연구자들은 세 가지 다른 AI 모델을 사용하여 여섯 가지 다른 질문 - 답변 데이터 세트 (퀴즈, 과학, 일반 상식 등) 에서 이 방법을 테스트했습니다.

  • 결과: '빔 서치' 방법은 구식인 '주사위 던지기' 방법을 일관되게 능가했습니다.
  • 지표: 그들은 **PRR (예측 - 거부 비율)**이라는 점수를 사용했습니다. 이는 다음과 같은 테스트라고 상상해 보세요: "AI 의 확신 점수에 따라 최악의 답변을 버린다면, 남은 답변들이 개선될까?"
  • 최종 결과: 빔 서치 방법은 나쁜 답변을 식별하고 좋은 답변을 유지하는 데 더 뛰어났습니다. State-of-the-Art (최첨단) 결과를 달성했는데, 이는 짧은 사실성 질문에 대해 현재 이용 가능한 가장 좋은 방법임을 의미합니다.

결론

이 논문은 말합니다: 당신의 빔을 버리지 마십시오.

AI 세계에서 '빔'은 모델이 답변을 찾기 위해 탐색하는 여러 경로입니다. 저자들은 무작위로 답변을 샘플링하는 것 (종종 지루한 중복으로 이어짐) 대신 빔 서치의 구조화된 경로를 사용해야 함을 보여줍니다. 그렇게 하고 각 경로의 확률을 신중하게 계산함으로써, 우리는 AI 를 위한 훨씬 더 정확한 '확신 계수'를 얻을 수 있습니다. 이는 특히 짧은 사실성 질문에 대해 AI 를 언제 신뢰하고 언제 회의적으로 접근해야 하는지 알려주는 데 도움이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →