← 최신 논문
💬 NLP

VISTA: Verification In Sequential Turn-based Assessment

이 논문은 대화형 AI 의 사실성을 평가하기 위해 각 응답을 사실적 주장 단위로 분해하고 대화 맥락과 신뢰할 수 있는 출처를 기반으로 검증하는 새로운 프레임워크인 VISTA 를 제안하며, 기존 평가 방법보다 환각 현상 감지 성능이 뛰어나고 인간 평가자 간 일치도를 높인다고 설명합니다.

원저자: Ashley Lewis, Andrew Perrault, Eric Fosler-Lussier, Michael White

게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ashley Lewis, Andrew Perrault, Eric Fosler-Lussier, Michael White

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

VISTA: 대화 속 '사실'을 찾아내는 새로운 나침반

이 논문은 인공지능 (AI) 이 대화할 때 자주 저지르는 실수, 즉 **'환각 (Hallucination)'**을 어떻게 더 정확하게 찾아내고 평가할 수 있는지에 대한 새로운 방법론을 소개합니다. 저자들은 이 방법을 VISTA라고 이름 붙였습니다.

기존의 방법들은 AI 가 말한 문장 하나하나를 독립적으로 검사하거나, "증거가 없으면 무조건 거짓이다"라고 딱 잘라 판단하는 경향이 있었습니다. 하지만 실제 대화는 훨씬 복잡합니다. "어제 비가 왔어"라고 말한 뒤, "그래서 우산을 챙겼지"라고 이어지는 것처럼, 앞뒤 맥락이 중요하기 때문이죠.

VISTA 는 이 복잡한 대화의 흐름을 따라가며, AI 가 한 말 하나하나를 **'작은 사실 조각 (Atomic Claims)'**으로 잘게 부수고, 그 조각들이 참인지, 거짓인지, 아니면 증거가 없는지를 하나하나 확인하는 시스템입니다.


🧩 VISTA 가 작동하는 방식: 4 단계 요리 레시피

VISTA 의 과정을 쉽게 이해하기 위해 **'요리사 (AI)'**가 **'손님 (사용자)'**에게 요리를 설명하는 상황을 상상해 보세요.

1 단계: 재료를 썰기 (Claim Decomposition)

요리사가 "오늘은 신선한 생선으로 만든 매운탕을 드실 수 있습니다"라고 말합니다.
기존 방식은 이 문장 전체를 한 덩어리로 봅니다. 하지만 VISTA 는 이 문장을 작은 조각으로 잘게 썹니다.

  • 조각 1: "매운탕을 만들었다."
  • 조각 2: "생선이 신선하다."
  • 조각 3: "매운탕을 드실 수 있다."
    이렇게 쪼개야만, "생선은 신선한데 매운탕은 안 만들었다" 같은 부분적인 오류도 찾아낼 수 있습니다.

2 단계: 장바구니 확인하기 (Verification)

잘게 썬 각 조각을 **신뢰할 수 있는 장바구니 (참고 문서)**와 이전 대화 내용과 비교합니다.

  • ✅ 검증됨 (Verified): 장바구니에 생선이 있고, 이전 대화에서 매운탕을 주문했다는 기록이 있다면 '참'입니다.
  • ❌ 검증 불가 (Unverifiable): 장바구니에 해당 정보가 없다면 '검증 불가'로 분류합니다.

3 단계: 검증 불가 이유 분류하기 (Categorization)

여기가 VISTA 의 가장 혁신적인 부분입니다. 기존 방식은 '검증 불가'를 모두 '거짓 (환각)'으로 치부했지만, VISTA 는 그 이유를 4 가지로 나눕니다.

  1. 주관적 의견 (Out-of-Scope): "이 매운탕이 세상에서 제일 맛있다" → 사실 확인이 불가능한 의견입니다. (오류가 아님)
  2. 모순됨 (Contradicted): "매운탕을 안 만들었다"라고 말했는데, 장바구니에 생선이 있다면 거짓입니다. (오류)
  3. 증거 부족 (Lacking Evidence): "매운탕에 고춧가루가 10g 들어갔다" → 장바구니에 그 정보가 없다면 증거가 없는 상태입니다. (단순 실수는 아님)
  4. 답변 유보 (Abstention): "그건 잘 모르겠습니다"라고 말하는 것 → 거짓이 아닌 정직한 답변입니다.

4 단계: 대화의 흐름 기억하기 (Sequential Tracking)

이 과정이 대화 전체에 걸쳐 반복됩니다. 1 번 대화에서 확인된 사실은 2 번 대화의 **'배경 지식'**이 됩니다.

  • 예: "내 이름은 김철수야" (1 번 대화, 검증됨) → "김철수는 한국 사람이다" (2 번 대화, 배경 지식과 결합하여 검증).
    이렇게 하면 AI 가 대화 중간에 갑자기 "아, 내 이름은 이영희야"라고 말하면, 이전 대화와 모순된다고 바로 잡아낼 수 있습니다.

🏆 왜 VISTA 가 더 좋은가요?

기존의 평가 방법들은 마치 시험지 채점처럼, 각 문장만 보고 점수를 매겼습니다. 하지만 VISTA 는 대화의 흐름을 읽는 통찰력을 가지고 있습니다.

  • 작은 모델도 잘합니다: 기존 방법들은 거대하고 비싼 AI 모델만 잘 평가했지만, VISTA 는 작은 모델에서도 환각을 훨씬 잘 찾아냅니다.
  • 사람의 눈과 비슷합니다: 연구진은 실제 사람 (언어학 전공 학생들) 이 이 방식을 사용해 채점하게 했더니, 사람들도 VISTA 가 나눈 '주관/객관/거짓' 구분을 훨씬 잘 이해하고 동의했습니다.
  • 실수를 줄여줍니다: "증거가 없는 의견"을 "거짓 사실"로 잘못 판단하는 실수를 크게 줄여줍니다.

💡 결론: 더 투명하고 신뢰할 수 있는 AI 를 위해

VISTA 는 AI 가 사실을 말할 때, 단순히 "맞다/틀리다"를 넘어서 **"왜 맞고, 왜 틀리며, 왜 모른다고 하는지"**를 설명해주는 나침반과 같습니다.

이 방법은 AI 가 환각을 일으키지 않도록 훈련시키는 데도 쓰일 수 있으며, 우리가 AI 와 대화할 때 더 신뢰할 수 있고 투명한 정보를 얻을 수 있게 해줍니다. 마치 대화의 진실을 찾아내는 탐정처럼, VISTA 는 AI 의 말 속에 숨겨진 사실과 허구를 가려내는 새로운 기준을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →