← 최신 논문
💬 NLP

ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups

이 논문은 다양한 인구통계학적 페르소나에 걸친 사실적 일관성을 평가하기 위해 19개의 대규모 언어 모델을 검증하는 독립적인 벤치마크인 ConsistencyAI를 소개하며, 일관성 점수가 모델 제공업체와 주제 모두에 따라 크게 달라지며 평균 벤치마크 임계값이 0.8656임을 밝히고 있습니다.

원저자: Peter Banyas, Shristi Sharma, Alistair Simmons, Atharva Vispute

게시일 2026-09-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Peter Banyas, Shristi Sharma, Alistair Simmons, Atharva Vispute

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 정보 시대에 우리는 우유 가격부터 복잡한 역사의 세부 사항에 이르기까지 질문에 답을 얻기 위해 점점 더 인공지능에 의존하고 있습니다. 대규모 언어 모델(LLM)로 알려진 이 시스템들은 인간의 언어를 이해하고 대화처럼 느껴지는 텍스트를 생성하도록 설계되었습니다. 이들은 사람들이 사실에 접근하는 주요한 방식이 되었으며, 때로는 빠른 답변을 위해 전통적인 검색 엔진을 대체하기도 합니다. 그러나 이러한 기계들이 어떻게 작동하는지에 대한 근본적인 질문이 남아 있습니다. 즉, 이들이 모두에게 동일한 이야기를 하는가, 아니면 묻는 사람이 누구냐에 따라 사실을 바꾸는가 하는 점입니다. 만약 컴퓨터 프로그램이 당신을 어린 학생으로 알고 있다면, 나이가 많은 경영자에게 보여줄 것과는 다른 일련의 진실을 제시할까요? 이러한 가능성은 공정성과 정보의 무결성에 대한 우려를 불러일러킵니다. 만약 사람의 배경(예: 연령, 성별, 직업)에 따라 사실 자체가 변한다면, 이는 시스템이 단순히 질문에 답하는 것을 넘어 특정 청중에게 맞춰 현실을 조작하고 있음을 시사합니다. 만약 이것이 실제 현상이라면, 서로 다른 집단이 세상을 이해하는 방식을 미묘하게 형성하여, 격차를 해소하기보다는 오히려 심화시킬 수 있습니다.

이를 조사하기 위해 듀크 대학교와 노스캐롤라이나 대학교의 연구진은 'ConsistencyAI'라는 새로운 테스트를 만들었습니다. 그들의 목표는 대규모 언어 모델이 서로 다른 사람들에게 서로 다른 사실을 말하는지 확인하는 것이었습니다. 연구진은 모델에게 정보가 참인지 확인하라고 요청한 것이 아니라, 25세 교사에게 제공한 사실의 집합과 60세 건설 노동자에게 제공한 사실의 집합이 동일한지를 물었습니다. 연구팀은 미국의 다양한 연령, 직업, 배경을 나타내는 다양한 사람들을 시뮬레이션하는 시스템을 구축했습니다. 그런 다음 25개의 서로 다른 인공지능 모델에 주택 비용, 무역 적자, 정치적 갈등 등 15가지 서로 다른 주제에 대해 5가지 사실을 제공하도록 요청했습니다. 각 질문은 대표적인 데이터셋에서 추출한 100개의 페르소나를 사용하여 질문자의 맥락을 매번 변경하며 각 모델에 100번씩 던져졌습니다. 연구진은 답변을 비교함으로써 페르소나가 변할 때 콘텐츠가 얼마나 변하는지를 측정할 수 있었습니다.

결과에 따르면 많은 모델이 일반적으로 일관성을 유지하지만, 완벽하지는 않았습니다. 연구진은 모델들이 자신이 누구와 대화하고 있는지에 따라 제시하는 사실을 실제로 바꾼다는 것을 발견했습니다. 100개의 페르소나를 포함한 대규모 테스트에서, 모델의 일관성 점수는 최고 0.9137에서 최저 0.6719까지 나타났으며 평균 점수는 0.8555였습니다. 이 평균값이 연구의 벤치마크가 되었습니다. 가장 일관된 모델은 xAI의 Grok-4로, 사용자에 관계없이 사실 관계를 놀라울 정도로 일정하게 유지했습니다. 반면, 여러 경량 및 중간 단계 모델들은 가장 큰 변동성을 보였습니다. 연구는 논의되는 주제가 모델 자체만큼이나 중요하다는 것을 보여주었습니다. 예를 들어, 명확하고 표준화된 정부 데이터가 있는 주제인 미국 무역 적자에 대해 질문했을 때 모델들은 매우 높은 일관성을 보였습니다. 그러나 복잡하고 다양한 데이터 소스를 가진 주제인 주택 비용에 대해 질문했을 때는 모델들이 사람마다 훨씬 더 다양한 답변을 내놓았습니다.

연구진은 또한 모델들이 단순히 어조나 스타일만 바꾸는 것이 아니라, 실제로 서로 다른 사실을 선택한다는 것을 발견했습니다. 페르소나가 바뀌면 응답에서 언급되는 구체적인 세부 사항, 조직, 숫자들이 자주 바뀌었습니다. 예를 들어, 국경 보안이라는 주제에 대해 한 모델은 고령 사용자에게는 법 집행에 초점을 맞춘 답변을 제공하는 경향이 있었던 반면, 젊은 사용자에게는 지리에 초점을 맞춘 답변을 제공했습니다. 또 다른 모델은 미성년자에게는 비유가 많은 단순화된 응답을 제공했지만, 성인에게는 직접적이고 사실적인 응답을 제공했습니다. 이는 모델들이 인구통계학적 단서에 민감하며 그에 따라 정보를 조정하고 있음을 시사합니다. 연구는 더 발전된 '추론형' 모델이라고 해서 반드시 더 나은 일관성을 보장하는 것은 아니라는 점에도 주목했습니다. 일부 작은 규모의 오래된 모델들이 최신 기술의 복잡한 시스템보다 더 나은 성능을 보이기도 했는데, 이는 일관성이 단순히 모델의 크기나 지능의 부산물이 아님을 나타냅니다.

연구의 상당 부분은 논쟁적인 주제에 집중되었습니다. 이스라엘-팔레스타인 갈등은 답변의 변동 폭이 가장 넓었으며, 어떤 모델은 매우 일관된 사실을 제공한 반면 어떤 모델은 판이하게 다른 답변을 내놓았습니다. 이 주제에 대해 일부 모델은 사용자가 어린이로 식별될 경우 답변을 거부하거나 오류를 반환하기도 했습니다. 이는 모델이 인지된 사용자에 따라 민감한 주제로부터 물러나게 만드는 내장된 필터가 있을 수 있음을 시사합니다. 연구는 또한 정치적 민감성 자체가 불일치를 예측하는 척도는 아니라는 것을 발견했습니다. 일부 정치적 주제는 매우 불일치했지만 다른 주제는 그렇지 않았으며, 주택 비용과 같은 비정치적 주제에서도 낮은 일관성을 보였습니다. 이는 단일하고 안정적인 서사를 찾는 데이터의 난이도가 주요 요인임을 나타냅니다. 만약 특정 주제에 대해 이용 가능한 정보가 혼란스럽거나 논쟁적이라면, 모델은 서로 다른 사람들에게 서로 다른 사실을 제시할 가능성이 높습니다.

저자들은 자신들의 작업이 사실이 '참'인지 결정하는 것이 아니라, 사실이 '안정적'인지를 결정하는 것이라고 강조합니다. 그들은 정보가 정확하더라도 서로 다른 사람에게 서로 다른 사실을 제시하는 것이 해로울 수 있다고 주장합니다. 이는 사람들이 자신의 기존 신념에 부합하는 현실의 버전만을 듣게 되는 확증 편향을 초래하거나, 고정관념을 강화할 수 있습니다. 연구는 인공지능이 진정으로 신뢰받기 위해서는 누가 묻든 상관없이 안정적인 사실 세트를 제공해야 한다고 제언합니다. 연구진은 저널리스트, 개발자, 그리고 대중이 다양한 모델이 어떻게 작동하는지 직접 확인할 수 있도록 테스트 도구와 대화형 웹사이트를 공개했습니다. 그들은 이러한 투명성이 기업들이 사용자에게 맞춰 진실을 가공할 가능성이 낮은 시스템을 구축하도록 독려하여, 우리가 의존하는 정보가 일관되고 신뢰할 수 있는 상태로 남을 수 있게 하기를 희망합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →