← 최신 논문
💻 computer science

The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks

이 논문은 영국 정부 정보를 기반으로 생성된 22,000개의 합성 시민 질의어로 구성된 새로운 벤치마크 데이터셋인 CitizenQuery-UK를 소개하며, 공공 부문 애플리케이션에서 AI의 불완전성을 인정해야 할 필요성과 핵심적인 신뢰성 문제를 강조하기 위해 11개의 대규모 언어 모델을 사실성, 기권, 장황함을 기준으로 평가한다.

원저자: Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영국의 정부 규칙(예: 혜택을 신청하는 방법이나 세금 양식을 작성하는 법)처럼 혼란스러운 정부 규정을 파악하려고 애쓰는 일반인이라고 상상해 보세요. 과거에는 도움 데스크에 전화를 걸거나 정부 웹사이트를 검색했을 것입니다. 오늘날에는 매우 똑똑한 AI 챗봇에게 물어볼 수도 있습니다.

이 논문은 이러한 특정 정부 규칙에 관한 질문들을 AI 챗봇이 얼마나 잘 처리하는지 테스트하기 위한 거대한 "성적표"를 구축하는 것에 관한 내용입니다. 저자들은 이 성적표를 CitizenQuery-UK라고 부릅니다.

다음은 그들이 무엇을 했고 무엇을 발견했는지에 대한 요약이며, 쉬운 비유를 사용했습니다.

1. 문제점: "나를 믿으라는" 함정 (The "Trust Me" Trap)

당신이 세금에 대해 조언을 구했는데, 아주 자신감 넘치고 빠르게 말을 하는 AI가 나타나서 매우 상세한 답변을 준다고 상상해 보세요. 하지만 만약 그 AI가 존재하지도 않는 규칙을 지어낸 것이라면 어떨까요? 일반적인 대화라면 그저 재미있는 실수에 불과하겠지만, 정부 규칙의 경우라면 이야기가 다릅니다. 지어낸 사실 하나가 당신에게 금전적 손실을 입히거나, 법적 문제를 일으키거나, 삶을 망가뜨릴 수 있기 때문입니다.

저자들은 이렇게 말합니다: "우리는 AI가 똑똑해 보인다는 이유만으로 그들을 신뢰할 수 없습니다. 그것이 진실을 말하고 있다는 증거가 필요합니다."

2. 해결책: "시험" 구축하기 (데이터셋)

AI를 테스트하려면 시험지가 필요합니다. 하지만 단순히 질문을 만들어내서는 안 되며, 반드시 실제적이어야 합니다.

  • 출처: 그들은 정부 규칙의 "성경"과도 같은 gov.uk(영국 공식 정부 웹사이트)에서 수천 페이지의 내용을 가져왔습니다.
  • 질문: 그들은 단순히 로봇 같은 질문을 던진 것이 아닙니다. Reddit에서 사람들이 조언을 구하는 실제 사례들을 사용하여, 질문이 실제 인간이 말하는 방식(무질서하고, 구체적이며, 때로는 혼란스러운 방식)처럼 들리도록 만들었습니다.
  • 캐릭터: 질문을 위해 "페르소나(Persona)"를 만들었습니다. 예를 들어, 육아에 관한 질문은 '아이'가 아닌 '부모' 페르소나에 할당됩니다. 이는 AI가 질문하는 사람의 *맥락(Context)*을 이해하는지 테스트하기 위함입니다.
  • 결과: 그들은 22,000개의 질문-답변 쌍으로 구성된 데이터셋을 구축했습니다. 이것은 정답이 이미 정부의 공식 텍스트에 적혀 있는, 22,000문제짜리 거대한 기말고사라고 생각하면 됩니다.

3. 채점 방식: 어떻게 검토했는가

그들은 단순히 "AI가 맞게 답했는가?"라고 묻지 않았습니다. 매우 정밀하게 검토하기 위해 3단계 채점 과정을 사용했습니다.

  • 1단계: "침묵" 체크 (Abstention): AI가 확신이 없을 때 "모른다"고 말합니까? 아니면 그냥 추측해 버립니까? 저자들은 AI가 모른다는 것을 인정할 만큼 용기 있는지, 아니면 너무 떠들고 싶어 하는지를 보고 싶었습니다.
  • 2단계: 세분화 (Atomization): AI가 긴 문단을 작성한다고 가정해 봅시다. 채점자들은 그 문단을 아주 작은 개별적인 사실들로 나누었습니다 (마치 레고 성을 개별 브릭으로 분해하는 것과 같습니다).
  • 3단계: "진실 일치" 확인 (Verification): 그들은 AI가 말한 모든 "브릭(사실)"을 정부의 공식 답변에 있는 "브릭"과 비교했습니다.
    • 점수 (F1@K): 점수는 두 가지를 기준으로 부여되었습니다. AI가 올바른 사실을 포함했는가? 그리고 올바른 사실'만' 포함했는가(너무 많은 군더더기를 붙이지 않았는가)?

4. 결과: 성적표가 말해주는 것

그들은 11개의 서로 다른 AI 모델(OpenAI, Google, Meta 등의 모델)을 테스트했고, 흥미로운 사실들을 발견했습니다.

  • "수다스러운" 문제 (The "Chatty" Problem): 거의 모든 AI가 너무 많이 떠들었습니다. 마치 간단한 질문을 받았을 때 에세이를 써 내려가는 학생 같았습니다. 그들은 공식 정부 텍스트에 없는 추가적인 사실들을 덧붙였습니다. 이를 **장황함(Verbosity)**이라고 합니다.
  • "침묵" 문제 (The "Silent" Problem): AI는 거의 "모른다"고 말하지 않았습니다. 심지어 틀렸을 때조차 계속해서 말을 이어갔습니다. 답변을 "유보(Abstain)"하는 경우가 거의 없었습니다.
  • 오류의 "긴 꼬리" (The "Long Tail" of Errors): 대부분의 경우 AI는 주요 핵심은 잘 짚어냈습니다. 하지만 틀릴 때는 아주 크게 틀렸습니다. 이는 마치 쉬운 문제에서는 A를 받지만, 어려운 문제에서는 완전히 낙제하는 학생과 같습니다. 이로 인해 결과가 예측 불가능해집니다.
  • 공개형 vs 폐쇄형 (Open vs. Closed): 코드가 공개된 일부 "오픈(Open)" 모델들도 값비싼 "폐쇄형(Closed)" 모델들만큼 성능이 좋았습니다. 좋은 결과를 얻기 위해 반드시 가장 비싼 AI를 사용할 필요는 없다는 뜻입니다.

5. 핵심 결론

이 논문은 AI가 발전하고 있기는 하지만, 현재로서는 고도의 책임이 따르는 정부 조언을 하기에는 너무 떠들기를 좋아하고, 틀렸음을 인정하기를 두려워한다고 결론짓습니다.

만약 AI가 당신의 정부 규칙 가이드가 되고 싶다면, 두 가지를 배워야 합니다:

  1. 간결해질 것: 정부 웹사이트의 사실에만 충실할 것. 추가적인 이야기를 지어내지 말 것.
  2. 겸손해질 것: 답을 모른다면 추측하는 대신 "모릅니다"라고 말할 것.

저자들은 이 "시험"(CitizenQuery-UK)을 구축함으로써, 정부와 기술 기업들이 AI가 사람들의 실제 삶의 문제들을 도울 수 있을 만큼 안전하고 신뢰할 수 있게 변하는지 지속적으로 테스트할 수 있도록 했습니다. 그들은 AI가 아직 인간 상담원을 대체할 준비가 되었다고 말하는 것이 아닙니다. 대신, "우리가 준비에 얼마나 가까워졌는지 측정할 수 있는 자(Ruler)를 여기 제시한다"라고 말하고 있는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →