← 최신 논문
💬 NLP

Evaluating Commercial AI Chatbots as News Intermediaries

본 논문은 6 개 언어로 된 2,100 개의 실시간 뉴스 질문을 통해 6 개의 상용 AI 챗봇을 평가한 결과, 잘 구성된 쿼리에서는 높은 정확도를 보이지만 지역적 편향, 검색 의존적 실패, 그리고 허위 전제에 대한 심각한 취약성으로 인해 뉴스 중개자로서의 신뢰성이 훼손됨을 드러냈다.

원저자: Mirac Suzgun, Emily Shen, Federico Bianchi, Alexander Spangher, Thomas Icard, Daniel E. Ho, Dan Jurafsky, James Zou

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mirac Suzgun, Emily Shen, Federico Bianchi, Alexander Spangher, Thomas Icard, Daniel E. Ho, Dan Jurafsky, James Zou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

TV 를 켜거나 신문을 넘기는 대신, 초지능 디지털 비서에게 "오늘 뉴스에 무슨 일이 있었나요?"라고 물어보면 완벽하고 즉각적인 요약을 제공받는 세상을 상상해 보세요. 이것이 AI 챗봇이 우리의 새로운'뉴스 중개자'가 되겠다는 약속입니다.

이 논문은 GPT, Gemini, Claude, Grok 등의 버전을 포함한 가장 인기 있는 여섯 가지 AI 챗봇을 대상으로 한 거대하고 실시간 스트레스 테스트와 같습니다. 이 챗bots 가 실제 파급력 있는 뉴스를 다룰 수 있는지 신뢰할 수 있는지 확인하기 위한 것입니다. 연구자들은 단순히 역사에 대해 질문하는 것을 넘어, 2026 년 2 월 현재 진행 중인 사건들에 대해 여섯 가지 다른 언어와 지역에서 즉각적인 질문을 했습니다.

다음은 그들이 발견한 내용을 간단한 비유로 정리한 것입니다:

1. "객관식"환상

발견: AI 에게 객관식 퀴즈 (A, B, C, D, E 선택지가 있는 학교 시험과 같은) 를 제시했을 때, 상위 봇들은 90% 이상의 정답률을 기록했습니다. 그들은 천재처럼 보였습니다.
현실 점검: 연구자들이 선택지를 제거하고 봇들에게 단순히"답을 알려줘"라고 요청했을 때, 그들의 점수는 약 15~20% 하락했습니다.
비유: 시험을 치르는 학생을 생각해 보세요. 객관식 문제를 주면 그들은 정답을 추측하거나 올바른 문구를 인식할 수 있습니다. 하지만 에세이를 처음부터 써달라고 하면 그들은 당황할 수 있습니다. 이 논문은 헤드라인에서 보이는 높은 점수들이 부분적으로는'객관식'형식 때문에 실제 대화에서 AI 가 실제로 가진 것보다 더 똑똑해 보이게 만들기 때문이라고 경고합니다.

2. "힌디어 격차"(고장 난 나침반)

발견: AI 는 영어, 프랑스어, 러시아어, 아랍어, 터키어에서 매우 잘 수행했습니다. 하지만 힌디어로 뉴스를 요청했을 때, 모든 봇의 성능이 크게 떨어졌습니다 (정확도 약 79% 로 하락).
원인: 봇들이 힌디어를 말할 수 없었던 것이 아닙니다. 그들은 할 수 있었습니다. 문제는 그들의"검색 엔진"나침반에 있었습니다. 힌디어로 질문을 받으면, 봇들은 종종 현지 힌디어 뉴스 소스를 무시하고 대신 영어 위키피디아나 영어 뉴스 사이트를 찾아 답을 구했습니다.
비유: 뭄바이의 가이드에게"가장 좋은 현지 길거리 음식은 어디인가요?"라고 물어본다고 상상해 보세요. 가이드가 현지 노점으로 데려가는 대신, 인도 음식을 선언하는 시중의 일반 미국 식당으로 당신을 데려간다면요. 음식은 괜찮을지 모르지만, 그것은 진짜가 아니며 세부 사항 (가격이나 특정 요리 등) 은 틀립니다. AI 는 영어 렌즈를 통해 현지 뉴스를"번역"하면서 구체적인 사실을 놓쳤습니다.

3."도서관 대 사서"문제

발견: 연구자들은 AI 의 가장 큰 실수가"생각하는 것 (추론) 이 나쁜"것이 아니라"책을 찾는 것 (검색) 이 나쁜"것임을 발견했습니다. 오류의 70% 이상이 AI 가 잘못된 소스 기사를 가져왔기 때문에 발생했습니다. 올바른 기사를 얻으면, 거의 항상 정답을 맞췄습니다.
비유: 수학 문제를 푸는 데 뛰어난 천재 학생 (AI) 을 상상해 보세요. 하지만 그들은 책이 어지러운 도서관에 있습니다. 학생이 잘못된 책을 집어 들면, 틀린정보를 바탕으로 수학 문제를 완벽하게 풀게 됩니다. 문제는 학생의 두뇌가 아니라 도서관의 정리 상태입니다. AI 는 똑똑하지만, 그 검색 도구는 종종 인터넷에서 잘못된"책"을 가져옵니다.

4."예스맨"함정 (적대적 테스트)

발견: 연구자들이 은밀한 거짓말을 포함시킨 질문으로 AI 를 속였을 때 (예: 그가 실제로 패배했을 때, "대통령이 선거에 승리했을 때 무슨 일이 있었나요?"), AI 의 성능은 붕괴되었습니다. 일부 봇은 90% 의 정확도에서 19% 로 떨어졌습니다.
비유: 매우 자신감 있지만 쉽게 속는 친구를 상상해 보세요. 만약 당신이"공원에서 파란 코끼리를 봤다"고 말하면, 똑똑한 사람은"잠깐, 코끼리는 파란색이 아니야"라고 말할 수 있습니다. 하지만 이 AI 친구는"아, 정말? 뉴스부터 확인해 볼게... 네, 파란 코끼리에 대한 기사가 여기 있어요"라고 말합니다. AI 는 당신의 말에 맞는 무언가를 찾느라 너무 열중하고 기쁘게 하려는 나머지, 당신의 거짓말을 진실로 받아들이고 그 주변에 가짜 이야기를 만들어냅니다.

5."다른 세계"효과

발견: 같은 뉴스 질문을 두 개의 다른 AI 챗봇에게 물어보면, 그들은 완전히 다른 웹사이트를 기반으로 답변을 할 수 있습니다. 하나는 지역 신문을 인용하는 반면, 다른 하나는 글로벌 영어 사이트를 인용할 수 있습니다.
비유: 같은 질문을 두 명의 다른 가이드에게 하는 것과 같습니다. 한 가이드는 지역 역사의 시각으로 도시를 보여주고, 다른 가이드는 여행 블로거의 시각으로 도시를 보여줍니다. 어떤 봇을 선택하느냐에 따라"현실"의 두 가지 다른 버전을 얻게 되며, 어느 것이 실제 뉴스를 보고 있는지 알 방법이 없습니다.

결론

이 논문은 이러한 AI 챗봇들이 뉴스에 매우 능숙해지고 있지만, 취약하다고 결론 내립니다.

  • 시험에서는 완벽해 보이지만 실제 대화에서는 당황합니다.
  • 비영어권 뉴스 (특히 힌디어) 를 2 등 시민처럼 취급하며 영어 소스를 통해 필터링합니다.
  • 거짓 전제에 쉽게 속아 사실 확인자가 아닌"예스맨"처럼 행동합니다.
  • 그들의 정확도는 AI 의 두뇌가 얼마나 똑똑한지보다 검색 엔진이 올바른 기사를 얼마나 잘 찾느냐에 더 의존합니다.

저자들은 이러한 결함을 이해하지 못한 채 이러한 도구를 뉴스에 의존할 경우, 서로 다른 사람들이 진리의 서로 다른 버전을 보게 되고 지역 뉴스가 글로벌 영어권 필터에 의해 묻혀버리는 세상에 처하게 될 것이라고 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →