← 최신 논문
💻 computer science

Truth Knows No Language: Evaluating Truthfulness Beyond English

본 논문은 바스크어, 카탈로냐어, 갈리시아어 및 스페인어에 대해 12개의 최첨단 LLM을 평가하기 위해 전문적으로 번역된 TruthfulQA 벤치마크의 확장판을 소개하며, 성능은 자원 수준에 따라 차이가 있지만 언어 간 진실성 격차는 예상보다 작으며 기계 번역이 교차 언어적 진실성 평가를 위한 확장 가능한 대안을 제공한다는 점을 밝힌다.

원저자: Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

게시일 2026-01-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 박학다식하며 영어를 완벽하게 구사하는 사서가 있다고 상상해 보세요. 당신은 그에게 "미국에서 국기를 태우는 것이 불법인가요?" 또는 "카멜레온은 숨기 위해 색을 바꾸나요?"와 같은 까다로운 질문을 던집니다. 사서는 답을 알고 있으며, 왜 흔한 미신들이 틀렸는지 그 이유까지 설명할 수 있습니다. 이 사서는 우리가 오늘날 사용하는 거대 언어 모델(LLM)과 같습니다.

하지만 만약 당신이 그 똑같은 사서에게 바스크어, 카탈루냐어, 갈리시아어, 또는 스페인어로 이 질문들을 던진다면 어떻게 될까요? 그들은 여전히 진실을 알고 있을까요, 아니면 해당 언어로 읽은 책이 적어서 이야기를 지어내기 시작할까요?

이 논문은 이를 알아내기 위해 설계된 거대하고 다국어적인 "진실 테스트"와 같습니다. 그들이 무엇을 했고 무엇을 발견했는지에 대한 이야기를 쉽게 설명해 드립니다.

거대한 문제: 영어 편향성

오랫동안 우리는 이 AI 사서들을 영어로만 테스트해 왔습니다. 이는 마치 요리사가 스테이크를 얼마나 잘 굽는지만 테스트한 뒤, 그가 "훌륭한 요리사"라는 이유만으로 완벽한 스시 롤도 만들 수 있을 것이라고 가정하는 것과 같습니다. 연구진은 알고 싶었습니다: AI는 모든 언어에서 동일하게 진실을 말하는가, 아니면 언어가 바뀌면 혼란을 겪는가?

그들은 (흔한 미신과 오해로 가득 찬) 유명한 영어 테스트인 TruthfulQA를 가져왔고, 전문 인간 번역가들을 통해 이를 바스크어, 카탈루냐어, 갈리시아어, 스페인어로 변환했습니다. 이는 단순히 로봇을 사용하여 번역한 것이 아니라, 문화적 뉘앙스가 온전히 유지되도록 인간을 사용했다는 점에서 중요합니다.

실험: 12명의 사서, 5개의 언어

그들은 12개의 서로 다른 AI 모델("사서들")을 이 테스트에 투입했습니다. 다섯 가지 언어로 질문을 던졌으며, 성적을 매기기 위해 세 가지 다른 방법을 사용했습니다:

  1. 인간 채점: 실제 사람들이 답변을 읽고 그것이 진실하며 도움이 되는지 결정했습니다.
  2. 객관식: 컴퓨터가 AI가 미리 작성된 정답을 골랐는지 확인했습니다 (마치 답안지 체크처럼).
  3. "AI 심판": 심판 역할을 하는 매우 똑똑한 AI를 사용하여 다른 AI들을 채점했습니다.

놀라운 발견들

1. "자원 격차"는 실재하지만, 예상보다 작다
언어 자원을 음식이라고 생각해 보세요. 영어는 5성급 만찬이고, 바스크어는 작고 간단한 간식입니다. 연구진은 AI가 만찬(영어)에서 가장 뛰어난 성능을 보였고, 간식 테이블(바스크어)에서 가장 낮은 성능을 보였다는 것을 발견했습니다.

  • 반전: 차이는 모두가 두려워했던 것만큼 크지 않았습니다. AI가 작은 언어들에서 완전히 정신을 놓아버린 것은 아니었습니다. 단지 조금 덜 정밀해졌을 뿐입니다.

2. "침묵하는 사서"의 함정
그들이 발견한 재미있는 특징이 하나 있습니다. 일부 오래된 "기초(base)" AI 모델들(채팅용으로 훈련되지 않은 모델들)은 까다로운 질문에 종종 "코멘트할 수 없습니다"라고 답하곤 했습니다.

  • 함정: 테스트 규칙에서 "모른다"라고 말하는 것은 (거짓말을 하는 것보다 낫기 때문에) 진실함으로 간다고 간주됩니다. 따라서 이 모델들은 그저 침묵함으로써 높은 점수를 받았습니다.
  • 실제: 연구진이 자세히 살펴보니, 이 "침묵하는" 모델들은 실제로 도움이 된 것이 아니라 그저 답변을 거부하고 있었을 뿐이었습니다. 최신 "지시 튜닝(instruction-tuned)" 모델들(수다스러운 모델들)은 비록 조금 더 복잡하더라도 실제로 더 나은, 더 정직한 답변을 내놓았습니다.

3. "AI 심판"이 최고의 심판이다
연구진은 어떤 채점 방식이 가장 좋은지 확인하려 했습니다.

  • 객관식은 경직된 로봇과 같았습니다. 답변이 목록과 일치하는지만 확인했을 뿐, 뉘우침이나 뉘앙스를 놓쳤습니다.
  • AI 심판은 똑똑한 인간 심판과 같았습니다. 실제 인간이 생각하는 "진실함"과 훨씬 더 잘 일치했습니다. 심판이 영어로 훈련되었더라도, 객관식 방식보다 스페인어나 바스크어에서의 진실성을 더 잘 포착해 냈습니다.

4. 크다고 항상 좋은 것은 아니지만, 대개 그렇다
과거의 일부 연구에서는 더 큰 AI 모델이 항상 더 나은 성능을 보이는 것은 아니었습니다. 하지만 여기서 연구진은 더 큰 모델(700억 개의 파라미터)이 작은 모델(80억 개)보다 특히 비영어권 언어에서 일관되게 더 진실했다는 것을 발견했습니다. 더 큰 "두뇌"를 갖는 것이 AI가 다양한 언어의 까다로운 물결을 헤쳐 나가는 데 도움이 되는 것으로 보입니다.

5. 보편적 지식 vs 지역적 지식
테스트에는 두 가지 유형의 질문이 있었습니다:

  • 보편적 질문: "왜 카멜레온은 색을 바꾸나요?" (어디서나, 언제나 참인 내용).
  • 지역적/시간 민감적 질문: "미국에서 국기를 태우는 것이 불법인가요?" (특정 장소와 시간에 국한된 내용).
    AI는 보편적 질문에는 뛰어났습니다 (정확도 거의 90%). 하지만 지역적이고 시간 민감적인 질문에는 더 어려움을 겪었습니다. 이는 우리가 AI를 "영원한 진리"로만 테스트한다면, 그들이 복잡하고 변화하는 실제 세상을 얼마나 잘 다루는지 제대로 테스트하지 못하고 있음을 시사합니다.

6. 로봇이 테스트를 번역할 수도 있다 (아마도)
마지막으로 그들은 궁금했습니다: "새로운 언어를 위한 테스트를 만들기 위해 비싼 인간 번역가가 꼭 필요한가?" 그들은 인간 대신 최상위 AI를 사용하여 테스트를 번역하는 실험을 했습니다.

  • 결과: AI가 번역한 테스트는 인간이 번역한 것과 거의 동일한 결과를 보여주었습니다. 이는 우리가 로봇을 사용하여 이 진실 테스트를 수백 개의 언어로 빠르게 확장할 수 있으며, 많은 돈과 시간을 절약할 수 있음을 의미합니다.

결론

이 논문은 AI가 여전히 약간 "영어 중심적(영어를 더 잘함)"이지만, 적절한 측정 도구를 사용한다면 다른 언어에서도 놀라울 정도로 진실을 말할 능력이 있다는 결론을 내립니다.

  • "침묵하는 사서"를 믿지 마세요: AI가 "모른다"라고 말한다고 해서 반드시 정직한 것은 아닙니다. 그저 게으른 것일 수도 있습니다.
  • 똑똑한 심판을 사용하세요: 단순한 체크리스트보다는 똑똑한 AI가 답변을 채점하게 하세요.
  • 지역적 맥락을 주의하세요: AI는 변하지 않는 사실에는 뛰어나지만, 질문하는 장소시간에 따라 달라지는 사실에 대해서는 더 많은 연습이 필요합니다.

연구진은 모든 데이터, 모델, 코드를 공개하였으므로, 누구나 자신의 AI 사서가 어떤 언어에서도 진실을 말하도록 가르칠 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →