← 최신 논문
💬 NLP

FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language

이 논문은 페르시아어 내 고정 관용구의 환각 현상을 평가하기 위한 최초의 벤치마크인 FFE-Hallu를 소개하며, 현재의 거대 언어 모델들이 문화적 근거 파악에 어려움을 겪고 조작된 관용구 및 속담을 빈번하게 생성하거나 감지하지 못한다는 점을 밝히고 있다.

원저자: Faezeh Hosseini, Mohammadali Yousefzadeh, Yadollah Yaghoobzadeh

게시일 2026-01-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Faezeh Hosseini, Mohammadali Yousefzadeh, Yadollah Yaghoobzadeh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 인간의 언어를 말하는 법을 가르치고 있다고 상상해 보십시오. 로봇이 "kick"과 "bucket" 같은 단어의 사전적 정의를 알고 있다면, "kick the bucket"이라는 구절을 이해할 수 있을 것이라고 생각할 수도 있습니다. 하지만 실제로 이 구절은 말 그대로 양동이를 차는 것을 의미하는 것이 아니라, "죽다"라는 의미를 담은 고정된 문화적 코드입니다.

이 논문인 FFE-HALLU는 AI를 위한 일종의 특화된 "거짓말 탐지기 테스트"와 같습니다. 이 로봇들이 실제로 자신만의 문화적 코드를 만들어내고 있는 것인지, 아니면 진짜 코드를 진정으로 이해하고 있는 것인지를 확인하기 위해 설계되었습니다.

연구진이 수행한 작업의 핵심을 쉬운 비유를 들어 설명하겠습니다.

1. 문제점: "가짜 관용구"의 함정

대규모 언어 모델(LLM)은 문장이 적절하게 들리도록 글을 쓰는 데 매우 뛰어납니다. 하지만 고정 관용 표현(Fixed Figurative Expressions, FFEs)—예를 들어 관용구("break a leg")나 속담("a stitch in time")—에 있어서는 종종 혼란을 겪습니다.

연구진은 이를 **비유적 환각(Figurative Hallucination)**이라는 특정 유형의 오류로 정의합니다.

  • 비유: 로봇이 농담을 하려고 노력하는 상황을 상상해 보세요. 로봇이 말합니다. "왜 허수아비가 상을 받았을까요? 왜냐하면 그는 들판에서 아주 뛰어났기(outstanding in his field) 때문입니다!" 이것은 진짜 농담입니다.
  • 환각: 그러고 나서 로봇은 이렇게 말합니다. "왜 토스터기가 상을 받았을까요? 왜냐하면 그는 그의 들판에서 아주 바삭했기(crispy in his field) 때문입니다!"
    • 문법 규칙은 따르고 있고, 농담처럼 들립니다. 하지만 이것은 가짜입니다. 인간의 문화에는 존재하지 않는 것입니다.
    • 위험한 점은, 만약 비원어민이 이를 듣고 "오, 저게 진짜 페르시아 속담인가 보네!"라고 생각하여 이를 사용했다가, 우스꽝스러워 보이거나 잘못된 정보를 퍼뜨리게 될 수 있다는 것입니다.

2. 해결책: "FFE-HALLU" 시험

저자들은 페르시아어를 위해 특별히 제작된 FFE-HALLU라는 테스트를 만들었습니다. 그들은 AI의 문화적 근육을 테스트하기 위해 600개의 연습 문제가 포함된 "체육관"을 구축했습니다. 이 테스트는 세 가지 주요 스테이션으로 구성됩니다.

  • 스테이션 1: "의미에서 구절로" 도전

    • 과제: AI에게 정의(예: "실수를 후회하고 다시는 하지 않겠다고 약속하다")를 주고, 실제 페르시아어 관용구를 말하도록 요청합니다.
    • 함정: 진짜 관용구를 말하는 대신, AI는 그럴듯하게 들리지만 인간이 한 번도 사용한 적 없는 가짜 관용구를 만들어낼 수 있습니다.
    • 결과: GPT-4.1과 같은 일부 상위 모델들은 약 60%의 정답률을 보였습니다. 반면 Qwen과 같은 모델들은 끔찍한 성적을 보였는데, 거의 70%의 경우에서 가짜 관용구를 만들어냈습니다.
  • 스테이션 2: "가짜인가 진짜인가?" 탐정 게임

    • 과제: AI에게 구절을 보여주고 "이것이 진짜 페르시아 관용구입니까?"라고 묻습니다.
    • 함정: 연구진은 실제 관용구와 똑같이 보이고 들리는(예: 단어 하나를 바꾸거나 의미를 살짝 비튼) 200개의 "가짜" 관용구를 만들었습니다.
    • 결과: 이 부분이 가장 어려웠습니다. 똑똑한 모델들도 혼란을 겪었습니다. "이것이 가짜입니까?"라는 질문에 많은 모델이 (그것이 실제로는 거짓임에도 불구하고) "아니오"라고 답했습니다. 이는 마치 완벽한 위조 신분증을 보고도 너무 그럴듯해서 진짜라고 믿어버리는 보안 요가 된 것과 같습니다.
  • 스테이션 3: "번역가" 테스트

    • 과제: AI에게 영어 관용구(예: "It's raining cats and dogs")를 주고, 직역이 아닌 그에 상응하는 문화적 대응 표현을 찾도록 합니다.
    • 함정: 만약 AI가 이를 문자 그대로 번역한다면("고양이와 개가 비처럼 내리고 있다"), 이는 페르시아어 화자들이 말하는 방식이 아니므로 환각에 해당합니다.
    • 결과: 대부분의 모델은 문화적 대응물을 찾는 데 어려움을 겪었으며, 종종 새로운 구절을 만들어내거나 너무 직역하는 모습을 보였습니다.

3. 결과: 누가 통과하고 누가 실패했는가?

연구진은 6가지 서로 다른 AI 모델을 테스트했습니다:

  • 최우수 성과자: GPT-4.1Claude 3.7이 가장 우수했습니다. 이들은 대개 실제 관용구를 찾아내고 가짜를 거부할 수 있었지만, 여전히 몇 가지 실수를 저질렀습니다.
  • 고전하는 모델들: DeepSeek, Gemma, Qwen과 같은 모델들은 자주 실패했습니다. 이들은 "과잉 생성(over-generate)"하는 경향이 있었는데, 즉 매우 진짜처럼 들리지만 완전히 발명된 가짜 관용구를 자신 있게 만들어냈습니다.
  • "예스맨" 문제: 일부 모델은 너무 기쁘게 해주고 싶은 나머지, "이것이 가짜입니까?"라는 질문에 (실제로는 "예, 진짜입니다"라는 뜻으로) "아니오"라고 답하곤 했습니다.

4. "심판"의 문제

논문은 또한 다음과 같은 질문을 던집니다: AI가 다른 AI의 결과물을 심사할 수 있는가?
그들은 한 AI가 다른 AI의 답안을 채점하도록 시도했습니다.

  • 비유: 이는 학생에게 다른 학생의 에세이를 채점하게 하는 것과 같습니다.
  • 결과: 쉬운 질문에서는 괜찮았지만, 미묘한 "가짜 관용구"를 포착하는 데 있어서 AI 심판들은 종-종 놓치는 경우가 있었습니다. 그들은 "틀린 답"과 "지어낸 답" 사이의 차이를 구분하지 못했습니다. 연구진은 미묘한 거짓말을 확실하게 잡아낼 수 있는 것은 여전히 인간 전문가(원어민 페르시아어 사용자)뿐이라는 것을 발견했습니다.

요약

이 논문은 AI에 대한 경고 라벨입니다. AI가 유창한 문장을 쓸 수는 있지만, 종종 **문화적 근거(cultural grounding)**가 부족하다는 것을 보여줍니다. AI는 마치 어떤 문화의 관용구를 아는 것처럼 보일 수 있지만, 실제로는 그 자리에서 즉석으로 만들어내고 있는 것일 뿐입니다.

연구진은 이를 증명하기 위해 테스트를 구축했으며, 가장 똑똑한 AI 모델들조차 "비유적 환각"—즉, 진실처럼 들리는 문화적 거짓말을 하는 현상—에 취약하다는 것을 보여주었습니다. AI가 실제 문화적 격언과 그럴듯한 가짜를 구분하는 법을 배우기 전까지, 우리는 깊은 문화적 이해가 필요한 작업에 AI를 온전히 신뢰할 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →