← 최신 논문
💬 NLP

How Much Do LLMs Know About Chinese Zero Pronouns?

이 논문은 다양한 언어적 과업 전반에 걸쳐 중국어 영프로언운(Zero Pronoun)을 처리하는 여러 거대 언어 모델의 능력을 체계적으로 평가하며, 현재의 최첨단 추론 중심 모델들을 포함한 모델들이 일반적인 숙련도에도 불구하고 이러한 현상의 상류 단계 식별과 하류 단계 번역 모두에서 상당한 어려움을 겪고 있음을 밝히고 있다.

원저자: Yifei Li, Guanyi Chen, Tingting He

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yifei Li, Guanyi Chen, Tingting He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 중국어로 된 이야기를 읽고 있다고 상상해 보세요. 영어에서 "Bill"이라는 캐릭터가 무언가를 한다면, 우리는 보통 "Bill saw him."이라고 말합니다. 하지만 중국어에서 이 언어는 마치 빈 캔버스를 남겨두는 것을 즐기는 숙련된 미니멀리스트 화가와 같습니다. 당신은 그저 "Bill saw [공백]."을 보게 될 수도 있습니다.

이 공백 공간을 **영제로사(Zero Pronoun, ZP)**라고 부릅니다. 독자는 이 빈틈을 채우기 위해 머리를 써야 합니다: "아, 그가 자기 자신을 봤구나," 또는 "그는 를 봤구나."

이 논문은 오늘날 우리가 사용하는 초스마트 AI 챗봇인 **대규모 언어 모델(LLM)**에 대한 성적표와 같습니다. 연구자들은 알고 싶었습니다: 이 AI 뇌들이 실제로 중국어의 보이지 않는 빈칸을 '볼' 수 있는지, 그 빈칸이 누구를 가리키는지 이해할 수 있는지, 그리고 그것을 영어로 올바르게 번역할 수 있는지 말입니다.

다음은 몇 가지 간단한 비유를 사용한 그들의 조사 내용입니다.

1. 5단계 테스트 ("이해의 사다리")

연구자들은 단순히 AI에게 문장을 번역하라고 시킨 것이 아닙니다. 그들은 가장 쉬운 단계(빈칸 찾기)부터 가장 어려운 단계(전체 이야기 번역하기)까지 5개의 과제로 구성된 사다리를 만들었습니다.

  • 1단계: 빈칸 찾기 (식별 - Identification).
    • 과제: 중국어 문장을 보고 보이지 않는 대명사가 정확히 어디에 숨어 있는지 찾아내기.
    • 결과: AI는 여기서 고전했습니다. 이는 로봇에게 어두운 방에서 유령을 찾아보라고 하는 것과 같습니다. 작은 규모의 AI 모델들은 유령을 거의 찾지 못했습니다. 크고 똑똑한 모델들조차 약 15% 정도만 찾아냈습니다.
  • 2단계: 실재하는가? (지시성 - Referentiality).
    • 과제: 빈칸이 특정 인물/사물을 가리키는지, 아니면 단순히 일반적인 "누군가"(예를 들어, 특정 인물이 아닌 "사람은 안전벨트를 매야 한다"라고 할 때의 "사람"처럼)를 의미하는지 결정하기.
    • 결과: AI는 게으름을 피웠습니다. AI는 빈칸이 그렇지 않을 때조차 모든 빈칸이 특정 인물을 가리킨다고 가정했습니다. 이는 모든 그림자를 범죄자로 생각하는 형사와 같았습니다.
  • 3단계: 어느 방향을 보고 있는가? (지시 유형 - Referential Type).
    • 과제: 만약 빈칸이 누군가를 가리킨다면, 그 사람이 빈칸 이전에 언급되었는지(뒤를 돌아봄), 아니면 빈 коэффициент 이후에 언급되었는지(앞을 내다봄) 판단하기.
    • 결과: AI는 혼란스러워했습니다. 뒤를 돌아보는 것(이전 언급)은 괜찮았지만, 앞을 내다보는 것(이후 언급)은 엉망이었습니다.
  • 4단계: 퍼즐 풀기 (해결 - Resolution).
    • 과제: 실제로 빈칸이 가리키는 인물의 이름을 맞히기.
    • 결과: AI는 특히 대화 맥락에서 저조한 성적을 보였습니다. 맥목에 맞지 않더라도 방 안에서 가장 유명한 이름을 골라내는 나쁜 습관이 있었습니다.
  • 5단계: 번역 (최종 보스 - The Final Boss).
    • 과제: 중국어 텍스트를 영어로 번역하면서, 빈칸을 올바른 영어 단어(예: "he", "she", "it")로 채우기.
    • 결과: 이것이 가장 큰 실패였습니다. 가장 뛰어난 AI 모델조차 절반도 맞히지 못했습니다. 그들은 보이지 않는 빈칸의 절반 미만(< 50%)만을 올바르게 번역했습니다.

2. "크기 vs 지능" 논쟁

연구자들은 다양한 크기(소형, 중형, 거대)와 다양한 "성격"(표준 모델 vs 단계별로 생각하는 "추론" 모델)을 가진 AI 모델들을 테스트했습니다.

  • 덩치가 크다고 항상 더 나은 것은 아니다: 거대 모델들이 소형 모델들보다 약간 더 나은 성과를 보였지만, 그 격차는 엄청나지 않았습니다.
  • 생각하는 것이 도움이 된다: "추론" 모델(답변하기 전에 잠시 "생각"하는 모델)이 전반적으로 가장 좋은 성적을 거두었습니다. 이들은 제출하기 전에 자신의 답을 다시 확인하는 학생들과 같았습니다.
  • 번역의 역설: 놀랍게도, AI가 빈칸을 찾는 능력을 키운다고 해서 자동으로 번역 능력이 좋아지는 것은 아니었습니다. 번역 기술은 AI가 아직 완전히 구축하지 못한 별개의 근육인 듯합니다.

3. "오라클(Oracle)" 실험 (AI에게 치트키를 주다)

연구자들은 궁금했습니다: 만약 우리가 AI에게 빈칸이 정확히 어디에 있는지 알려준다면, 더 잘 번역할 수 있을까?

  • 설정: 그들은 빈칸이 특수 태그(예: <pro>)로 표시된 버전의 텍스트를 AI에게 제공했습니다.
  • 결과: 결과가 폭발적이었습니다. 성능이 급격히 뛰어올랐습니다. AI가 어디를 봐야 할지 알게 되자, "추론" 모델들은 약 **79%**의 확률로 정답을 맞혔습니다.
  • 교훈: AI가 반드시 빈칸의 의미를 이해하지 못하는 것이 아니라, 애초에 빈칸을 찾는 것 자체를 매우 못한다는 것입니다. 일단 위치를 짚어주면, 나머지는 파악할 수 있습니다.

4. "맥락(Context)" 문제

연구자들은 AI에게 얼마나 많은 "배경 이야기"가 필요한지도 테스트했습니다.

  • 발견: 어떤 과제의 경우, AI에게 더 많은 문장(더 많은 맥락)을 주는 것이 오히려 성과를 악화시켰습니다. 이는 혼란에 빠진 학생에게 필요한 한 페이지 대신 도서관 전체의 책을 주는 것과 같았습니다. 추가된 정보가 오히려 그들을 더 혼란스럽게 만들었습니다.

결론

이 논문은 중국어 영제로사가 현재의 AI에게 거대하고 해결되지 않은 골칫거리라는 결론을 내립니다.

오늘날 가장 발전된 AI 모델이라 할지라도, 중국어를 몇 마디 할 줄은 알지만 대화의 보이지 않는 부분을 계속 놓치는 관광객과 같습니다. 그들은 존재하는 단어들은 번역할 수 있지만, 문장을 이해하게 만드는 '보이지 않는 빈칸'을 채우는 데는 계속해서 실패합니다.

연구자들은 이 연구가 개발자들에게 AI가 정확히 어느 부분에서 실패하고 있는지 보여주는 "성적표" 역할을 하여, 인간 언어의 "보이지 않는" 부분까지 진정으로 이해할 수 있는 더 나은 시스템을 구축하도록 돕기를 바랍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →