← 최신 논문
🤖 AI

Position: Text Embeddings Should Capture Implicit Semantics, Not Just Surface Meaning

이 입장서는 텍스트 임베딩 연구가 표면적 의미에서 화용론과 화자 의도 같은 암시적 의미를 포착하는 방향으로 초점을 전환해야 하며, 이를 위해 언어학적으로 근거를 둔 데이터, 더 깊은 평가 벤치마크, 그리고 실제 언어의 복잡성을 더 잘 반영하는 핵심 모델링 목표를 도입해야 한다고 주장한다.

원저자: Yiqun Sun, Qiang Huang, Anthony K. H. Tung, Jun Yu

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yiqun Sun, Qiang Huang, Anthony K. H. Tung, Jun Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 일상적인 비유를 사용하여 설명합니다.

핵심 아이디어: "문자 그대로 해석하는" 문제

외국 문화를 이해하는 데 도움을 줄 번역가를 고용한다고 상상해 보세요. 그들에게 사전과 단어 목록을 건네줍니다. 그들은 단어를 단어에 매칭하는 데 놀라울 정도로 빨라집니다. "비가 오고 있어요"라고 말하면, "비"를 의미하는 정확한 외국어를 정확히 알고 있습니다.

하지만 홍수에 잠긴 지하실을 보며 "글쎄, 정말 훌륭하군"이라고 말한다면, 이 번역가는 여전히 이를 "이것은 긍정적인 상황입니다"라고 번역할 뿐입니다. 그들은 반어를 놓칩니다. 숨겨진 의미를 놓칩니다. 의도를 놓칩니다.

이 논문은 현대 AI 텍스트 임베딩 (컴퓨터가 언어를 이해하는 데 사용하는 수학적 "사전") 이 이러한 문자 그대로 해석하는 번역가처럼 행동한다고 주장합니다. 그들은 표면적 의미 (비슷하게 보이는 단어) 를 매칭하는 데는 뛰어나지만, 암시적 의미 (실제로 의도된 것, 암시된 것, 또는 느껴지는 것) 를 이해하는 데는 형편없습니다.

의미의 세 가지 층위

저자들은 인간 언어를 양파처럼 세 가지 층위로 분해합니다.

  1. 겉껍질 (발화 수준): 이는 문자 그대로의 단어입니다.

    • 예시: "나는 간신히 시험에 합격했다."
    • 표면적 의미: 합격했다.
    • 숨겨진 의미: 놀라울 정도로 어려웠고, 합격할 것이라고 기대하지 않았다.
    • AI 의 문제: 현재 모델은 "합격"이라는 단어를 보고 거기서 멈춥니다. 그들은 놀라움을 놓칩니다.
  2. 중간 층 (화자 수준): 이는 화자의 태도나 입장이자입니다.

    • 예시: "형"이나 "야" 같은 은어를 사용하거나 특정 억양을 사용하는 것.
    • 숨겨진 의미: 이는 화자가 누구인지, 얼마나 친근한지, 또는 특정 집단에 어울리려고 노력하는지를 나타냅니다.
    • AI 의 문제: AI 는 "형"이라는 단어를 보지만, 그 뒤에 있는 "멋짐"이나 "연대감"을 느끼지 못합니다.
  3. 핵심 (사회 수준): 이는 문화적, 정치적 맥락입니다.

    • 예시: 중립적으로 들리지만 특정 집단에 대한 분노를 느끼게 하도록 작성된 뉴스 헤드라인.
    • 숨겨진 의미: 단어 뒤에 숨겨진 편견이나 이념.
    • AI 의 문제: AI 는 사실을 읽지만 "분위기"나 정치적 의제를 놓칩니다.

"시험 점수"의 환상

이 논문은 현재 이러한 AI 모델을 평가하는 방식의 주요 결함을 지적합니다.

수학 시험을 치르는 학생을 상상해 보세요.

  • 현재의 시험 (표면적 벤치마크): 시험은 "2 더하기 2 는 얼마인가?"와 "5 더하기 5 는 얼마인가?"를 묻습니다. 학생은 100% 를 맞춥니다. 우리는 말합니다. "훌륭해! 이 학생은 수학 천재야!"
  • 실제 세계 (암시적 의미): 실제 생활에서 학생에게 "사과 두 개를 주고 하나를 먹으면, 몇 개가 남고 공유하는 것에 대해 어떻게 느끼는가?"라고 묻습니다. 학생은 얼어붙습니다. 그들은 공유의 암시나 먹는 느낌을 파악할 수 없습니다.

저자들은 이러한 "실제 세계" 질문에서 AI 모델이 어떻게 수행하는지 보기 위해 "파일럿 연구 (소규모 실험)"를 실시했습니다.

  • 결과: 가장 똑똑하고 비싼 AI 모델들 (OpenAI 나 대형 기술 기업들의 모델 등) 도 단순히 단어를 세는 매우 간단한 컴퓨터 프로그램 ("토큰 가방"이라고 함) 보다 약간 더 잘 수행했을 뿐입니다.
  • 충격: 반어, 입장 감지, 또는 숨겨진 편견 이해가 필요한 작업에서 고급 AI 모델들은 무작위 추측자나 간단한 단어 세기 프로그램보다 거의 나아지지 않았습니다.

왜 이런 일이 발생할까요?

저자들은 문제가 훈련 식단성적표에 있다고 말합니다.

  1. 식단 (훈련 데이터): AI 모델은 방대한 양의 텍스트를 공급받지만, "유사한" 문장을 찾도록 훈련됩니다. 그들은 "고양이가 매트 위에 앉았다"가 "고양이가 러그 위에 쉬었다"와 유사하다고 배웁니다. 그들은 "장난기 있게 말한 '꽃병 깨뜨린 거 잘했네'"와 "진심으로 말한 '꽃병 깨뜨린 거 잘했네'"가 다르다는 것을 배우지 않습니다. 그들은 문자 그대로의 매칭 위주로 식단을 공급받으므로, 문자 그대로의 음식만 소화하도록 배웁니다.
  2. 성적표 (벤치마크): 이러한 모델을 순위 매기는 데 사용하는 테스트 (MTEB 등) 는 대부분 "이 두 문장은 같은 주제에 관한 것인가?"를 묻습니다. "화자가 반어법을 사용하고 있는가?" 또는 "이 문장은 정치적 편향을 숨기고 있는가?"를 거의 묻지 않습니다. 시험이 그것을 요구하지 않기 때문에 AI 는 그것을 배우지 않습니다.

제안된 해결책

이 논문은 "패러다임 전환 (완전한 방향 전환)"을 요구합니다.

  • 음식을 바꾸자: 우리는 반어, 숨겨진 의도, 사회적 맥락을 구체적으로 강조하는 데이터로 모델을 훈련해야 합니다. 단어들이 말한 것과 반대되는 의미를 가질 수 있음을 그들에게 가르쳐야 합니다.
  • 시험을 바꾸자: AI 가 무엇을 말했는지뿐만 아니라 왜 그것이 말해졌는지를 이해할 수 있는지 여부를 특별히 테스트하는 새로운 벤치마크가 필요합니다.
  • 목표로 삼자: 단순히 AI 를 더 빠르게 만들거나 키워드 매칭에 더 잘하게 하는 대신, "숨겨진 의미 이해"를 문법이나 철자처럼 주요 목표로 삼아야 합니다.

요약

현재 우리의 AI 텍스트 모델은 단어 매칭에는 뛰어나지만 인간의 뉘앙스에는 무지한 초고속 사전과 같습니다. 그들은 두 문장이 비슷한 단어를 사용한다고 알려줄 수는 있지만, 한 문장이 농담인지, 위협인지, 아니면 미묘한 정치적 공격인지를 알려주는 데는 종종 실패합니다. 저자들은 AI 가 인간 소통을 진정으로 이해하기를 원한다면, 표면적 유사성만으로 훈련하는 것을 멈추고 인간 의도의 숨겨진 층위를 가르치기 시작해야 한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →