← 최신 논문
💬 NLP

LLMs as Cultural Archives: Cultural Commonsense Knowledge Graph Extraction

이 논문은 대규모 언어 모델로부터 문화적 상식 지식 그래프를 추출하여 암묵적인 문화적 지식을 구조화하기 위한 반복적 프레임워크를 소개하며, 이러한 그래프가 문화적 추론과 생성을 향상시키지만 비영어권 문화를 나타낼 때조차 현재 영어에 대해 상당한 편향을 보인다는 점을 밝힌다.

원저자: Junior Cedric Tonga, Chen Cecilia Liu, Iryna Gurevych, Fajri Koto

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Junior Cedric Tonga, Chen Cecilia Liu, Iryna Gurevych, Fajri Koto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 거대하고 보이지 않는 도서관이라고 상상해 보세요. 이 도서관에는 전 세계 사람들이 쓴 책들이 가득 차 있어, 다양한 문화가 어떻게 생각하고, 행동하고, 축하하는지에 대한 방대한 정보를 담고 있습니다. 하지만 현재 이 정보들은 매우 무질서합니다. 도서관 깊숙한 곳에 흩어져 있는 수백만 개의 정리되지 않은 문장들 속에 파묻혀 있어, 특정 문화의 구체적인 '규칙'을 찾아내거나 이해하기 어렵습니다.

이 논문은 그 도서관을 정리하여 **문화적 상식 지식 그래프(Cultural Commonsense Knowledge Graph, CCKG)**로 만드는 방법을 제안합니다. 이 그래프를 단순한 사실 목록이 아니라, 하나의 기차 선로 시스템이라고 생각해 보세요.

핵심 아이디어: 사실을 기차 선로로 바꾸기

보통 AI에게 문화에 대해 물으면, "인도네시아인은 아침 식사로 *소토 아얌(soto ayam)*을 먹는다"와 같은 단일한 사실을 알려줄 수 있습니다. 그것은 정적인 사실입니다.

저자들은 그 사실의 여정을 그려내고자 했습니다. 그들은 AI에게 다음과 같이 질문하는 시스템을 구축했습니다: "만약 누군가 아침 식사를 원한다면, 그다음에 무엇을 하는가? 그다음은? 그리고 그 후에 일어나는 일은 무엇인가?"

  • 선로: "아침 식사를 찾는다면 \rightarrow 와룽(작은 가게)에 간다 \rightarrow 소토 아얌을 주문한다 \rightarrow 따뜻함과 위로를 느낀다."

이 단계들을 연결함으로써, 그들은 문화적 논리의 "기차 선로"를 만들어냅니다. 이를 통해 AI는 단순히 무엇이 일어나는지뿐만 아니라, 문화적 삶의 흐름을 이해할 수 있게 됩니다.

선로를 구축하는 방법 (과정)

연구진은 AI(특히 GPT-4o)를 "문화적 기록 보관사"로 취급했습니다. 그들은 이 선로들을 만들기 위해 두 단계의 과정을 거쳤습니다.

  1. 첫 번째 레일 깔기 (초기 생성): 연구진은 AI에게 일상적인 생활 주제(음식, 결혼식, 습관 등)에 대해 간단한 "만약 ~라면, ~한다(If-Then)" 문장을 생성하도록 요청했습니다. 대상 국가는 중국, 인도네시아, 일본, 영국, 이집트 다섯 곳이었습니다.
  2. 선로 확장하기 (반복적 확장): 이것이 영리한 부분입니다. 일단 AI가 "아침 식사를 찾는다면, 소토 아얌을 주문한다"라고 말하면, 연구진은 AI에게 그 사이의 빈틈을 채우도록 요청했습니다.
    • 중간 확장: "아침 식사를 찾는 것과 주문하는 것 사이에는 어떤 일이 일어나는가? 아마도 먼저 곁들임 음식을 고를 수도 있을 것이다."
    • 전방 확장: "주문한 후에 어떤 일이 일어나는가? 아마도 삼발(칠리 소스)을 추가할 수도 있을 것이다."

이 과정을 반복하여, 단일한 사실을 길고 논리적인 문화적 행동의 사슬로 변모시켰습니다.

큰 반전: "영어 브릿지(English Bridge)"

연구진은 다음과 같은 가설을 세웠습니다: "만약 우리가 인도네시아 문화에 대해 알고 싶다면, 인도네시아어로 물어야 한다. 중국 문화에 대해 알고 싶다면, 중국어로 물어야 한다."

그들은 틀렸습니다.

이 문화적 선로들의 품질을 테스트했을 때, 그들은 이상하지만 일관된 패턴을 발견했습니다. 영어로 구축된 선로가 모국어로 구축된 선로보다 훨씬 더 뛰어났습니다.

  • 비유: 도시의 지도를 그린다고 상상해 보세요. 현지 언어로 그려야 가장 정확할 것이라고 생각할 수 있습니다. 하지만 연구진은 AI의 "내부 지도"가 영어로 가장 명확하게 그려져 있다는 것을 발견했습니다. 인도네시아의 아침 식사나 이집트의 결혼식을 설명할 때조차도, AI는 영어로 말하도록 강제되었을 때 더 논리적이고 일관되며 문화적으로 정확한 "선로"를 만들어냈습니다.
  • 결과: 지식 그래프의 영어 버전은 중국어, 아랍어, 또는 인도네시아어로 작성된 버전보다 더 일관성이 있었고, 인간 평가자들에게 더 잘 통했습니다.

이것이 작은 AI들에게 도움이 될까요?

연구진은 이 "기차 선로"(CCKG)를 가져가서 더 작고 성능이 낮은 AI 모델들에게 주고, 이것이 그들의 문화적 이해를 돕는지 확인했습니다.

  • 테스트: 연구진은 이 작은 모델들에게 문화에 관한 질문에 답하거나 짧은 이야기를 쓰도록 요청했습니다.
  • 결과: 작은 모델들이 (CCKG를 가이드로 사용하여) "선로를 들여다볼 수 있게 되었을 때", 그들은 문화적으로 실감 나는 답변을 하고 이야기를 쓰는 데 훨씬 더 나은 모습을 보였습니다.
  • 주의점: 가장 큰 효과는 모델들이 비영어권 문화를 다룰 때조차 영어 선로를 사용했을 때 나타났습니다. 현재로서는 "영어 브릿지"가 AI의 문화적 지식에 접근하는 가장 신뢰할 수 있는 방법인 것으로 보입니다.

그들이 주장하지 않은 것

논문의 내용을 정확히 전달하는 것이 중요합니다:

  • 그들은 이 시스템이 병원, 학교, 또는 법률 시스템에서 바로 사용될 준비가 되었다고 말하지 않았습니다.
  • 그들은 이 시스템이 AI의 편향성이나 고정관념 문제를 해결했다고 주장하지 않았습니다 (실제로 편향성은 여전히 위험 요소이며, 이에 대해 깊이 있게 감사하지 않았음을 언급했습니다).
  • 그들은 영어가 인간이 사용하기에 "최고의" 언어라고 말한 것이 아닙니다. 그들은 단지 이 특정 AI 모델들에 있어서는, 영어로 추출하는 것이 문화적 논리에 접근하는 가장 안정적인 방법임을 발견했을 뿐입니다.

요약

이 논문은 우리가 AI 모델을 거대한 문화적 지식의 저장소로 취급할 수 있음을 보여줍니다. AI에게 문화적 논리의 "기차 선로"(만약 이 일이 일어나면, 그다음엔 저 일이 일어난다)를 구축하도록 요청함으로써, 우리는 서로 다른 문화가 작동하는 방식에 대한 구조화된 지도를 만들 수 있습니다. 그러나 반전이 있습니다. 현재 이 AI 모델들은, 비록 그 대상이 영어를 쓰지 않는 문화라 할지라도, 영어를 사용할 때 이러한 문화적 지도를 가장 명확하게 이해하고 표현하는 것으로 보입니다. 이 "영어의 이점"은 작은 AI 모델들의 성능을 높여주지만, 동시에 현재 우리의 AI 도구들이 세계의 다양한 문화들을 재현하는 방식이 여전히 불균형하다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →