KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
이 논문은 대규모 설문조사를 통한 국가별 사회적 가치에 대한 이해와 교과서 기반 질문을 통한 상식 능력을 평가함으로써 대규모 언어 모델의 한국과의 정렬(alignment)을 평가하기 위한 첫 번째 벤치마크인 KorNAT를 소개하며, 현재의 모델들이 요구되는 정렬 기준에 미치지 못하는 경우가 많다는 것을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
급격히 진화하는 인공지능의 세계에서, 대규모 언어 모델은 한때 불가능해 보였던 유창함으로 이야기를 쓰고, 문제를 해결하며, 질문에 답할 수 있는 강력한 도구가 되었습니다. 이러한 시스템은 인터넷의 방대한 양의 텍스트를 통해 학습하며, 인간의 언어와 지식의 패턴을 배웁니다. 그러나 이러한 모델들이 서로 다른 문화와 상호작용하는 방식에는 상당한 격차가 발생했습니다. 이들은 일반적인 개념을 이해하는 데는 뛰어나지만, 특정 국가의 삶을 정의하는 구체적인 사회적 가치, 역사적 맥락, 그리고 일상적인 상식을 파악하는 데는 종종 어려움을 겪습니다. 모델은 보편적인 물리학의 사실은 알 수 있겠지만, 현지 법률에 대한 사회의 미묘한 의견이나 한 국가가 역사를 기억하는 특정한 방식은 이해하지 못할 수 있습니다. 인공지능이 특정 국가에서 진정으로 유용하고 안전하기 위해서는, 그 나라 국민들의 집단적 사고방식 및 기초 지식과 일치해야 합니다.
한국의 연구진은 이러한 디지털 지능이 한국인의 삶의 방식을 얼마나 잘 이해하고 있는지를 측정하는 새로운 방법을 만들어 이 문제를 해결하기 위한 중요한 발걸음을 내디뎠습니다. 그들은 인공지능이 한국 시민처럼 생각하고 느낄 수 있는지 확인하기 위해 특별히 설계된 종합 테스트인 KorNAT이라는 벤치마크를 도입했습니다. 연구팀은 이 테스트를 두 가지 주요 축, 즉 사회적 가치와 상식(common knowledge)을 중심으로 구축했습니다. 사회적 가치는 특정 법률을 변경해야 하는지 또는 사회적 갈등을 어떻게 처리해야 하는지와 같이 사람들이 중요한 사회적 이슈에 대해 갖는 공유된 의견을 의미합니다. 상식은 역사, 문학부터 과학, 지리에 이르기까지 대부분의 사람들이 학교에서 배우는 기본적인 사실과 문화적 토대를 다룹니다. 이 두 가지 측면에서 모델을 테스트함으로써, 연구진은 인공지능이 단순히 사실을 암송하는 것인지, 아니면 국가의 문화적 결을 진정으로 이해하고 있는지를 판단할 수 있었습니다.
이 테스트를 구축하기 위해 연구진은 단순히 몇 명의 전문가에게 의견을 구하는 데 그치지 않았습니다. 대신, 그들은 6,174명의 고유한 한국인 참여자가 참여한 대규모 설문조사를 실시했습니다. 연구진은 이 실제 사람들에게 현재의 사회적 이슈에 관한 광범위한 질문을 던졌고, 무엇이 그 나라의 '정답'이 될 수 있는지를 확립하기 위해 다양한 응답을 수집했습니다. 테스트의 사회적 가치 부분에는 단 하나의 정답이 있는 것이 아니라, 인공지능이 일반 대중에게서 발견되는 의견의 분포와 일치하는 것이 목표입니다. 만약 대부분의 사람이 어떤 진술에 동의한다면, 모델도 동의해야 합니다. 상식 부분의 경우, 질문은 한국의 표준 교과서와 교육 자료에서 추출되었으며, 한국사, 사회, 과학 등의 과목을 다루었습니다. 이 질문들은 학교 시험과 유사하게 명확한 정답이 존재하며, 이는 모델이 교육받은 한국인이라면 누구나 알아야 할 기초적인 사실을 알고 있는지 테스트하기 위함입니다.
그 후 연구팀은 세계에서 가장 발전된 7개의 인공지능 모델을 테스트에 투입했습니다. 결과는 일반적으로 능력이 뛰어난 모델과 한국 문화에 진정으로 부합하는 모델 사이에 명확한 차이가 있음을 보여주었습니다. 일부 글로벌 최상위 모델들은 상당히 준수한 성능을 보였지만, 설문 데이터가 설정한 기준에는 미치지 못하는 경우가 많았습니다. 한국어 텍-스트를 대량으로 학습한 특정 모델은 가장 높은 정렬도를 보이며 눈에 띄었습니다. 이 모델은 한국의 사회적 가치와 상식 모두에서 훨씬 더 깊은 이해도를 보여주며 다른 모델들을 크게 압도했습니다. 이는 일반적인 지능이 강력하긴 하지만 그것만으로는 충분하지 않으며, 모델이 현지 인구와 진정으로 공명하기 위해서는 특정한 문화적 훈련이 필요하다는 것을 시사합니다.
또한 이 연구는 최고의 성능을 보이는 모델들조차 개선의 여지가 있음을 강조했습니다. 사회적 가치 섹션에서 연구진이 참고 점수(reference score)로 간주한 수준의 정렬에 도달한 모델은 불과 몇 개에 불과했습니다. 상식 섹션에서도 결과는 비슷했으며, 대부분의 모델이 한국의 성인에게 기대되는 기초 지식의 임계치에 도달하는 데 어려움을 겪었습니다. 연구진은 일부 모델이 사회적 가치에 관한 질문에 답변하기를 주저했는데, 이는 아마도 논쟁적인 주제에 대해 입장을 취하는 것을 피하도록 프로그래밍되었기 때문일 것이라고 언급했습니다. 이러한 주저함은 의도는 좋았으나, 결과적으로 모델이 자신들이 봉사해야 할 사람들의 실제 의견을 반영하는 데 실패하게 만들었습니다. 이러한 결과는 인공지능이 특정 국가에서 효과적으로 배치되기 위해서는 단순히 언어뿐만 아니라 그 사회의 가치와 공유된 지식을 이해하도록 세심하게 조정되어야 함을 시사합니다.
이 작업은 단순한 언어 번역을 넘어 문화적 이해를 테스트하기 위해 이러한 방식으로 국가적 정렬을 측정하는 벤치마크를 만든 첫 번째 사례입니다. 수천 개의 엄선된 질문을 포함하는 이 데이터셋은 데이터 품질을 보장하기 위해 전담된 정부 산하 기관의 검토와 승인을 받았습니다. 연구진은 이 테스트를 공개함으로써, 인공지능이 더 포용적이고 다양한 국가의 다양한 요구에 더 잘 부합하도록 개발되기를 희고 있습니다. 궁극적인 목표는 이러한 강력한 도구들이 일상생활의 일부가 될 때, 사람들이 자신의 문화적 현실에 기반하여 자연스럽고 존중하는 방식으로 도움을 받을 수 있도록 보장하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.