← 최신 논문
💬 NLP

Skill Issue: Are Skills Language-Invariant in LLMs?

이 논문은 다국어 셀프 플레이 프레임워크를 사용하여 동일한 모델이 오로지 사용된 언어 인터페이스에 따라서만 현저히 다른 성능 강점, 추론 능력, 그리고 전략적 행동을 보일 수 있음을 보여줌으로써, 거대 언어 모델이 서로 다른 언어에 걸쳐 상당하고 측정 가능한 기술 불일치를 나타낸다는 점을 입증한다.

원저자: Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 오늘날 우리가 사용하는 많은 인공지능 도구의 엔진이며, 수십 개의 언어로 이야기를 쓰고, 문제를 해결하며, 질문에 답할 수 있는 능력을 갖추고 있습니다. 수년 동안 연구자들은 이러한 시스템이 모든 언어에서 동일하게 우수한 성능을 보이는 것은 아니라는 사실을 알고 있었습니다. 어떤 모델은 영어로 역사 질문에 답하는 데는 탁월하지만, 아랍어나 중국어로 물었을 때는 동일한 사실을 찾는 데 어려움을 겪을 수 있습니다. 이러한 불일치는 대개 모델이 학습한 데이터 때문, 즉 어떤 언어는 기계에게 가르칠 수 있는 정보가 단순히 적게 존재한다는 가정에 기인한다고 여겨져 왔습니다. 그러나 새로운 연구 흐름은 더 깊은 질문을 던집니다. 문제는 단지 모델이 무엇을 아느냐의 문제인가, 아니면 모델이 실제로 무엇을 '할 수 있느냐'의 문제인가? 설령 과제 자체가 정확히 동일하더라도, 동일한 인공 지능 정신이 어떤 언어를 사용하느냐에 따라 서로 다른 기술 세트를 보유할 수 있는 것일까요?

연구팀은 언어를 연구 대상이 아니라 통제된 실험의 변수로 취급함으로써 이 질문에 답하고자 했습니다. 그들은 친숙한 개념인 '게임'을 활용했습니다. 동일한 인공지능 모델의 복사본 두 개를 디지털 경기장에 배치하여 서로 대결하게 함으로써 완벽한 기술 테스트를 만들어냈습니다. 이 설정에서 게임의 규칙, 보드, 카드, 그리고 가능한 움직임은 두 플레이어에게 고정되어 동일하게 유지되었습니다. 유일하게 변하는 것은 상황을 설명하는 데 사용되는 언어였습니다. 한 플레이어는 영어로 된 지침을 받고 게임 상태를 확인하는 반면, 상대방은 동일한 보드와 규칙이 독일어, 히브리어, 중국어 또는 여러 다른 언어로 번역된 것을 보았습니다. 모델들이 동일하고 게임 메커니즘이 고정되어 있었기 때문에, 승패의 차이는 지식이나 지능의 차이가 아니라 오직 언어 인터페이스로부터 기인해야 했습니다.

연구진은 TextArena라고 알려진 게임 플랫폼의 다국어 확장판인 거대한 테스트 환경을 구축하였으며, 이를 통해 여섯 가지 유형의 게임에 걸쳐 수천 번의 경기를 실행할 수 있었습니다. 이 게임들은 플레이어가 격자를 시각화해야 하는 틱택토와 같은 단순한 공간 추론 퍼즐부터 자원 배분과 블러핑(속임수)이 포함된 복잡한 전략 게임에 이르기까지 다양했습니다. 그들은 비슷한 크기의 세 가지 오픈 소스 모델을 테스트하며, 각 모델을 여덟 가지 다른 언어로 자기 자신과 맞붙게 했습니다. 결과는 놀라운 현실을 드러냈습니다. 동일한 모델이 한 언어에서는 숙련된 전략가가 될 수 있지만, 다른 언어에서는 서툰 초보자가 될 수 있다는 사실이었습니다. 어떤 경우에는 영어로 플레이하는 모델이 히브리어나 아랍어로 플레이하는 자신의 버전을 지속적으로 이겼는데, 이는 모델이 게임에 대해 더 많이 알았기 때문이 아니라, 언어 자체가 모델의 명확한 사고 능력을 해제하거나 차단했기 때문인 것으로 보였습니다.

이러한 실패의 본질은 구체적이고 시사하는 바가 컸습니다. 격자 위의 선을 연결하는 것과 같은 공간적 추론이 필요한 게임에서, 아랍어나 히브리어와 같은 비라틴 문자를 사용하는 언어로 플레이하는 모델들은 보드를 근본적으로 오해한 듯한 오류를 자주 범했습니다. 그들은 종-적으로 또는 세로로 달리는 승리선을 보지 못하고, 마치 행(row)만이 유일하게 중요한 것처럼 격자를 취급하곤 했습니다. 포커의 단순화된 형태와 같은 확률 및 전략 게임에서, 모델들은 언어에 따라 성격 전체를 바꾸기도 했습니다. 모델은 한 언어에서는 신중하고 정직하게 플레이할 수 있지만, 다른 언어에서는 손에 든 카드가 동일함에도 불구하고 공격적이고 위험한 블러핑을 일삼는 경향을 보였습니다. 연구진은 이것이 무작위적인 실수가 아니라, 문제를 구성하는 단어들에 전적으로 의존하는 체계적인 행동 변화라는 것을 발견했습니다.

가장 놀라운 발견 중 하나는 문제가 모델이 읽고 있는 언어뿐만 아니라, 모델이 '생각하는 데 사용하는' 언어와도 관련이 있다는 점이었습니다. 일부 실험에서 연구진은 독일어와 같이 상대적으로 약한 언어로 게임 지침을 유지하되, 모델에게 영어로 내부 추론을 수행하도록 지시했습니다. 이 간단한 전환만으로도 모델은 상실했던 성능의 상당 부분을 회복할 수 있었으며, 이는 언어 장벽이 단순한 번역 문제가 아니라 인지적 문제임을 시사했습니다. 모델은 약한 언어로 플레이하면서도 강한 언어로 "생각"할 수 있다면 자신의 온전한 전략적 잠재력에 접근할 수 있었습니다. 이는 언어 인터페이스가 현재의 게임 상태를 이해하는 것부터 최선의 수를 선택하는 것에 이르기까지, 의사 결정의 모든 단계에 영향을 미친다는 것을 나타냅니다.

또한 연구는 이러한 차이가 인터넷상에 각 언어에 대한 텍스트가 얼마나 존재하는지에 의해 설명될 수 있는지 조사했습니다. 각 언어에 사용 가능한 데이터가 많을수록 모델이 더 잘 수행하는 것은 사실이지만, 이 요인이 전체 이야기를 다 설명하지는 못했습니다. 웹상에 데이터가 비교적 적은 언어도 모델이 매우 잘 플레이하게 만드는 경우가 있었던 반면, 데이터가 풍부한 언어임에도 불구하고 낮은 성능을 보이는 경우도 있었습니다. 이는 문제가 단순히 훈련 자료의 양에 관한 것이 아니라, 모델이 서로 다른 언어 체계 간에 어떻게 기술을 연결하는지를 학습했느냐에 관한 것임을 시사합니다. 이러한 발견은 인공지능이 진정으로 신뢰할 수 있고 공정하기 위해서는, 개발자들이 모델의 능력이 모든 언어에서 일관될 것이라고 단순히 가정해서는 안 된다는 점을 시사합니다. 모델이 사용하는 언어는 단순히 지식을 보여주는 창이 아닙니다. 그것은 모델의 기술을 왜곡하여 세상이 보이는 방식과 게임을 플레이하는 방식을 바꾸는 렌즈입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →