← 최신 논문
🤖 machine learning

Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs

이 논문은 일본어 화용론적 현상을 위한 최소 쌍(minimal-pair) 벤치마크인 J-PragEval-v0을 소개하며, 1.5B 규모의 이중 언어 모델에 선형 프로빙(linear probing)과 활성화 스티어링(activation steering)을 적용하여 경어법은 잔차 스트림(residual streams)에서 선형적으로 디코딩 가능한 반면, 생략된 주어나 내집단 지칭과 같은 다른 화용론적 대조는 프롬프트에 저장되기보다 생성 과정 중에 해결된다는 것을 입증한다.

원저자: Florian Braun

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Florian Braun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어는 단순히 단어와 문법 규칙의 집합 그 이상입니다. 그것은 사회적 신호, 무언의 합의, 그리고 문화적 맥락이 어우러진 살아있는 체계입니다. 일본어를 사용하는 사람은 끊임없이 복잡한 관계의 지도를 탐색하며, 누가 자신의 신뢰 범주 안에 있고 누가 밖에 있는지를 결정하고, 대화 상대에게 느끼는 감정을 정확하게 반영하는 단어를 선택합니다. 이것이 바로 화용론(pragmatics), 즉 맥락이 의미를 어떻게 형성하는지를 연구하는 영역입니다. 수십 년 동안 인공지능은 단어를 번역하고 질문에 답하는 데 탁월한 능력을 보여왔지만, 이러한 미묘한 사회적 층위를 이해해야 할 때는 종종 비틀거립니다. 컴퓨터는 정중한 표현의 사전적 정의는 알 수 있지만, 그것을 언제 사용해야 하는지는 모르는 경우가 많으며, 더 나아가 인간 청자에게 무례하거나 이상하게 들리는 방식으로 사용하는 경우도 있습니다. 이러한 격차는 화자와 청자의 관계가 문장의 구조 자체를 결정하는 언어인 일본어에서 특히 두드러집니다. 연구자들이 일상적인 기기에서 구동되도록 설계된 더 작고 효율적인 컴퓨터 모델을 구축함에 따라, 한 가지 중요한 질문이 제기되었습니다. 이 소형 모델들이 실제로 자신이 구사하는 언어의 문화적 규칙을 이해하고 있는 것일까요, 아니면 단지 표면적인 패턴을 흉내 내고 있는 것일까요?

최근 독립 연구자 플로리안 브라운(Florian-Braun)의 연구는 영어와 일본어를 모두 구사하는 소형 이중 언어 컴퓨터 모델 내부를 들여다봄으로써 이 질문을 다룹니다. 이 연구는 유용한 작업을 수행할 만큼 강력하면서도 거대하고 에너지를 많이 소비하는 서버 없이도 구동될 수 있을 만큼 가벼운 '소형 언어 모델(small language model)'이라 불리는 특정 유형의 인공지능에 초점을 맞춥니다. 이러한 모델들은 일본에서 점점 흔해지고 있지만, 주로 텍스트 번역 능력이나 독해 질문 답변 능력만을 테스트하는 경우가 많습니다. 그러나 이러한 표준 테스트들은 인간 의사소통의 가장 어려운 부분, 즉 '분위기를 읽는 능력'을 놓치고 있습니다. 이를 해결하기 위해 연구자는 'J-PragEval'이라는 새로운 테스트 환경을 만들었습니다. 이 테스트는 모델에게 문장을 번역하라고 요구하는 대신, 화자가 상사에게 말하는지 혹은 친구에게 말하는지와 같은 단 하나의 사회적 세부 사항만 다른 두 개의 거의 동일한 시나리오를 제시합니다. 그러면 모델은 그 사회적 세부 사항에 근거하여 문장을 완성하는 올바른 방법을 선택해야 합니다. 이 테스트는 일본 사회 생활의 네 가지 특정 영역을 다룹니다: 존경을 나타내기 위한 경어 사용, 문장에서 주어가 생략되었을 때 언급되고 있는 대상이 누구인지 추측하는 능력, 내집단(insider)과 외집단(outsider)을 구분하는 동사 선택, 그리고 직접적인 "아니요"라고 말하지 않고 정중하게 요청을 거절하는 기술입니다.

연구자는 모델이 이러한 테스트를 통과하는 데 필요한 지식을 어디에 저장하는지 확인하기 위해, 28개의 처리 계층을 가진 컴퓨터 모델 내부를 들여다보았습니다. 모델의 내부 사고를 관찰하는 현미경과 같은 방식을 사용하여, 연구는 모델의 처리 단계별 활동을 조사했습니다. 결과는 모델이 이러한 사회적 규칙을 처리하는 방식에서 놀라운 분리를 보여주었습니다. 경어 사용의 경우, 모델은 잘 정리된 도서관처럼 행동합니다. 어떤 수준의 공손함을 사용할지에 대한 정보는 모델의 특정 계층에 명확하게 저장되어 있으며, 간단한 확인을 통해 거의 96%의 정확도로 이를 찾아낼 수 있습니다. 모델은 규칙을 알고 있으며, 그 규칙을 사용할 준비를 갖추고 있습니다. 그러나 다른 사회적 규칙의 경우 양상이 달라집니다. 모델이 주어가 생략된 문장에서 누구에 대해 이야기하고 있는지 결정하거나, 내집단과 외집단을 구분하는 적절한 동사를 선택해야 할 때, 연구자들은 모델이 프롬프트를 다 읽은 시점에 이러한 규칙에 대한 명확하고 정적인 기억을 가지고 있는지 찾아낼 수 없었습니다. 내부 신호가 너무 희미하여 표준적인 확인 방법으로는 감지되지 않았습니다. 그럼에도 불구하고, 모델이 실제로 답변을 생성할 때에는 77~79%의 확률로 올바른 선택을 했습니다. 이는 모델이 이러한 과업을 위해 단순히 저장된 규칙을 검색하는 것이 아니라, 문장을 단어 단위로 구축하면서 실시간으로 사회적 맥락을 계산해낸다는 것을 시사합니다.

또한 이 연구는 모델을 테스트하는 방식에 숨겨진 함정을 밝혀냈습니다. 네 가지 테스트 중 간접적 거절에 초점을 맞춘 테스트는 처음에 모델이 해당 기술을 마스터한 것처럼 보였으며, 95%의 탐지 점수를 기록했습니다. 그러나 연구자가 모델의 실제 행동을 자세히 조사한 결과, 모델은 이 테스트에서 대부분의 경우 실패하고 있었습니다. 높은 점수는 테스트 설계 자체의 결함으로 인한 가짜 경보였습니다. 정답이 더 긴 문장이었기 때문에, 모델은 사회적 뉘앙스를 이해한 것이 아니라 단순히 문장 길이에 기반하여 추측했던 것입니다. 길이를 고려하여 테스트를 조정한 후에야 간접적 거절을 처리하는 모델의 실제 무능력이 드러났습니다. 이 발견은 테스트가 진정한 이해와 표면적인 속임수를 분리하도록 정교하게 설계되지 않는다면, 컴퓨터 테스트의 높은 점수가 때로는 깊은 오해를 숨길 수 있다는 경고를 줍니다.

이러한 발견을 해결하기 위해, 연구자는 모델을 처음부터 다시 학습시킬 필요 없이 모델을 가이드하는 새로운 방법을 제안했습니다. '프래그매틱 표현 스티어링(Pragmatic Representation Steering)'이라 불리는 이 아이디어는 모델이 텍스트를 생성하는 순간 내부 활동을 올바른 방향으로 부드럽게 유도하는 것을 포함합니다. 이것은 모델의 뇌를 완전히 개조하는 것이 아니라, 모델의 내부 나침반을 미세하게 조정하는 것으로 생각하면 됩니다. 연구는 적어도 명확하게 저장된 규칙들에 대해서는, 이러한 유도를 위한 수학적 방향이 모델의 구조 내에 존재한다는 것을 보여주었습니다. 이는 거대한 재학습 비용 없이도 소형 언어 모델을 더욱 문화적으로 인지하고 사회적으로 적절하게 만들 수 있음을 시사합니다. 이 스티어링 방식에 대한 더 큰 규모의 모델 테스트는 향후 과제로 계획되어 있지만, 현재의 연구는 문화적 이해를 위한 내부 메커니즘이, 비록 서로 다른 방식으로 숨겨져 있을지라도 존재한다는 것을 입증합니다. 연구는 소형 언어 모델이 진정으로 일본 사용자들에게 도움이 되기 위해서는, 단순한 번역 점수를 넘어 이 모델들이 인간 관계의 보이지 않는 무언의 규칙들을 어떻게 처리하는지를 이해해야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →