Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
이 논문은 다섯 가지 결정적인 혼란 변수를 교정함으로써 도구 사용 에이전트의 교차 언어적 정책 유지력을 측정하기 위한 엄격한 프레임워크를 소개하며, 이를 통해 최첨단 모델들이 비영어권 과업을 영어로 라우팅함으로써 언어 간에 71~73%의 행동 정책을 구조적으로 유지한다는 점과, 더 작은 규모의 모델들은 붕괴 현상을 보이며 관찰된 실패들이 모델의 한계가 아닌 추적 추출 정규 표현식에 의해 인위적으로 제조될 수 있음을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 비서의 보이지 않는 여정
당신에게 컴퓨터 안에 살고 있는 개인용 로봇 같은 아주 똑똑한 디지털 비서가 있다고 상상해 보세요. 이 비서의 임וב은 일련의 단계를 거쳐 문제를 해결하는 것입니다. 최종 답변을 내놓기 전에 정보를 찾아보거나, 수학 계산을 하거나, 문장을 번лоtranslate할 수도 있습니다. 이것이 현대의 "AI 에이전트"가 작동하는 방식입니다. 그들은 단순히 답을 추측하는 것이 아니라, 그곳에 도달하기 위한 경로를 구축합니다.
오랫동안 과학자들은 이 비서들에게 영어와 힌디어처럼 서로 다른 언어로 같은 질문을 던지며 테스트해 왔습니다. 만약 비서가 두 언어 모두에서 정답을 맞혔다면, 모두가 만족했습니다. 그것은 마치 학생이 수학 문제를 어떻게 풀었는지는 보지 않고, 오직 수학 시험에서 정답을 맞혔는지로만 성적을 매기는 것과 같았습니다. 하지만 만약 학생이 영어 문제는 그림을 그려서 풀었는데, 힌디어 문제는 긴 에세이를 써서 풀었다면 어떨까요? 결과적으로 같은 점수를 받았지만, 그들은 완전히 다른 방법을 사용한 것입니다.
이 논문은 중대한 질문을 던집니다. AI 에이전트가 언어를 바꿀 때, 그들의 "경로"나 정답에 도달하기 위해 밟는 단계들이 변하는가? 알고 보니, 그 단계들은 매우 중요합니다. 경로는 컴퓨터가 사용하는 비용, 작업 속도, 그리고 실수가 발생했을 때 어떤 일이 벌어질지를 결정합니다. 만약 AI가 힌디어로 질문받았을 때 영어로 질문받았을 때와 다른 경로를 택한다면, 비용이 더 많이 들거나 안전 규칙이 잡아내지 못하는 방식으로 실패할 수 있습니다. 그래서 연구진은 단순히 최종 결과만을 보는 것을 멈추고, 여정 자체를 관찰하기로 했습니다.
거대한 언어 우회로
연구진은 이 AI 에이전트들이 진정으로 이중 언어를 구사하는 것인지, 아니면 그저 흉내를 내고 있는 것인지 알아보기 위해 나섰습니다. 그들은 8개의 서로 다른 AI 모델을 가져와 41개의 다양한 언어로 동일한 과업을 부여했습니다. 단순히 최종 결과만을 확인하는 대신, 그들은 자동차의 여정을 추적하는 GPS처럼 AI가 밟은 모든 단계, 즉 "트레이스(trace)"를 기록했습니다. 그들은 알고 싶었습니다. 만약 내가 영어로 "날씨를 찾고 나서 비용을 계산하라"고 요청하고, 그다음 똑같은 내용을 힌디어로 요청한다면, AI가 정확히 같은 단계들을 밟을 것인가?
결과는 예상과는 달랐지만, 명확한 "아니오"였습니다. AI는 단순히 약간 다른 길을 간 것이 아니라, 거대한 우회로를 택하고 있었습니다. 연구진은 언어가 바뀌면 AI의 행동도 크게 변한다는 사실을 발견했습니다. 실제로 가장 발전된 모델들을 살펴보았을 때, 언어를 전환할 때 원래의 단계별 계획을 약 71%에서 73% 정도만 유지했습니다. 이는 대략 **27%에서 29%**의 경우 동안, AI가 단지 언어가 다르다는 이유만으로 완전히 다른 행동을 하고 있었음을 의미합니다.
"영어 피벗(English Pivot)"의 비밀
왜 이런 일이 발생하는 걸까요? 연구팀은 AI 에이전트들이 가진 숨겨진 습관을 발견했습니다. AI에게 힌디어, 타밀어 또는 다른 언어로 질문하더라도, AI는 종종 자신의 "마음속"에서 전체 내용을 영어로 비밀리에 번역한다는 사실이 밝혀졌습니다. 그런 다음 영어로 문제를 풀고 답변을 다시 번역하여 내놓는 것입니다.
연구진은 이를 "영어 피벗(English pivot)"이라고 불렀습니다. 이를 증명하기 위해, 그들은 AI가 이 행동을 멈추도록 강제해 보았습니다. 그들은 AI에게 "사용 중인 언어로 생각하세요. 영어로 번역하지 마세요!"라고 명령했습니다. 하지만 AI는 이 명령을 따르지 않았습니다. 테스트된 두 모델에서, AI가 과업의 언어로 생각하라는 지시를 따른 비율은 1% 미만이었습니다. AI가 명령한 대로 거의 수행하지 못했기 때문에, 연구진은 다른 언어로 생각하는 것이 단계에 변화를 주는지 테스트할 수 없었습니다. 그러나 이 결과는 더 강력한 사실을 입증했습니다. "영어 피벗"은 단순한 프롬프트로 끌 수 있는 선호도가 아니라, 모델이 직접적인 명령에도 불구하고 사실상 무시해 버리는 깊게 뿌리 박힌 행동이라는 점입니다. 그것은 마치 가이드가 무엇을 말하든 상관없이, 어떤 나라를 여행하더라도 반드시 통역사를 통해서만 대화하겠다고 고집하는 여행자와 같았습니다. 이 습관은 너무나 강력해서, 언어가 바뀔 때 AI의 단계가 변하게 만든 주요 원인이 되었습니다.
지름길의 함정
이 논문은 거의 모두를 속일 뻔한 재미있는 실수도 밝혀냈습니다. AI 에이전트의 성능을 측정할 때, 일부 연구자들은 AI의 단계를 읽기 위해 단순한 컴퓨터 프로그램을 사용하고 있었습니다. 그 프로그램 중 하나는 너무 엄격해서, 만약 AI가 특정 코드 형식이 아닌 "계산기를 사용하겠습니다"와 같은 문장을 쓰면, 프로그램은 AI가 실패했다고 판단했습니다.
이 때문에, 매우 유능한 AI 모델이 **76%**의 확률로 실패하는 것처럼 보였습니다. 하지만 연구진이 컴퓨터 프로그램을 조금 더 유연하게 수정하자, AI의 "성공률"은 26배나 높아졌습니다! 이는 때때로 언어의 문제처럼 보이는 것이 실제로는 우리가 AI의 글씨를 읽는 방식의 문제일 수 있다는 것을 연구진에게 가르쳐 주었습니다.
크기가 중요하다는 규칙
마지막으로, 연구팀은 더 큰 AI 모델이 이 부분에서 더 나은지 살펴보았습니다. 그들은 이상한 규칙을 발견했습니다. 가장 크고 강력한 모델들은 모두 매우 유사했으며, 그 **71~73%**의 일관성을 유지했습니다. 하지만 작은 모델들은 엉망이었습니다. 어떤 작은 모델들은 훌륭해 보였지만, 알고 보니 그들은 단순히 운 좋게 짧고 단순한 경로를 택했기 때문에 우연히 일치율이 높았던 것뿐이었습니다. 연구진이 이 운의 요소를 보정하자, 작은 모델들은 더 이상 인상적이지 않았습니다. 매우 크고 강력한 모델들만이 일관된 행동 방식을 확립한 반면, 작은 모델들은 여전히 그 과정을 헤쳐 나가는 중인 것으로 보입니다.
이것이 중요한 이유
이 연구는 우리가 AI를 테스트하는 방식을 바꿉니다. 정답을 얻는 것만으로는 충분하지 않다는 것을 보여줍니다. 만약 AI가 당신이 다른 언어로 말했다는 이유만으로 더 비싸거나 위험한 경로를 택한다면, 그것은 문제입니다. 연구진은 이 에이전트들이 진정으로 유창한 것이 아니라, 여전히 숨겨진 영어라는 지팡이에 의존하고 있음을 보여주었습니다. 이를 해결하기 전까지, AI는 영어로는 신뢰할 수 있을지 몰라도 다른 언어에서는 신뢰할 수 없을 수 있습니다. 그것은 AI가 "멍청해서"가 아니라, 동일한 목적지에 도달하기 위해 모니터링되지 않는 다른 길을 가고 있기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.