← 최신 논문
💬 NLP

When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use

본 논문은 다국어 LLM의 API 호출 시 발생하는 "인자 언어 불일치(Argument Language Mismatch)" 문제를 조사하며, 지도 미세 조정(supervised fine-tuning)이 인자 언어 일관성을 보장하기 위한 강력한 베이스라인 역할을 하는 반면, 강화 학습(reinforcement learning)은 주로 일반화 및 다목적 트레이드오프 측면에서 미미한 개선만을 제공한다는 점을 입증한다.

원저자: Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

게시일 2026-08-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 개인 비서가 되는 법을 가르치고 있다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)로 알려져 있으며, 다양한 언어로 대화하고, 이야기를 쓰고, 질문에 답하는 데 매우 뛰어납니다. 하지만 한 가지 문제가 있습니다. 진정으로 유용해지려면, 이 로봇은 단순히 말하는 것을 넘어 일을 완수하기 위해 다른 컴퓨터 프로그램들과 대화해야 합니다. 이 프로그램들을 계산기, 날씨 앱, 또는 항공권 예약 시스템과 같은 방대한 도구의 도서관이라고 생각해 보세요. 이 도구들을 사용하려면, 로봇은 매우 구별되고 엄격한 언어인 "API 호출"로 말해야 합니다. 이것은 마치 피자를 주문하는 것과 같습니다. 당신은 어떤 언어로든 "피자 먹고 싶어"라고 말할 수 있지만, 주방은 정확한 토핑과 크기가 적힌 특정한 티켓 형식만을 이해합니다.

이 논문이 다루는 큰 문제는 로봇이 주문 내용은 맞혔지만 티켓 작성을 망쳤을 때 발생하는 일입니다. 스페인어를 사용하는 사람이 로봇에게 항공권 예약을 요청했을 때, 로봇은 "항공권 예약" 도구는 제대로 골랐지만 목적지를 영어 단어인 "Paris" 대신 스페인어인 "París"로 채워 넣을 수 있습니다. 인간에게 이것은 아주 작고 무해한 실수처럼 보일 것입니다. 하지만 요청을 기다리고 있는 컴퓨터 프로그램에게 이것은 재앙입니다. 시스템이 충돌하거나 요청을 거부하는데, 왜냐하면 시스템은 스페인어 단어를 기다리고 있기 때문입니다. 연구진은 이 결함을 "인자 언어 불일치(Argument Language Mismatch, ALM)"라고 부릅니다. 이는 로봇이 당신이 무엇을 원하는지는 이해했지만, 사용하려는 도구의 '언어'를 말하는 데 실패하는 좌절스러운 버그입니다. 연구진은 특히 여러 언어를 동시에 다룰 때 로봇이 이 특정 실수를 저지르지 않도록 하는 가장 좋은 방법이 무엇인지 알아내고자 했습니다.

연구진은 두 가지 서로 다른 훈련 방법을 통해 어떤 것이 이 언어 결함을 가장 잘 고치는지 알아내는 탐정 놀이를 하기로 했습니다. 첫 번째 방법은 엄격한 선생님이 로봇에게 티켓을 작성하는 완벽한 예시를 수천 개 보여주는 것과 같습니다. 이를 "지도 미세 조정(Supervised Fine-Tuning, SFT)"이라고 합니다. 두 번째 방법은 비디오 게임과 더 비슷합니다. 로봇은 티켓을 작성하려고 시도하고, 자신이 얼마나 잘했는지에 따라 점수를 받으며, 시행착오를 통해 실수를 통해 배웁니다. 이를 "강화 학습(Reinforcement Learning, RL)"이라고 합니다. 연구진은 로봇이 얼마나 잘 학습하는지 확인하기 위해 도구 호출을 5개 국어(스페인어, 프랑스어, 이탈리아어, 네덜란드어, 영어)로 번역한 데이터셋을 사용하여 특별한 테스트 벤치를 구축했습니다.

여기서 그들이 발견한 놀라운 반전이 있습니다. 바로 "엄격한 선생님" 방법(SFT)이 사실 주인공이었다는 점입니다. 단순히 로봇에게 올바른 스페인어 대 스페인어 도구 호출 예시를 보여주었을 때, 로봇은 언어 불일치 오류의 대다수를 해결했습니다. 실제로 많은 작업에서 단순한 선생님 방법이 복잡한 비디오 게임 방법만큼 잘 작동하거나 때로는 더 나았습니다. 이 논문은 로봇이 해결책을 찾기 위해 스스로 "생각"할 필요가 없었다는 점을 시사합니다. 그저 "사용자가 스페인어를 사용하면, 도구 티켓도 스페인어여야 한다"라는 패턴을 배울 수 있을 만큼 충분한 예시를 보는 것만으로도 충분했습니다.

하지만 비디오 게임 방법(특히 GRPO라고 불리는 버전)은 몇 가지 특별한 기술을 숨기고 있었습니다. 이 방법이 기본적인 작업에서 선생님 방법을 항상 이기는 것은 아니었지만, 두 가지 측면에서 더 뛰어났습니다. 바로 로봇이 본 적 없는 새로운 도구를 다루는 능력과 일반적인 추론 능력을 날카롭게 유지하는 능력이었습니다. 연구진은 비디오 게임 방법이 마치 새로운 상황에 적응하면서도 수학 문제를 푸는 법을 잊지 않는 더 유연한 학생과 같다는 것을 발견했습니다. 또한 연구진은 로봇이 비디오 게임에서 받는 "점수"가 매우 중요하다는 것을 발견했습니다. 만약 점수가 단순히 "잘했음" 또는 "못했음"이라고만 한다면 로봇은 별로 배우지 못했습니다. 하지만 점수가 어떤 특정 단어가 틀렸는지에 대한 상세한 피드백을 준다면, 로봇은 훨씬 더 빨리 배웠습니다.

결론적으로, 이 논문은 이러한 언어 결함을 고치기 위해 항상 가장 복잡하고 비용이 많이 드는 훈련 방법이 필요한 것은 아니라고 결론짓습니다. 신중하고 잘 설계된 훈련 세트와 단순한 선생님만 있다면 대부분의 문제를 해결할 수 있습니다. 화려한 비디오 게임 훈련은 로봇의 기술을 다듬고 까다로운 상황에서 더 견고하게 만드는 데 유용하지만, 우리가 생각했던 것처럼 마법의 탄환은 아닙니다. 핵심적인 교훈은, 로봇이 도구에게 올바른 언어로 말하게 만드는 데 있어서 때로는 올바른 예시를 보여주는 고전적인 방식이 가장 강력한 도구가 될 수 있다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →