Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning
Palmyra x6는 소규모의 검증된 데이터셋을 활용한 앵커드 지도 미세 조정(Anchored Supervised Fine-Tuning)이라는 보수적이고 통제된 사후 학습 방식을 통해 도구 사용 벤치마크에서 최첨단 성능을 달성하는 기업 지향적 에이전트형 언어 모델입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 급격히 진화하는 지형 속에서, 대규모 언어 모델이 이미 보유한 기술을 해치지 않으면서도 어떻게 신뢰할 수 있는 조수로서 행동하도록 가르칠 것인가 하는 문제는 지속적인 과제였습니다. 전통적으로 특정 작업을 위한 고성능 모델을 만드는 것은 전체 시스템을 처음부터 다시 구축하는 것을 의미했으며, 이는 매번 다른 차량에 맞춰 새로운 엔진을 제작하는 과정과도 비슷했습니다. 최근 연구자들은 기존의 강력한 모델을 가져와서, 학습 데이터가 매우 뛰어난 품질이고 학습 방법이 정밀하다면, 그 모델의 행동을 특정 목적에 맞게 세심하게 정교화하는 것만으로도 충분하다는 사실을 발견했습니다. 이 접근 방식은 모델이 단순히 질문에 답하는 것을 넘어, 능동적으로 단계를 계획하고, 웹 검색이나 코드 실행과 같은 디지털 도구를 사용하며, 문제를 해결하기 위해 복-단계의 복잡한 워크플로를 탐색해야 하는 '에이전트적(agentic)' 작업에 초점을 맞춥니다. 목표는 단순히 텍스트를 생성하는 것이 아니라, 장기적인 계획과 다양한 소프트웨어 시스템과의 상호작용이 필요한 실제 디지털 환경에서 효과적으로 기능할 수 있는 AI를 만드는 것입니다.
Writer, Inc.의 연구팀은 이러한 에이전트적 작업에 특화되도록 설계된 모델인 Palmyra x6를 개발함으로써 이 과제를 해결했습니다. 거대한 새로운 모델을 밑바닥부터 학습시키는 대신, 그들은 수천억 개의 파라미터를 가진 정교한 기존 기반 모델인 GLM-5.2에서 시작했습니다. 이 기반 위에 그들은 '앵커드 지도 미세 조정(Anchored Supervised Fine-Tuning)'이라 불리는 매우 전문화된 학습 방법을 적용했습니다. 이 기술은 모델에게 새로운 기술, 즉 도구를 사용하는 방법과 복잡한 작업을 계획하는 법을 가르치는 동시에, 모델이 이미 가지고 있던 일반적인 지식과 추론 능력을 잊거나 저하시키는 것을 엄격히 방지하도록 설계되었습니다. 그 결과, 웹 검색, 코드 실행, 문서 검색 등을 포함한 복잡한 디지털 환경을 높은 숙련도로 탐색할 수 있으며, 기존 버전의 에이전트를 크게 능가하고 가장 앞선 모델들과 경쟁할 수 있는 수준의 시스템이 탄생했습니다.
이 성취의 핵심은 학습에 사용된 데이터의 품질과 성격에 있습니다. 연구진은 모델에 방대한 양의 인터넷 텍스트를 주입하는 대신, 단 626개의 사례로 구성된 작고 정교하게 선별된 데이터셋을 생성했습니다. 각 사례는 AI 에이전트에 의해 해결된 작업의 완전하고 검증된 궤적(trajectory)입니다. 이것들은 AI가 일련의 단계를 계획하고, 정보를 수집하거나 동작을 수행하기 위해 다양한 도구를 호출하며, 올 정답에 도달하는 과정을 담은 합성 이야기들입니다. 이 사례들이 완벽함을 보장하기 위해, 연구진은 '교사(teacher)' 모델이 성공적인 경로를 먼저 시연하면, '학생(student)' 모델이 교사의 계획을 높은 수준의 가이드로만 삼아 동일한 문제를 독립적으로 해결하도록 요구하는 엄격한 프로세스를 사용했습니다. 만약 학생 모델이 정답을 베끼거나 도구를 올바르게 사용하지 못하고 과정을 건너뛰려 한다면, 해당 시도는 폐기되었습니다. 오직 가장 성공적이고 정직한 시도들만이 남겨졌으며, 이는 모델에게 유능한 에이전트처럼 생각하고 행동하는 법을 가르치는 작지만 믿을 수 없을 정도로 고품질인 라이브러리를 만들어냈습니다.
이 작은 데이터셋으로부터 기존의 능력을 잃지 않고 학습하기 위해, 연구진은 안전 닻(safety anchor) 역할을 하는 방법을 채택했습니다. 학습 과정 동안 모델은 끊임없이 학습 전의 원래 상태를 상기하게 됩니다. 이 '앵커(anchor)'는 모델이 도구 사용법과 작업 계획법을 배우는 동안, 처음에 가졌던 일반 지능과 안전 행동에서 벗어나지 않도록 보장합니다. 이는 작은 데이터셋으로 학습할 경우 모델이 지나치게 특수화되거나 일반적인 대화 능력을 상실할 수 있기 때문에 매우 중요합니다. 모델을 원래 상태에 묶어둠으로써, 연구진은 기초를 침식시키지 않고도 새로운 에이전트적 기술을 주입할 수 있었습니다. 또한 그들은 내부 연결을 단순한 숫자가 아닌 기하학적 형상으로 취급하여 제한된 데이터를 더 효율적으로 활용할 수 있게 돕는 특수 수학적 최적화 도구(optimizer)를 활용했습니다.
이러한 접근 방식의 결과는 즉각적이고 상당했습니다. 도구 사용 능력, 장기 작업 계획, 복잡한 지시 이행 능력을 측정하기 위해 설계된 광범위한 벤치마크 테스트에서, Palmyra x6는 기존에 Writer의 에이전트가 사용하던 기본 모델보다 엄청난 향상을 보여주었습니다. 특히 웹을 검색하고 데이터를 분석해야 하는 금융 연구 분야와 일반적인 도구 사용 시나리오에서 강력한 성과를 보였습니다. 또한 이 모델은 다른 선도적인 프런티어 모델들과 경쟁력 있게 맞섰으며, 여러 테스트에 걸친 평균 점수에서 종종 그룹의 최상위에 올랐습니다. 무엇보다 중요한 점은, Palmyra x6가 높은 수준의 안전성과 중립성을 유지했다는 것입니다. 정치적 편향성과 거부 행동을 측정하기 위해 설계된 테스트에서, Palmyra x6는 논쟁적인 이슈에 대해 다각적인 관점을 제시하고 유해한 요청을 거부하는 방식이 기본 모델과 일치함을 보여줌으로써, 새로운 기술 습득이 안전성이나 신뢰성의 희생을 담보로 하지 않았음을 증명했습니다.
연구진은 이 모델이 모든 AI 작업에 대한 보편적인 대체재가 아니라 특화된 도구라는 점을 분명히 했습니다. 이 모델의 강점은 도구를 호출하고 계획을 실행할 수 있는 에이전트적 워크플로에 특화되어 있으며, 그 외의 작업에 대한 성능은 구축된 기반 모델의 역량에 따라 결정됩니다. 학습 데이터는 수량은 적었지만, 학습 방법 자체가 보수적이고 정밀하게 설계되었기에 도구 사용이라는 특정 행동을 가르치기에 충분했습니다. 이 모델은 현재 상업적 용도로 사용 가능하며, 표준 하드웨어에서도 효율적으로 구동할 수 있는 버전을 제공합니다. 이 연구는 적절한 조합의 고품질 데이터, 세심한 학습 목표, 그리고 안정적인 기반이 있다면, 대규모의 자원 집약적인 재학습 없이도 매우 유능한 AI 에이전트를 만들 수 있다는 것을 보여줍니다. Palmyra x6의 성공은 AI 비서가 수백만 개의 불완전한 사례가 아닌, 단 몇 백 개의 완벽한 사례를 바탕으로 정밀하고 안전하게 복잡한 현실 세계의 직무에 맞춰질 수 있는 미래를 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.