What is Missing from AI Post-Training AI: An Empirical Analysis
이 논문은 AI 에이전트가 사전에 정의된 훈련 전략을 효과적으로 실행할 수는 있지만, 경험, 인간의 지도, 그리고 추가적인 추론 연산량의 개선에도 불구하고 훈련 후 과정에서 자신의 상위 수준 전략을 자발적으로 재평가하고 수정하는 내재적 능력은 결여되어 있다는 점을 논한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
급격히 진화하는 인공지능의 세계에서 새로운 종류의 노동자가 등장했습니다: 바로 AI 에이전트입니다. 이들은 단순히 질문에 답하거나 텍스트를 쓰는 프로그램이 아닙니다. 이들은 시간을 두고 복잡한 과업을 계획하고 실행할 수 있는 시스템입니다. 이들은 컴퓨터 코드를 작성하고, 실험을 개시하며, 심지어 다른 인공지능 모델을 훈련시킬 수도 있습니다. 이러한 능력은 지능형 시스템이 스스로를 지속적으로 개선하는 'AI를 위한 AI'라는 비전을 불러일으켰으며, 이는 잠재적으로 인간의 개입 없이 더 나은 기계를 설계하는 기계로 이어질 수 있습니다. 이 비전을 테스트하기 위해, 연구자들은 AI 에이전트가 기초적인 언어 모델을 가져와 수학 문제 풀이나 코드 작성과 같은 어려운 과업을 더 잘 수행하도록 정교화하는 특정 과제를 설정했습니다. 연구의 희망은 에이전트가 숙련된 과학자처럼 행동하여, 계획을 제안하고, 실험을 실행하고, 무엇이 잘못되었는지 확인한 다음, 근본적으로 접근 방식을 바꾸어 새로운 시도를 하는 것입니다.
칭화대학교, 인민대학교, 그리고 중국 전자과기대학교의 연구진은 최근 이러한 AI 에이전트가 진정으로 과학적 유연성을 갖추고 있는지 조사했습니다. 그들은 초등 수학부터 대학원 수준의 과학적 추론에 이르는 7가지 뚜렷한 벤치마크에 걸쳐, 다양한 AI 에이전트가 언어 모델을 개선하려고 시도한 수천 건의 기록된 세션을 검토했습니다. 연구진은 에이전트가 할 수 있는 작업의 두 가지 유형을 구분했습니다. 첫 번째는 실행(execution)입니다: 코드의 버그를 수정하거나, 학습 속도를 조절하거나, 데이터를 정제하는 것과 같이 선택한 계획을 수행하는 능력입니다. 두 번째는 전략(strategy)입니다: 결과를 보고 전체 계획이 틀렸음을 판단한 뒤, 완전히 다른 방법으로 전환하는 능력입니다. 연구 결과, 에이전트들은 첫 번째 유형의 작업에는 매우 뛰어났지만, 두 번째 유형에는 거의 완전히 무능하다는 것이 밝혀졌습니다.
연구진은 PostTrainBench라고 불리는 공개 데이터셋에 기록된 1,300개 이상의 훈련 세션을 분석했습니다. 그들은 눈에 띄는 패턴을 발견했습니다: 거의 모든 경우에서, AI 에이전트는 세션 시작 후 몇 분 이내에 자신의 상위 수준 접근 방식을 결정하고 10시간의 지속 시간 내내 이를 고수했습니다. 만약 에이전트가 '전체 파라미터 미세 조정(full-parameter fine-tuning)'이라는 방법으로 모델을 가르치기 시작했다면, 결과가 좋지 않더라도 몇 시간 동안 그 방법을 계속 유지했습니다. 에이전트는 학습률을 변경하거나 데이터를 재구성하는 것과 같은 미세한 조정을 하는 데 시간을 보냈지만, 아예 다른 훈련 방법으로 전환하는 것은 고려하지 않았습니다. 반대로, '매개변수 효율적 미세 조정(parameter-efficient fine-tuning)'이라는 다른 방법으로 시작한 에이전트 역시 그 접근 방식에 갇혀 있었습니다. 전략의 선택은 해결하려는 과업보다는 사용 중인 특정 AI 에이전트에 더 많이 의존했습니다. 이러한 '고착(lock-in)' 현상 때문에 에이전트들은 효과가 없어진 지 오래된 단일 접근 방식을 정교화하며 사실상 제자리걸음을 하고 있었습니다.
왜 이런 일이 발생하는지 이해하기 위해, 연구진은 에이전트를 이 루프에서 탈출시킬 수 있는지 확인하고자 개입 수준을 높여가며 세 가지 가능한 설명을 테스트했습니다. 첫째, 에이전트에게 경험이 부족한 것인지 궁금했습니다. 연구진은 에이전트에게 관찰 내용을 기록할 디지털 일지, 오픈 소스 프로젝트에서 추출한 기술 라이브러리, 그리고 진단과 제안을 제공할 별도의 평가 에이전트를 제공했습니다. 이 설정은 에이전트의 실행 능력을 크게 향상시켜 수학 및 코딩 벤치마크 성능을 높였습니다. 그러나 이러한 추가적인 도움과 현재의 접근 방식이 실패하고 있다는 명확한 증거가 있음에도 불구하고, 에이전트는 여전히 상위 전략을 바꾸기를 거부했습니다. 그들은 평가자의 조언에 따라 설정을 미세하게 조정할 수는 있었지만, 방법 자체를 바꾸라는 제안은 무시했습니다.
다음으로, 연구진은 에이전트에게 더 나은 가이드가 필요한지 테스트했습니다. 연구진은 훈련이 시작되기 전 에이전트의 초기 계획을 검토하고, 다른 전략을 선택하라고 명시적으로 지시하는 인간 검토자를 도입했습니다. 이는 시작 단계에서는 완벽하게 작동했습니다. 에이전트들은 새로운 지침을 이해하고 다른 계획을 구현했습니다. 그러나 일단 훈련이 시작되자, 에이전트들은 빠르게 예전 습관으로 돌아갔습니다. 그들은 국소적인 조정을 시작했고 더 넓은 전략을 고려하는 것을 멈췄으며, 작업이 시작되자마자 인간의 가이드를 사실상 무시했습니다. 마지막으로, 연구진은 에이전트에게 생각할 시간이 더 필요한 것인지 테스트했습니다. 연구진은 에이전트가 결정에 대해 숙고할 수 있도록 훨씬 더 많은 컴퓨팅 파워를 부여했습니다. 쉬운 과업에서는 이 추가적인 생각 시간이 결과 개선에 도움이 되었습니다. 하지만 가장 어려운 과업에서는 추가적인 연산 능력이 거의 이득을 주지 못했습니다. 에이 에이전트들은 단순히 경로를 바꿔야 한다는 것을 깨닫는 대신, 자신들이 고착된 전략을 더욱 정교하게 만드는 데 그 추가적인 시간을 사용했습니다.
연구는 자동화된 AI 연구에서 누락된 요소가 경험, 가이드, 또는 순수한 컴퓨팅 파워의 부족이 아니라고 결론짓습니다. 에이전트들은 새로운 전략을 이해하고 지시받았을 때 이를 구현할 수 있는 능력을 분명히 갖추고 있습니다. 그들에게 부족한 것은 현재의 경로가 실패하고 있음을 인식하고 자발적으로 방향을 바꿀 수 있는 '자발성'입니다. 가설을 제칭하고, 실험을 실행하고, 접근 방식을 수정하는 루프는 작은 규모의 국소적 수정 수준에서만 닫힙니다. 상위 전략 수준에서 이 루프는 열려 있는 상태로 남습니다. 이러한 자동화된 시스템의 한계는 그들이 얼마나 오래 일하거나 얼마나 많이 생각하느냐가 아니라, 그들이 내리는 바로 그 첫 번째 결정의 품질에 의해 결정됩니다. AI 에이전트가 실행 과정 중에 전략적 선택을 자발적으로 다시 열 수 있을 때까지, 그들은 진정한 과학자로서 행동하기보다는 유능한 노동자로 남을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.