Praxist: From Experimental Artifacts to Solution Lineages
Praxist는 자율적 R&D를 고립된 실험에서 추적 가능한 증거 그래프로 변환하여, 에이전트가 검증된 메커니즘을 상속받고 복잡한 엔지니어링 작업에서 기존 베이스라인 대비 약 12분의 1 수준의 비용으로 탁월한 성능을 달성할 수 있게 하는 계보 중심의 세대별 시스템입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
과학과 공학은 오랫동안 인간의 단순한 리듬에 의존해 왔습니다. 무언가를 시도하고, 그것이 작동하는지 확인하고, 실수로부터 배우고, 다시 시도하는 것입니다. 수십 년 동안 이 순환은 발견의 엔진 역할을 해왔으며, 연구자가 프로토타입을 만들고, 테스트하고, 그 결과를 사용하여 다음 버전을 개선하는 과정이었습니다. 하지만 컴퓨터가 스스로 코드를 작성하고 스스로 실험을 수행할 수 있을 만큼 강력해지면서, 새로운 질문이 등장했습니다. 기계가 인간과 같은 방식으로 자신의 실패로부터 배울 수 있을까? 문제는 단순히 기계가 결과를 얻느냐가 아니라, 기계가 왜 그 결과를 얻었는지 이해하느냐입니다. 컴퓨터가 설계의 수천 가지 변형을 시도할 때, 대개 무엇이 일어났는지는 알려주지만 어떤 구체적인 변화가 차이를 만들었는지는 알려주지 않는 방대한 양의 데이터를 생성합니다. 그러한 명확성이 없다면, 기계는 아무런 결실 없이 길을 잃는 경로에 시간과 에너지를 낭비하며 똑같은 교훈을 반복해서 배워야만 합니다.
이것이 바로 Sapient Intelligence의 연구팀이 해결하고자 했던 문제입니다. 그들은 단순히 해결책을 찾는 것이 아니라, 그 해결책들이 어떻게 발견되었는지에 대한 명확하고 감사 가능한 이력을 구축하도록 설계된 PRAXIST라는 시스템을 만들었습니다. PRAXIST는 모든 시도를 새로운 시작으로 취급하는 대신, 연구를 하나의 연속적인 대화로 취급합니다. 이 시스템은 한 실험의 결과를 가져와 이를 구체적인 교훈(무엇이 작동했고, 무엇이 실패했으며, 무엇이 그저 운 좋은 추측이었는지)으로 분해하여 영구적인 기록으로 저장합니다. 시스템이 다음 단계의 실험을 시작할 때, 과거의 최고 점수만을 보는 것이 아니라 그 점수를 얻게 만든 구체적인 메커니즘을 살펴봅니다. 그리고 "이 설계의 특정 부분이 실제로 개선을 일으킨 것인가, 아니면 다른 요소 때문인가?"라고 묻습니다. 이 질문에 답함으로써, 시스템은 자신의 역사의 유용한 부분만을 전달할 수 있으며, 이전보다 훨씬 적은 노력으로 더 강력하고 신뢰할 수 있는 솔루션을 구축할 수 있습니다.
연구진은 이 접근 방식을 의료 영상에서 질병을 식정하는 것부터 주식 시장의 추세를 예측하는 것에 이르기까지 75가지의 다양한 머신러닝 엔지니어링 과제에 적용하여 테스트했습니다. 그들은 이 시스템을 가장 진보된 언어 모델 중 하나에서 실행되는 강력한 표준 AI 코딩 어시스턴트와 비교했습니다. 결과는 놀라웠습니다. 표준 어시스턴트는 약 73%의 과제에서 메달을 획득했지만, 이를 위해 거의 38,000달러의 컴퓨팅 비용을 지출했습니다. 반면, 다른 기반 모델과 훨씬 더 스마트한 작업 조직 방식을 사용한 PRAXIST 시스템은 약 3,000달러만을 지출하면서 80%의 과제에서 메달을 획득했습니다. 즉, 이 새로운 시스템은 비용의 약 12분의 1만 들여 더 나은 솔루션을 찾아낸 것입니다.
하지만 진정한 혁신은 절감된 비용이 아니라 그 방법에 있습니다. 연구진은 대부분의 자동화된 시스템이 자신의 이력을 단순한 점수 목록처럼 취급하여, 가장 높은 숫자만을 남기고 나머지는 버린다는 점을 관찰했습니다. 그러나 PRAXXIST는 역사를 가계도처럼 취급합니다. 시스템이 새로운 소프트웨어나 새로운 제어 메커니즘을 구축할 때마다, 성공이나 실패를 이끌어낸 구체적인 설계 선택 사항을 기록합니다. 만약 특정 로켓 착륙 알고리즘의 변화로 인해 기체가 추락했다면, 그 실패는 막다른 길이 아니라 미래의 시도가 무엇을 피해야 하는지 알려주는 가치 있는 교훈으로 기록됩니다. 만약 특정 트레이딩 전략의 미세한 조정이 수익을 개선했다면, 그 성공은 그것이 왜 작동했는지에 대한 정확한 이유와 함께 태그되어, 시스템이 다른 맥락에서도 동일한 조정을 사용할 수 있도록 합니다. 이 과정은 시스템이 "유형화된 증거(typed evidence)"를 상속받게 하여, 솔루션의 어떤 부분이 검증되었고 어떤 부분이 여전히 추측에 불과한지를 정확히 알게 해줍니다.
이것이 실제 세계에서 어떻게 작동하는지 확인하기 위해, 팀은 단 하나의 정답도 없는 네 가지 복잡하고 개방적인 엔지니어링 문제에 PRAXIST를 적용했습니다. 한 사례에서는 재사용 가능한 로켓을 수직으로 착륙시키기 위한 컨트롤러를 설계하도록 요청했습니다. 시작점은 성공률이 4%에 불당하는 컨트롤러였습니다. 표준 자동 최적화 도구는 수백 가지의 변형을 시도하여 성공률을 17%까지 높였지만, 로켓을 매번 안전하게 착륙시키지는 못했습니다. 그러나 PRAXIST는 다른 길을 택했습니다. 단순히 무작위적인 변화를 시도하는 대신, 개선의 계보를 구축했습니다. 먼저 연료를 관리하기 위한 거버너(governor)를 추가했고, 그다음으로 비행 단계 사이의 전환을 처리하기 위한 가이드를 추가했으며, 마지막으로 로켓의 핀(fin)에 가해지는 힘을 균형 있게 맞추기 위한 특정 수학적 도구를 도입했습니다. 캠페인이 끝날 무렵, 시스템은 모든 테스트 실행에서 로켓을 성공적으로 착착륙시킨 컨트롤러, 즉 100%의 완벽한 점수를 만들어냈습니다. 결정적으로, 시스템은 전체 여정을 기록하여 각 작은 개선이 어떻게 최종 성공으로 이어졌는지 정확히 보여주었습니다.
또 다른 실험에서 시스템은 자율 트레이딩 문제를 다루었습니다. 목표는 시간이 지남에 따라 수익을 극대화할 수 있도록 주식을 사고파는 전략을 만드는 것이었습니다. 가용 가능한 모든 주식을 동일한 양으로 매수하는 단순한 기본 전략은 연간 성장률 23%를 달착했습니다. PRAXIST는 시장 패턴으로부터 학습하고 실행 비용에 따라 행동을 조정하는 더 복합적이고 적응적인 전략을 발견했습니다. 이 새로운 전략은 성장률 53%를 달성하며 기본 전략의 두 배가 넘는 성과를 냈습니다. 시스템은 단순히 운 좋은 조합을 찾은 것이 아니라, 위험을 어떻게 관리하고 거래 타이밍을 어떻게 조절했는지와 같은 구체적인 변화를 통해 그 발견의 과정을 추적했습니다. 연구진은 시스템의 "계보"를 살펴봄으로써 전략이 성능을 저해하던 흔한 함정을 피하는 법을 배운 정확한 순간을 확인할 수 있었습니다.
시스템은 로봇 공학과 물리학 분야에서도 그 가치를 입증했습니다. 카메라와 레이저를 사용하여 항해하는 로봇을 대상으로 한 테스트에서, 표준 시스템은 중복된 정보로 지도를 계속 업데이트하느라 엄청난 양의 컴퓨요 자원을 낭비하고 있었습니다. PRAXIST는 로봇이 모든 비디오 프레임을 볼 필요가 없으며, 새로운 정보가 실제로 유용할 때만 확인하면 된다는 것을 깨달았습니다. 로봇에게 불필요한 업데이트를 건너뛰도록 가르침으로써, 시스템은 항해 정확도를 잃지 않으면서도 시각 처리 시간을 72% 단축했습니다. 마찬가지로, 핵융합 원자로를 제어하는 시뮬레이션에서 시스템은 물리 법칙이 예측하기 매우 까다로운 상황임에도 불구하고, 기존의 인간 설계 컨트롤러보다 플라즈마를 더 오랫동안 안정적으로 유지하는 컨트롤러를 설계했습니다.
이러한 결과가 중요한 이유는 그것이 제공하는 투명성에 있습니다. 전통적인 자동화된 연구에서 시스템이 솔루션을 찾아낼 때, 그것은 종종 "블랙박스"와 같습니다. 그것이 작동한다는 것은 알지만 왜 그런지는 모르며, 약간 다른 상황에서도 그 성공이 유지될지 쉽게 판단할 수 없습니다. PRAXIST는 모든 결과에 상세한 이야기를 첨부함으로써 이를 변화시킵니다. 이는 어떤 메커니즘이 테스트되었고, 무엇이 검증되었으며, 무엇이 폐기되었는지를 보여주는 증거의 사슬인 "계보"를 기록합니다. 이는 인간 과학자들이 시스템의 작업을 보고, 그 뒤에 숨겨진 논리를 이해하며, 심지어 최선의 부분을 가져와 새로운 것을 구축할 수 있음을 의미합니다. 이는 컴퓨터를 단순히 답을 내놓는 도구에서, 자신의 추론을 문서화하는 협력자로 바꿉니다.
연구진은 이 접근 방식이 인간 과학자를 대체하려는 것이 아니라, 그들에게 더 강력한 도구를 제공하려는 것이라고 강조합니다. 수천 가지의 변형을 테스트하고 학습된 교훈을 정리하는 지루한 작업을 처리함으로써, 시스템은 인간이 더 큰 그림에 집중할 수 있도록 해줍니다. 실험의 세대를 거쳐 지식을 상속받는 능력은 시스템이 새로운 문제에 직면할 때마다 처음부터 다시 시작할 필요가 없음을 의미합니다. 시스템은 과거의 실패와 성공으로부터 얻은 지혜를 전달할 수 있으며, 시도할 때마다 더 강력해지는 신뢰할 수 있는 지식의 토대를 구축할 수 있습니다. 최고의 점수를 찾는 단순한 탐색에서 증거에 기반한 깊은 이해로의 이러한 전환은 우리가 복잡한 공학적 과제에 접근하는 방식을 근본적으로 변화시킵니다.
결국, PRAXIST의 이야기는 기계의 기억력에 관한 이야기입니다. 오랫동안 컴퓨터는 계산에는 뛰어났지만, 자신의 역사를 구조적인 방식으로 학습하는 데는 서툴렀습니다. 이 시스템은 기계에게 단순히 무엇이 일어났는지가 아니라 왜 일어났는지를 기록하는 능력을 부여했을 때, 이전에 도달할 수 없었던 문제들을 해결할 수 있음을 보여줍니다. 이는 기계가 일반적인 의미에서 더 똑똑해졌기 때문이 아니라, 무엇을 기억하고 그 기억을 어떻게 사용하는지에 대해 더 신중해졌기 때문입니다. 그 결과, 더 효율적이고 비용 효율적일 뿐만 아니라, 모든 솔루션이 도달 과정에 대한 명확하고 검사 가능한 설명을 동반하기 때문에 더 신뢰할 수 있는 시스템이 탄생했습니다. 이것이 자율 연구의 미래입니다. 단순히 정답을 향해 추측하며 나아가는 기계가 아니라, 한 번에 하나의 실험을 통해 증거의 유산을 쌓아가는 기계의 미래입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.