← 최신 논문
💻 computer science

Experience Graphs: The Data Foundation for Self-Improving Agents

이 논문은 장기적 에이전트 작업에서 생성된 구조화된 "경험 그래프(experience graphs)"를 상태가 없는 에이전트, 견고한 크래시 복구, 그리고 폐쇄 루프형 학습 플라이휠을 가능하게 하는 첫 번째 클래스의 쿼리 가능한 데이터로 취급하는 데이터베이스 중심 아키텍처인 Trellis를 제안하며, Meta의 프로덕션 커널 옵티마이저에서 상당한 효율성 이득을 입증한다.

원저자: Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanov
게시일 2026-06-30
📖 5 분 읽기🧠 심층 분석

원저자: Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanova, Uladzimir Pashkevich, Matt Steiner, Pedro Pedreira, Rob Fergus, Anirudh Goyal, Carole-Jean Wu, Gaoxiang Liu, Andrew Witten, Daniel J. Abadi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "망각하는" 에이전트에서 "누적하는" 학습자로

당신이 로봇에게 새로운 컴퓨터 칩을 설계하거나 복잡한 코드를 작성하는 것과 같은 매우 어려운 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요.

기존 방식 (현재의 에이전트):
현재 대부분의 AI 에이전트는 한 번에 퍼즐을 풀려고 노력하는 사람처럼 작동합니다. 한 단계를 시도하고, 아마 실패할 수도 있고, 다시 시도하며, 답을 얻을 때까지 계속 진행합니다. 하지만 일단 작업을 마치거나 (혹은 중단되면) 그 특정 시도 중에 배웠던 거의 모든 것을 잊어버립니다. 만약 내일 똑같은 퍼즐을 다시 시도한다면, 그들은 처음부터 다시 시작해야 합니다. 그들의 "기억"은 읽거나 재사용하기 어려운 지저분한 메모(로그) 더미일 뿐입니다.

새로운 방식 (Trellis & Experience Graphs):
이 논문은 Trellis라고 불리는 새로운 시스템을 제안합니다. 트렐리스(격자 구조물)를 정원사가 덩굴이 자라도록 돕기 위해 사용하는 나무 격자 구조라고 생각해 보세요. 덩굴(AI 에이전트)은 기어오르고 자라지만, 트렐리스(데이터베이스)는 모든 것을 지탱하고, 가지를 정리하며, 식물이 쓰러지지 않도록 보장합니다.

이 새로운 시스템에서는 에이전트가 취하는 모든 단계—모든 추측, 모든 실패, 사용하는 모든 도구, 그리고 얻은 점수까지—가 **Experience Graph(경험 그래프)**라고 불리는 거대하고 조직적이며 검색 가능한 구조 안에 저장됩니다.

핵심 비유: "시도의 정원"

에이전트가 단순히 최종 보고서를 작성하는 대신, 거대한 정원을 탐험하고 있다고 상상해 보세요.

  • Experience Graph (경험 그래프): 이것은 정원 그 자체입니다. 에이전트가 걷는 모든 경로, 꺾는 모든 꽃, 그리고 부딪히는 모든 막다른 길은 정원의 영구적인 식물로 기록됩니다.
  • "덩굴" (Vines): AI 에이전트는 덩굴입니다. 그들은 자라고, 탐험하고, 새로운 것을 시도합니다.
  • "Trellis" (Trellis 시스템): 이것은 정원을 지탱하는 데이터베이스입니다. 식물을 키우지는 않지만, 모든 것을 지탱합니다. 모든 가지가 어디에 있는지, 얼마나 잘 자랐는지, 그리고 다른 경로를 시도했을 때 어떤 일이 일어났는지를 정확히 기억합니다.

이것이 왜 모든 것을 바꾸는가

이 논문은 이러한 "정원 기록"을 (은행이나 항공사를 운영하는 것과 같은) 제대로 된 데이터베이스로 취급하는 것이 다음과 같은 세 가지 주요 방식으로 AI의 작동 방식을 바꾼다고 주장합니다.

1. 충돌(Crash) 후에도 "기억 상실" 없음

문제점: 현재의 에이전트가 충돌하면(컴퓨터가 멈추는 것처럼), 진행 상황을 잃어버립니다. 이는 마치 등산객이 절벽에서 떨어지면서 들고 있던 지도를 잊어버리는 것과 같습니다.
Trellis의 해결책: "지도"(경험 그래프)가 에이전트의 머릿속이 아닌 데이터베이스에 살고 있기 때문에, 에이전트는 즉시 재시작될 수 있습니다. 에이전트는 그저 데이터베이스에 "내가 어디에 있었지?"라고 묻고 정확히 멈췄던 지점에서 다시 시작하면 됩니다. 에이전트 자체는 "상태가 없는(stateless)" 존재가 됩니다. 즉, 에이전트는 생각하는 일을 하는 작업자일 뿐이며, 데이터베이스가 기억을 보유합니다.

2. 타인으로부터 배우기 (세션 간 재사용)

문제점: 현재는 에이전트 A가 문제를 해결하더라도 에이전트 B는 자동으로 그 사실을 알지 못합니다. 그들은 고립되어 있습니다.
Trellis의 해결책: 데이터베이스를 통해 에이전트 B는 에이전트 A의 "정원"을 들여다볼 수 있습니다. 만약 에이전트 A가 지름길을 찾았거나 막다른 길을 피하는 방법을 찾았다면, 에이전트 B는 즉시 그 경로를 볼 수 있습니다.

  • 결과: 논문은 이를 KernelEvolve(컴퓨터 코드를 최적화하는 도구)라는 실제 도구로 테스트했습니다. 에이전트들이 공유된 정원에서 정보를 "빌려올" 수 있었을 때, 그들은 10배 더 빠르게 좋은 솔루션을 찾아냈으며, 다른 이들이 이미 저지른 실수를 반복하는 데 시간을 낭비하지 않았기에 컴퓨팅 자원(토큰)을 52% 적게 사용했습니다.

3. 훈련을 위한 "시간 여행"

문제점: AI를 더 잘 가르치기 위해, 우리는 보통 무엇이 작동했고 무엇이 작동하지 않았는지 찾기 위해 지저분한 로그를 훑어야 합니다. 이는 느리고 종종 부정확합니다.
Trellis의 해결책: 데이터베이스는 "정원"을 훈련 자료로 자동 정리합니다.

  • AI에게 보여줄 수 있습니다: "여기는 당신이 성공한 경로(Good)입니다."
  • 또한 보여줄 수 있습니다: "여기는 당신이 실패한 경로(Bad)입니다."
  • 심지어 "시간 여행"도 가능합니다: 미래의 결과는 보지 않은 채, 과거의 특정 시점에 에이전트가 정확히 무엇을 알고 있었는지를 재구성할 수 있습니다. 이는 자동으로 고품질의 훈련 데이터를 생성합니다.

"자기 개선 플라이휠" (Self-Improving Flywheel)

이 논문은 시스템을 점점 더 똑똑하게 만드는 순환 과정을 설명합니다:

  1. 탐색 (Explore): 에이전트가 정원을 탐색하며 새로운 것을 시도합니다.
  2. 기록 (Record): 모든 시도가 Trellis 데이터베이스에 저장됩니다.
  3. 학습 (Learn): 데이터베이스는 이러한 시도들을 AI 모델을 가르치기 위한 훈련 데이터로 변환합니다.
  4. 개선 (Improve): 더 똑똑해진 모델이 다시 정원으로 돌아가 더 나은 탐색을 수행합니다.

데이터베이스가 기억을 보유하기 때문에, 시스템은 더 많은 사람이 사용할수록 더 똑똑해집니다. 이는 단지 하나의 에이전트가 똑똑해지는 것이 아니라, 하나의 성장하는 라이브러리를 공유하는 에이전트 공동체 전체가 똑똑해지는 것입니다.

이 논문이 실제로 주장하는 것 (그리고 주장하지 않는 것)

  • 주장하는 바: 그들은 AI 검색 기록을 데이터베이스로 취급하는 시스템(Trellis)을 구축했습니다. 그들은 이를 컴퓨터 칩 최적화(KernelEvolve)하드웨어 검증에 테스트했습니다. 이 시스템이 에이전트를 더 빠르고, 저렴하며, 신뢰할 수 있게 만든다는 것을 보여주었습니다.
  • 주장하는 바: 이 아키텍처는 "재귀적 자기 개선(Recursive Self-Improvement, 에이전트가 자신의 업무를 스스로 개선하는 것)"을 가능하게 합니다.
  • 주장하지 않는 바: 이 논문은 의료 용도, 임상 시험, 또는 소프트웨어/하드웨어 최적화 이외의 특정 응용 분야(구조적으로는 신약 개발이나 과학 분야에 적용될 수 있다고 언급했지만, 실제 제시된 결과는 컴퓨터 코드와 칩에 관한 것임)에 대해 논하지 않습니다.

요약 비유

새로운 물리 법칙을 발견하려고 노력하는 과학자 그룹을 상상해 보세요.

  • Trellis가 없다면: 각 과학자는 별도의 방에서 작업하며 메모를 종이에 적고, 방을 떠나면 그 메모는 버려집니다. 그들은 매번 바퀴를 다시 발명해야 합니다.
  • Trellis가 있다면: 모든 과학자가 거대한 공유 도서관에서 함께 일합니다. 모든 실험, 모든 실패, 모든 성공이 카드에 적혀 완벽하게 파일링됩니다. 만약 한 과학자가 실수를 한다면, 도서관은 그것을 알고 있습니다. 만약 다른 과학자가 단서가 필요하다면, 동료의 실험에서 나온 정확한 카드를 찾아볼 수 있습니다. 도서관 자체가 모든 것을 기억하는 "두뇌" 역할을 하며, 과학자들이 서로의 어깨 위에 올라타 더 멀리 나아갈 수 있도록 돕습니다.

논문은 결론적으로 로그가 데이터베이스를 신뢰할 수 있게 만들었다면, 경험 그래프는 AI 에이전트를 누적적(cumulative)으로 만들 수 있다고 말합니다. 즉, 한 번에 하나의 문제만 푸는 것이 아니라, 지속되고 성장하는 지식을 쌓을 수 있다는 의미입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →