← 최신 논문
💻 computer science

PREPING: Building Agent Memory without Tasks

본 논문은 제안자 주도 루프를 활용하여 고품질 합성 연습 궤적을 생성하고 선택적으로 저장함으로써 에이전트가 목표 과제를 접하기 전에 절차적 기억을 구축할 수 있게 하는 Preping이라는 프레임워크를 소개하며, 이를 통해 온라인 기억 구축보다 훨씬 낮은 배포 비용으로 콜드스타트 간극을 극복합니다.

원저자: Yumin Choi, Sangwoo Park, Minki Kang, Jinheon Baek, Sung Ju Hwang

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yumin Choi, Sangwoo Park, Minki Kang, Jinheon Baek, Sung Ju Hwang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 디지털 생활을 관리할 새로운 직원을 고용한다고 상상해 보세요. 그 직원은 매우 똑똑합니다 (강력한 AI). 하지만 당신의 특정 앱, 도구, 또는 규칙은 한 번도 본 적이 없습니다.

문제: "콜드 스타트" 격차
일반적으로 직원을 고용할 때, 당신은 다음 두 가지 중 하나를 선택합니다:

  1. 사전에 훈련 (오프라인): 과거의 성공적인 작업에 대한 두꺼운 매뉴얼을 제공합니다. 하지만 당신이 완전히 새로운 앱을 출시하고 있다면, 그 매뉴얼은 아직 존재하지 않습니다.
  2. 직무 중 훈련 (온라인): 즉시 일을 시작하게 합니다. 하지만 처음에는 직원이 실수를 하고, 실패하며, 상황을 파악하는 동안 당신을 짜증나게 할 것입니다. 이것이 바로 "콜드 스타트" 문제입니다.

이 논문은 질문합니다: 우리가 직접 만든 연습 세션만을 사용하여, 이 직원이 실제 고객을 한 번도 만나기 전에 훈련시킬 수 있을까요?

해결책: PREPING (Pre-Task Reusable Playbook Making, 사전 작업 재사용 가능 플레이북 제작)
저자들은 PREPING이라는 시스템을 개발했습니다. 이를 시뮬레이션 훈련 캠프로 생각하세요. 여기서 AI 는 스스로 고안한 작업들을 연습하지만, 연습이 실제로 유용하도록 매우 엄격한 코치가 존재합니다.

다음은 세 가지 캐릭터를 사용하여 "훈련 캠프"가 어떻게 작동하는지 설명한 것입니다:

1. 제안자 (The Proposer, 창의적인 코치)

이것은 AI 의 연습 과제를 고안하는 부분입니다.

  • 코치 없이: AI 에게 단순히 "연습하라"고만 말하면, 같은 일을 100 번 반복하거나 (예: 문 열기) 불가능한 일을 시도할 수 있습니다 (예: 비행). 이는 쓸모가 없습니다.
  • PREPING 과 함께: 제안자는 **기억 노트 (Proposer Memory)**를 가지고 있습니다. 이미 연습한 내용을 추적합니다. 만약 방금 "문을 여는 것"을 연습했다면, 노트는 "좋아, 이제 잠그는 것을 시도해 봐" 또는 "엘리베이터를 사용해 봐"라고 말합니다. 또한 과제가 실제로 가능한지 확인하기 위해 환경 지도를 참조합니다 (예: "건물에 지붕이 없다면 AI 에게 비행하라고 요청하지 마세요").
  • 목표: 새로운 환경의 모든 도구와 규칙을 포괄하면서도 반복되지 않는 다양한 연습 drill 을 생성하는 것입니다.

2. 해결자 (The Solver, 훈련생)

이것은 실제로 작업을 수행하는 AI 입니다. 제안자가 고안한 과제를 완료하려고 노력합니다. 실제 사용자를 위해 하듯이 코드를 작성하고, 버튼을 클릭하며, API 를 호출합니다.

3. 검증자 (The Validator, 엄격한 검사관)

이것이 가장 중요한 부분입니다. 모든 연습 세션이 좋은 것은 아닙니다.

  • 때때로 훈련생은 존재하지 않는 카드에서 돈을 인출하는 것처럼 불가능한 일을 시도합니다.
  • 검증자는 결과를 보고 말합니다: "멈춰. 이건 가짜 작업이야. 적어두지 마."
  • 만약 작업이 실제 것이었고 훈련생이 성공했다면, 검증자는 말합니다: "좋아! 이것이 배운 교훈이야. 플레이북에 기록해."

결과: 첫날부터 준비된 "플레이북"
AI 가 실제 사용자에게 배포될 때쯤이면, 다음과 같은 내용으로 채워진 **플레이북 (절차에 대한 기억)**을 갖게 됩니다:

  • 서로 다른 도구들을 올바르게 결합하는 방법.
  • 문제가 발생했을 때 무엇을 해야 하는지.
  • 실제로 이용 가능한 도구들.

왜 이것이 기존 방식보다 더 나은가요?

  • 훈련 없음 vs: AI 는 제로에서 시작하지 않습니다. 첫 번째 실제 작업에서 당황스러운 실수를 하지 않습니다.
  • 직무 중 학습 vs: AI 는 당신의 실패로부터 배울 필요가 없습니다. 이미 요령을 익혔습니다.
  • 비용: 직무 중 학습은 비쌉니다. AI 가 작동하는 동안 당신이 기다리는 동안 계속 "생각"하고 "기억을 업데이트"해야 하기 때문입니다. PREPING 은 당신이 고용하기 전에 모든 무거운 작업을 처리하므로 실제 작업은 훨씬 저렴하고 빨라집니다.

핵심 요약 비유
조종사를 상상해 보세요.

  • 기존 방식: 처음 조종하는 동안 승객을 태운 실제 비행기로 조종사를 비행시켜 제어 장치를 배우게 합니다. (위험하고 느림).
  • PREPING 방식: 비행 시뮬레이터에 태웁니다. 똑똑한 강사 (제안자) 가 구체적인 시나리오 (흐린 날, 엔진 고장, 새로운 공항) 를 제공합니다. 안전 요원 (검증자) 은 그들이 산으로 날아가지 못하게 막습니다. 실제 조종석에 앉을 때쯤이면 그들은 모든 것을 처리하는 방법의 정신적 체크리스트 (기억) 를 갖게 되며, 즉시 비행할 준비가 됩니다.

논문의 발견
저자들은 세 가지 다른 "디지털 세계" (앱 관리, 함수 호출, 서버 도구 사용) 에서 이를 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  1. PREPING 은 매뉴얼을 읽거나 추측하는 것보다 훨씬 더 똑똑한 AI 를 만들었습니다.
  2. 수천 개의 실제 인간 작업을 훈련받은 AI 와 거의 동일한 성능을 발휘했습니다. 비록 실제 인간 작업을 한 번도 보지 않았음에도 불구하고요.
  3. AI 가 당신을 위해 일하는 동안 "학습"할 필요가 없었기 때문에 시간과 비용을 절약했습니다.

요약하자면, PREPING 은 AI 가 고객과 만나기 전에 똑똑하게 연습하고 나쁜 연습을 필터링함으로써 AI 가 프로가 되도록 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →