← 최신 논문
💬 NLP

VeRO: An Evaluation Harness for Agents to Optimize Agents

이 논문은 에이전트 최적화 작업을 체계적으로 평가하기 위해 버전 관리, 보상, 관찰 데이터를 통합한 평가 프레임워크인 VeRO 를 제안하고, 이를 통해 다양한 최적화 설정을 비교 분석하는 벤치마크를 제공합니다.

원저자: Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton

게시일 2026-02-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 에이전트 **(자동화 프로그램)에 대한 연구입니다.

쉽게 말해, "AI 가 스스로 코드를 고쳐서 더 똑똑하게 만드는 과정"을 어떻게 체계적으로 평가하고 개선할지 연구한 것입니다.

이 복잡한 내용을 일상적인 비유로 풀어서 설명해 드릴게요.


1. 문제 상황: "수술실 없는 외과 의사"

지금까지 AI 에이전트 (예: 자동화 프로그램) 를 만들 때는 인간이 직접 코드를 짜고, 실수가 나면 고치고, 다시 테스트하는 과정을 반복했습니다. 하지만 이 과정은 너무 느리고 비효율적입니다.

게다가, 기존에는 AI 가 스스로를 고칠 때 어떤 기준으로 고쳤는지, 왜 고쳤는지를 기록하거나 통제하는 체계가 없었습니다. 마치 수술실 없이 수술을 하는 의사처럼, "어디를 잘랐는지, 왜 잘랐는지"를 기록하지 않고 결과만 보는 것과 같습니다. 그래서 "AI 가 정말 나아진 건지, 아니면 운이 좋았을 뿐인지"를 알 수 없었습니다.

2. 해결책: **VeRO **(베로)

저자들은 이 문제를 해결하기 위해 VeRO라는 도구를 만들었습니다. VeRO 는 세 가지 핵심 기능을 가진 **'AI 실험실'**입니다.

  • **버전 관리 **(Versioning)
    • 비유: 게임의 **'세이브 포인트'**입니다.
    • AI 가 코드를 고칠 때마다 자동으로 저장됩니다. 만약 고친 결과가 더 나빠지면, 언제든 이전의 좋은 상태로 되돌릴 수 있습니다. "어떤 수정이 문제를 일으켰는지"를 정확히 추적할 수 있게 해줍니다.
  • **예산 통제 **(Rewards/Budget)
    • 비유: 제한된 식권이나 연료입니다.
    • AI 가 무한히 코드를 고치고 테스트하는 것을 막습니다. "테스트 횟수"라는 제한을 둬서, AI 가 무작정 시도하는 게 아니라 효율적으로 가장 좋은 해결책을 찾도록 유도합니다.
  • **구조화된 관찰 **(Observations)
    • 비유: 정밀한 의료 기록입니다.
    • AI 가 실패했을 때, 단순히 "틀렸다"는 결과만 주는 게 아니라, "어떤 단계에서 왜 틀렸는지"를 상세히 기록해 줍니다. 이를 통해 AI 는 다음에 무엇을 고쳐야 할지 정확히 알 수 있습니다.

3. 실험 결과: "초보자와 전문가의 차이"

저자들은 이 VeRO 시스템을 이용해 다양한 AI(옵티마이저) 들이 다른 AI(타겟 에이전트) 를 어떻게 고치는지 실험했습니다.

  • **초보 에이전트 **(Pawn)
    • 비유: 간단한 자전거를 고치는 상황입니다.
    • 초보 자전거는 부품이 적고 단순해서, 바퀴를 더 튼튼하게 하거나 핸들을 조정하는 것만으로도 성능이 비약적으로 향상됩니다.
    • 결과: AI 옵티마이저가 초보 에이전트를 고치면 효과가 매우 컸습니다.
  • **전문가 에이전트 **(Knight)
    • 비유: 고성능 레이싱 카를 고치는 상황입니다.
    • 이미 잘 만들어진 레이싱 카에 "더 빨리 가라"고 지시하는 것만으로는 큰 변화가 없습니다. 오히려 너무 많은 지시 (레시피) 를 주면 혼란이 와서 성능이 떨어지기도 했습니다.
    • 결과: 전문가 에이전트는 간단한 지시만 받아야 창의적으로 스스로 고쳐서 더 좋아졌습니다.

4. 중요한 발견: "단순한 말 바꾸기만으로는 부족하다"

가장 흥미로운 발견은 다음과 같습니다.

  • **현재의 AI 는 "말 **(프롬프트)
    • AI 옵티마이저들은 코드의 구조나 도구를 바꾸기보다, "지시문 (프롬프트) 을 조금 더 자세히 써달라"는 식의 작은 수정을 주로 합니다.
    • 비유: 요리사가 재료를 바꾸거나 조리법을 고치는 대신, "소금을 조금 더 넣어주세요"라고 말만 바꾸는 것과 같습니다.
  • 진짜 발전은 "구조"를 바꿀 때 옵니다.
    • 하지만 진정한 성능 향상은 **새로운 도구 **(예: 인터넷 검색 기능 추가)나 **작업 흐름 **(예: 실수하면 다시 확인하는 단계 추가)을 도입할 때 일어납니다.
    • VeRO 를 사용하면 AI 가 이런 구조적인 변화를 시도할 수 있게 됩니다.

5. 결론: 왜 이것이 중요한가요?

이 연구는 **"AI 가 스스로를 발전시키는 능력 **(자기 진화)을 보여줍니다.

  • 현재: AI 는 주로 "말"을 고치는 수준에 머물러 있습니다.
  • 미래: VeRO 같은 시스템을 통해 AI 는 프로그램의 구조 자체를 고쳐서 더 복잡하고 어려운 문제 (수학 문제 해결, 복잡한 도구 사용 등) 를 스스로 풀 수 있게 될 것입니다.

한 줄 요약:

**"AI 가 스스로 코드를 고칠 때, 실수를 기록하고 예산을 통제하며 체계적으로 학습할 수 있는 '실험실 **(VeRO)

이 연구는 앞으로 AI 가 인간보다 더 똑똑한 소프트웨어를 스스로 만들어내는 시대가 왔을 때, 그 과정을 안전하게 관리하고 평가하는 기준을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →