← 최신 논문
🤖 AI

Anchor: Mitigating Artifact Drift in Agent Benchmark Generation

본 논문은 비즈니스 워크플로우를 제약 최적화 프로그램으로 형식화하여 검증 가능하고 확장 가능한 평가 환경을 생성함으로써 아티팩트 드리프트를 완화하는 태스크 생성 파이프라인인 Anchor 를 소개하며, 이는 생산급 ERP 시스템에서 300 개의 장기적 태스크로 구성된 벤치마크인 ERP-Bench 의 출시를 통해 입증되었습니다.

원저자: Maksim Ivanov, Abhijay Rana

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Maksim Ivanov, Abhijay Rana

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

공장 운영을 로봇에게 가르치려 한다고 상상해 보세요. 발주, 제품 생산, 송장 발송과 같은 실제 비즈니스 업무를 처리할 만큼 똑똑한지 확인하기 위해 로봇에게 테스트를 주고 싶을 것입니다.

이 논문에 따르면, 문제는 대부분의 이러한 테스트가 결함이 있다는 점입니다. 저자들이 '아티팩트 드리프트(Artifact Drift)'라고 부르는 현상으로 인해 테스트가 제대로 작동하지 않습니다.

문제: "고장 난 레시피"

AI 에이전트를 위한 테스트를 만드는 것을 케이크 레시피를 작성하는 것과 같다고 생각해 보세요. 공정한 테스트를 만들기 위해서는 다음 네 가지가 완벽하게 일치해야 합니다.

  1. 지시사항: "초콜릿 케이크를 만드세요."
  2. 주방 (환경): 로봇에게 제공하는 오븐, 볼, 재료들.
  3. 정답 키 (오라클): 최종적으로 기대하는 완벽한 케이크.
  4. 심사관 (검증자): 케이크를 맛보고 좋다고 판단하는 사람.

대부분의 현재 AI 테스트에서는 이 네 가지 요소가 서로 대화하지 않는 다른 사람들이나 다른 도구들에 의해 작성됩니다.

  • 지시사항은 "설탕 2 컵을 사용하세요"라고 말할 수 있습니다.
  • 하지만 주방에는 설탕이 1 컵만 있습니다.
  • 정답 키는 로봇이 설탕 3 컵을 사용했다고 가정합니다.
  • 심사관은 케이크가 타더라도 케이크처럼 보이기만 하면 합격점을 줄 수도 있습니다.

이 네 가지 부분이 일치하지 않을 때, 테스트는 불공정해집니다. 로봇은 테스트 자체가 불가능했기 때문에 실패할 수도 있고, 테스트 제작자가 의도하지 않은 허점을 찾아 "부정" (보상 해킹) 을 할 수도 있습니다. 저자들은 이 혼란을 아티팩트 드리프트라고 부릅니다.

해결책: "앵커 (Anchor)"

저자들은 이를 해결하기 위해 앵커 (Anchor) 라는 새로운 시스템을 구축했습니다.

네 개의 별도 문서를 작성하는 대신, 단 하나의 완벽한 수학적 청사진 (제약 프로그램) 을 작성한다고 상상해 보세요. 이 청사진은 케이크를 어떻게 만들어야 하는지, 어떤 재료가 있는지, 규칙은 무엇인지를 정확히 정의하는 마스터 레시피와 같습니다.

테스트를 생성하고 싶을 때:

  1. 청사진을 약간 수정합니다 (예: "고객을 더 추가하여 어렵게 만들기" 또는 "재고를 더 주어 쉽게 만들기").
  2. 컴퓨터 솔버가 이 청사진을 읽고 "알겠습니다, 이 특정 버전을 해결하는 정확한 완벽한 방법이 여기 있습니다"라고 말합니다.
  3. 앵커는 그 하나의 완벽한 솔루션을 테스트의 네 가지 부분으로 자동으로 변환합니다.
    • 지시사항을 쉬운 영어로 작성합니다.
    • 올바른 재료로 주방을 설정합니다.
    • 솔버의 수학을 기반으로 정답 키를 생성합니다.
    • 그 정확히 동일한 규칙을 기준으로 검사하도록 심사관을 프로그래밍합니다.

모든 것이 그 단일 청사진에서 비롯되기 때문에 서로 불일치할 수 없습니다. 지시사항, 환경, 정답, 심사관은 모두 완벽하게 정렬됩니다.

결과: ERP-Bench

이 시스템을 사용하여 저자들은 ERP-Bench라는 새로운 테스트 세트를 만들었습니다.

  • 무엇입니까? Odoo 라는 실제 비즈니스 소프트웨어 시스템 내에서 부품 구매, 제품 제작, 재고 관리와 관련된 300 개의 현실적인 비즈니스 작업 세트입니다.
  • 왜 특별한가요? "검증 가능"합니다. 시스템은 모든 단일 작업에 대한 수학적으로 완벽한 정답을 알고 있습니다. 단순히 "잘 보이느냐"가 아니라 AI 가 완벽한 솔루션에 얼마나 근접했는지 정확히 알려줄 수 있습니다.

그들이 발견한 것

그들은 이 300 개의 작업에 대해 오늘날 이용 가능한 가장 똑똑한 AI 모델 다섯 가지를 테스트했습니다. 결과는 다음과 같습니다.

  1. 난이도 척도가 작동합니다: 청사진의 숫자만 변경하면 작업을 "쉬움", "중간", "어려움"으로 만들 수 있었습니다. AI 모델들은 작업이 어려워질수록 정확히 예측된 대로 성능이 떨어졌습니다.
  2. "충분히 좋은" 대 "완벽한" 간극: AI 모델들은 기본 규칙 (예: "재고가 떨어지지 않도록 하라") 을 따르는 데는 괜찮았습니다. 기본 제약 조건을 약 26% 의 확률로 올바르게 처리했습니다. 그러나 최적의 가능한 솔루션 (예: 최소 비용으로 지출하기) 을 찾는 데는 매우 형편없었습니다. 그들은 완벽한 최적 솔루션을 17% 의 확률로만 찾았습니다.
  3. 인터페이스가 중요합니다: AI 모델들은 인간처럼 화면의 버튼을 "클릭" (마우스 또는 브라우저 사용) 해야 할 때보다 소프트웨어와 직접 "대화" (프로그래머가 코드 사용) 할 때 훨씬 더 잘 수행했습니다. "클릭" 방식은 훨씬 느리고 실수가 더 많았습니다.

결론

이 논문은 실제로 비즈니스 작업을 수행할 수 있는 AI 를 구축하려면 불일치하는 부분으로 테스트를 만드는 것을 멈춰야 한다고 주장합니다. "단일 진실 공급원 (앵커 시스템)"을 사용하면 AI 에이전트가 복잡한 비즈니스 문제를 해결하는 능력이 실제로 얼마나 뛰어난지 알려주는 공정하고 감사 가능하며 현실적인 테스트를 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →