ContractBench: Can LLM Agents Preserve Observation Contracts?
본 논문은 현재 최첨단 LLM 에이전트가 세션 토큰 및 URL 과 같은 관찰 계약의 시간적 유효성과 바이트 수준의 무결성을 유지하는 데 자주 실패함을 드러내는 결정론적 벤치마크인 ContractBench 를 소개하며, 이 능력은 모델 크기와 단조롭게 확장되지 않으며 개선을 위해서는 특정 실패 인지 훈련이 필요함을 밝힙니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 "CONTRACTBENCH: LLM 에이전트는 관찰 계약을 유지할 수 있는가?"라는 논문을 쉬운 언어와 창의적인 비유를 사용하여 설명한 것입니다.
핵심 아이디어: "디지털 인계" 문제
당신이 매우 똑똑하지만 다소 서툰 로봇 비서를 고용하여 용건을 봐달라고 가정해 보십시오. 당신은 로봇에게 이렇게 말합니다: "은행에 가서 임시 열쇠를 받아서 그 열쇠로 금고 문을 열어."
현실 세계에서 로봇이 열쇠를 떨어뜨리거나, 열쇠의 모양을 바꾸거나, 만료된 열쇠를 사용하려고 한다면 금고는 열리지 않습니다. 로봇이 실패한 이유는 무엇을 해야 할지 몰라서가 아니라, 인계 과정의 구체적인 세부 사항을 처리하지 못했기 때문입니다.
이 논문은 이러한 세부 사항을 "관찰 계약 (Observation Contracts)"이라고 부릅니다.
- 계약: 도구 (예: 은행 API) 가 로봇에게 데이터 (예: 임시 비밀번호나 서명된 링크) 를 제공할 때, 그 데이터에는 두 가지 보이지 않는 규칙이 따릅니다.
- 만료일: 지금 사용해야 하며, 그렇지 않으면 쓸모없어집니다.
- "손대지 마" 규칙: 글자 하나하나 그대로 복사해야 합니다. 쉼표나 공백 하나만 바꿔도 작동이 멈춥니다.
저자들은 오늘날 가장 똑똑한 AI 에이전트조차 이러한 규칙을 따르는 데 매우 서툴다는 사실을 발견했습니다. 그들은 종종 열쇠를 떨어뜨리거나, 녹이거나, 다음 날 사용하려고 시도합니다.
새로운 테스트: CONTRACTBENCH
이를 증명하기 위해 연구자들은 CONTRACTBENCH라는 새로운 테스트를 개발했습니다. 이를 자동차 운전 면허 시험이라고 생각하되, 대신 자동차 운전 대신 에이전트가 다음 사람에게 깨지기 쉽고 시간 제한이 있는 패키지를 전달해야 하는 디지털 장애물 코스를 navigat 해야 하는 시험이라고 상상해 보십시오.
- 코스: 10 초 만에 죽는 링크로 파일을 다운로드하거나, 완벽하게 입력해야 하는 코드로 로그인하는 등 33 가지 다른 시나리오가 있습니다.
- 규칙: 이 테스트는 엄격한 컴퓨터 프로그램 (인간 심사관 없음) 이 수행합니다. "가상 시계"를 사용하여 에이전트가 너무 느린지 확인하고, "디지털 지문 스캐너"를 사용하여 에이전트가 코드 속의 글자 하나를 변경했는지 확인합니다.
- 점수: 에이전트가 시간 제한을 초과하거나 코드의 철자를 실수하면 낙제합니다.
그들이 발견한 것 (연구 결과)
연구자들은 OpenAI, Anthropic, Google 및 오픈소스 팀의 최신이자 가장 유명한 모델을 포함하여 38 가지 다른 AI 모델을 테스트했습니다. 일상적인 용어로 번역된 그들의 발견은 다음과 같습니다.
1. 가장 "똑똑한" 로봇조차 실패합니다
발견: 어떤 모델도 테스트의 80% 를 통과하지 못했습니다. 가장 좋은 모델 (Claude Opus 4.6) 은 약 78% 만 획득했습니다.
비유: 세상에서 가장 똑똑한 학생이 수학 시험을 본다고 상상해 보십시오. 그들은 복잡한 미적분 문제를 풀 수 있지만, 10 자리 숫자를 오타 없이 완벽하게 복사하라고 요청하면 여전히 22% 의 확률로 틀립니다. "똑똑하다"는 것이 "신중하다"는 뜻은 아닙니다.
2. "마법의 절벽" (Qwen 3.5)
발견: 한 특정 모델 계열 (Qwen 3.5) 에서 능력의 급격한 상승이 있었습니다. 작은 40 억 파라미터 모델은 **0%**만 정확했습니다. 약간 더 큰 90 억 파라미터 모델은 **56%**로 급등했습니다.
비유: 레벨 9 에 도달할 때까지 쓸모없던 비디오 게임 캐릭터와 같습니다. 레벨 8 에서는 열쇠를 잡을 수도 없습니다. 레벨 9 에서는 갑자기 열쇠를 부드럽게 잡는 법을 배웁니다. 이는 서서히 개선된 것이 아니라, 데이터를 변경하지 않는다는 것을 아는 절제라는 특정 기술의 갑작스러운 "각성"이었습니다.
3. 더 크다고 항상 좋은 것은 아닙니다 (GPT-5 롤러코스터)
발견: GPT-5 모델 계열이 발전함에 따라 성능은 상승했다가 추락했다가 다시 상승했습니다.
비유: 요리사가 새로운 레시피 책을 받는다고 상상해 보십시오.
- 셰프 A (GPT-5): 완벽한 케이크를 만듭니다.
- 셰프 B (GPT-5.1): 더 "똑똑한" 버전의 책을 얻지만 설탕을 너무 많이 넣어 레시피를 망칩니다 (구체적으로, 재료를 복사하는 대신 변경하기 시작했습니다).
- 셰프 C (GPT-5.2): 레시피를 수정하고 완벽한 케이크를 다시 만듭니다.
이 논문은 AI 를 "더 똑똑하게" 만들거나 "더 대화형"으로 만드는 것이 때로는 엄격하고 지루한 규칙을 따르는 능력을 악화시킬 수 있다고 제안합니다.
4. "베이스" 모델은 할 수 없습니다
발견: 채팅하거나 지시를 따르도록 "학습"되지 않은 모델 (Base 모델) 은 테스트에서 0% 를 기록했습니다. 지시 따는 법을 배운 모델 (Instruct 모델) 만 통과할 수 있었습니다.
비유: 날것의 점토 덩어리 (Base 모델) 는 모양을 유지할 수 없습니다. 컵에 물을 담을 수 있게 하려면 조각 (후학습) 을 해야 합니다. 이러한 계약을 따르는 능력은 자연스러운 것이 아니라 가르쳐야 합니다.
5. "힌트"가 효과가 있습니다
발견: 연구자들이 AI 에게 정확히 무엇을 잘못했는지 (예: "코드의 글자를 변경했습니다") 알려주었을 때, AI 는 실수를 수정하고 테스트를 통과할 수 있었습니다.
비유: 아이에게 "공을 떨어뜨렸어"라고 말하면 다시 시도해서 잡을 수 있습니다. 하지만 단순히 "다시 해봐"라고만 말하면 다시 떨어뜨릴 수 있습니다. 구체적인 피드백이 오류를 수정하는 열쇠였습니다.
이것이 중요한 이유 (논문에 따르면)
이 논문은 우리가 AI 를 "퍼즐을 풀 수 있는지" 또는 "이야기를 쓸 수 있는지"로 테스트해 왔다고 주장합니다. 하지만 현실 세계에서 AI 에이전트는 정확성이 모든 것인 일을 수행하는 데 자주 사용됩니다.
AI 에이전트가 은행 계좌를 관리한다면 거래 코드에서 숫자 하나를 변경할 수 없습니다. 서버를 관리한다면 만료된 비밀번호를 사용할 수 없습니다.
결론: 현재의 AI 에이전트는 훌륭하지만 서툰 인턴과 같습니다. 그들은 큰 그림을 이해하지만, 건네받은 깨지기 쉬운 도구를 계속 떨어뜨립니다. 이를 현실 세계의 업무에 신뢰할 수 있게 만들기 위해서는 단순히 AI 를 "더 똑똑하게" 만드는 것을 멈추고, 그들이 받는 디지털 계약을 더 신중하게 그리고 더 정확하게 다루도록 가르쳐야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.