← 최신 논문
💻 computer science

Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents

본 논문은 목표, 경계 및 품질 기준의 검열 가능성을 향상시키기 위해 기업용 AI 에이전트 지시를 읽기 쉬운 작업 계약으로 구조화하는 GovernSpec 에서 영감을 받은 "계약적 기술"을 소개하며, 실험을 통해 이 접근 방식이 독립적인 안전 메커니즘이 아닌 거버넌스 및 유지보수성을 개선함을 입증합니다.

원저자: Ting Liu

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ting Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 빠르지만 때로는 지나치게 열성적인 조수를 고용하여 비즈니스를 운영한다고 상상해 보세요. 이 조수에게 "스킬(Skills)"이라는 일련의 지시 사항을 전달합니다.

과거의 방식에서는 이러한 지시 사항이 길고 산만한 편지와 같았습니다. 예를 들어, "고객과 대화할 때는 친절하게 대하고, 가격표를 확인하며, 제공할 수 없는 것을 약속하지 마세요"라고 작성할 수 있습니다. 조수는 이를 읽고 고개를 끄덕이며 최선을 다하려 합니다. 하지만 규칙이 텍스트의 여러 단락 속에 숨어 있기 때문에, 조수가 가격 확인을 잊거나 더 나쁘게는 허가되지 않은 할인을 실수로 약속할 수도 있습니다.

이 논문은 이러한 지시 사항을 작성하는 새로운 방식을 제안하며, 이를 **"계약적 스킬 (Contractual Skills)"**이라고 부릅니다.

핵심 아이디어: 편지에서 체크리스트로

긴 편지 대신, 계약적 스킬공식적인 고용 계약서비행 체크리스트로 생각하세요.

저자인 류팅 (Ting Liu) 은 모든 스킬이 조수가 반드시 작성하거나 따라야 하는 구체적인 레이블이 달란 상자 (필드) 를 가져야 한다고 제안합니다.

  • 목표 (Goal): 정확히 무엇을 달성하려 하나요?
  • 입력 (Inputs): 시작하기 전에 어떤 정보가 필요합니까? (고객의 신원 확인증이 없다면 중단하세요!)
  • 권한 (Permissions): 어떤 도구를 사용할 수 있습니까? (이메일은 읽을 수 있지만 파일을 삭제할 수는 없습니다.)
  • 인간 게이트 (Human Gates): 언제 멈추고 인간 상사에게 승인을 요청해야 합니까? (예: "할인율이 10% 를 초과하면 일시 정지하고 서명을 기다리세요.")
  • 증거 (Evidence): 사실을 어디서 얻었습니까? (추측하지 말고 출처를 제시하세요.)
  • 출력 (Output): 최종 결과는 어떻게 보여야 합니까? (임의의 단락이 아닌 특정 형식이어야 합니다.)

왜 이렇게 해야 할까요?

이 논문은 규칙이 "산문 (긴 텍스트)"에 숨어 있을 때는 놓치기 쉽다고 주장합니다. 하지만 규칙이 레이블이 달린 상자에 있으면 무시할 수 없게 됩니다.

  • 유사성: 비행기가 조종하는 조종사를 상상해 보세요. 안전 규칙이 소설에 적혀 있다면 조종사는 단계를 놓칠 수 있습니다. 하지만 규칙이 체크박스가 있는 체크리스트에 있다면 조종사는 반드시 이를 확인해야 합니다. 계약적 스킬은 AI 의 지시 사항을 바로 그 체크리스트로 변환합니다.

무엇을 테스트했나요?

연구진은 이 "체크리스트" 방식이 "긴 편지" 방식보다 실제로 더 잘 작동하는지 확인하기 위해 두 가지 주요 실험을 수행했습니다.

1. 작성 테스트 (텍스트 생성)
연구진은 다양한 AI 모델에게 영업 이메일 작성, 계약서 검토, 코드 확인 등의 작업을 수행하도록 요청했습니다. 네 가지 버전을 비교했습니다.

  • 스킬 없음: 기본 프롬프트만 사용.
  • 최소 스킬: 짧고 간단한 지시 사항.
  • 일반 확장 스킬: 길고 상세한 지시 사항 (과거의 "산만한 편지"와 유사).
  • 계약적 스킬: 동일한 상세 정보를 엄격한 "체크리스트" 형식으로 정리한 것.

결과: "계약적 스킬"은 스킬이 없거나 최소 스킬을 사용하는 경우보다 일관되게 더 좋고, 구조화되었으며, 안전한 결과를 생성했습니다. 동일한 양의 정보를 가진 "일반 확장" 버전과 비교했을 때, 계약적 버전은 규칙 준수와 형식 측면에서 약간 더 우수했으나 그 차이는 크지 않았습니다. 주요 성과는 출력물이 검토하고 검증하기 더 쉬워졌다는 점이었습니다.

2. "그것은 건드리지 마세요" 테스트 (도구 호출)
연구진은 AI 에게 삭제나 송금과 같은 차단되어야 할 "위험한" 도구를 포함한 시뮬레이션된 도구에 접근할 수 있도록 했습니다. 그리고 AI 가 이러한 도구들을 사용하려 했는지 관찰했습니다.

결과:

  • 좋은 소식: 어떤 종류의 스킬 (단순한 것이라도) 을 사용하면 AI 가 위험한 행동을 시도할 가능성이 줄어듭니다.
  • 주의점: "계약적 스킬"이 모든 경우에서 AI 가 규칙을 위반하려는 시도를 마법처럼 막지는 못했습니다. 일부 모델은 여전히 위험한 도구 사용을 시도했습니다.
  • 교훈: 스킬은 AI 에게 무엇이 발생해야 하는지를 알려주는 경고 표지규정집 역할을 하지만, AI 가 시도하는 것을 물리적으로 막을 수는 없습니다. 여전히 나쁜 행동을 물리적으로 차단하는 "경비원 (런타임 가드레일)"이 필요합니다. 스킬은 AI 가 언제 멈춰야 하는지에 대해 더 똑똑하게 만들 뿐입니다.

결론

이 논문은 계약적 스킬이 AI 를 완벽하게 안전하게 만들거나 인간의 감독을 대체한다고 주장하지 않습니다. 대신, AI 의 직무 설명을 훨씬 더 명확하게 만든다고 주장합니다.

  • 이전: "여기 긴 지시 편지가 있습니다. 행운을 빕니다!"
  • 이후: "여기 '할 일', '피할 것', '도움 요청 시기'에 대한 명확한 상자가 있는 계약서가 있습니다."

이로써 인간이 AI 의 작업을 검토하기 쉬워지고, AI 가 규칙을 따르는지 테스트하기 쉬워지며, AI 가 자신의 업무 한계를 이해하는 데 도움이 됩니다. 이는 모호한 "프롬프트"를 관리 가능한 조직 자산으로 변환합니다.

간단히 말해: 계약적 스킬은 AI 를 슈퍼히어로로 만들지 않습니다. 다만 AI 가 길을 잃거나 실수로 차를 추락시키지 않도록 더 나은 지도와 명확한 규칙 세트를 제공할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →