← 최신 논문
🤖 AI

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

이 논문은 오픈소스 FairyClaw 프레임워크가 Harness-Bench 에서 뛰어난 성능을 보인 사례를 통해, LLM 에이전트의 효율성, 정확성 및 강제성을 향상시키기 위해 비공식적인 자연어 지시를 실행 가능한 상태 머신과 JSON 스키마로 대체하는 런타임 네이티브 추상화인 "Formal Skill"을 소개합니다.

원저자: Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분은 사무실의 복잡한 문제를 해결하기 위해 매우 똑똑하고 매우 빠른 인턴 (AI 에이전트) 을 고용하고 있습니다. 예를 들어 고장 난 소프트웨어를 수리하는 일이 그렇습니다.

구식 방식: "방대한 텍스트" 매뉴얼

현재 대부분의 AI 에이전트는 다음과 같이 작동합니다. 여러분은 AI 에게 평범한 영어로 작성된 방대하고 상세한 지시 매뉴얼 (프롬프트 스킬) 을 제공합니다. 매뉴얼에는 다음과 같은 내용이 적혀 있습니다. "먼저 오류 로그를 확인하세요. 그다음 코드를 수정해 보세요. 테스트 파일을 삭제하지 않도록 주의하세요. 실패하면 다시 시도하세요. 작업이 끝나면 보고서를 작성하세요."

이 논문은 이를 "비공식적 스킬 (Informal Skill)"이라고 부릅니다. 이는 세 가지 큰 문제점을 가지고 있습니다:

  1. 비용이 많이 듭니다: AI 는 매번 한 걸음을 내디딜 때마다 이 거대한 매뉴얼을 읽어야 합니다. 이는 많은 양의 '토큰' (AI 컴퓨팅 파워의 화폐) 을 소모합니다.
  2. 모호합니다: AI 는 '다시 시도하세요'나 '삭제하지 마세요'가 실제로 무엇을 의미하는지 추측해야 합니다. 이는 인간에게 '조심하세요'라고 말하되 '조심'이 어떤 모습인지 정의하지 않는 것과 같습니다.
  3. 취약합니다: AI 가 실수를 하면, 자신이 어디에 있었는지 기억하기 위해 전체 대화 기록을 다시 뒤져야 합니다. 작업을 완료했는지, 아니면 한 단계 뒤로 돌아가야 하는지 알려주는 내장된 '체크리스트'가 없습니다.

새로운 방식: "공식적 스킬 (Formal Skill)"

저자들은 "공식적 스킬 (Formal Skill)"이라는 새로운 방식을 제안합니다. AI 에게 긴 텍스트 매뉴얼을 주는 대신, 프로그래밍 가능한 도구 상자를 제공합니다.

이를 50 페이지 분량의 레시피 책을 요리사에게 주는 대신, 내장된 안전 기능이 있는 스마트 주방을 제공하는 것으로 업그레이드하는 것이라고 생각하세요:

  • 레시피는 텍스트가 아닌 코드입니다: AI 는 문단을 읽는 대신 특정 버튼 (도구) 과 상호작용하고 엄격한 흐름도 (상태 머신) 를 따릅니다.
  • "후크 (Hook)" 시스템: 클럽의 문지기 (후크) 를 상상해 보세요. AI 가 작업의 어느 단계에 있는지에 따라 문지기가 어떤 문이 열려 있는지 결정합니다.
    • 1 단계 (조사): 문지기는 '검색 도구' 문만 엽니다. '삭제' 문은 잠겨 있습니다.
    • 2 단계 (수정): 문지기는 '패치 도구' 문을 열지만 '삭제' 문은 다시 잠급니다.
    • 3 단계 (검증): 문지기는 AI 가 테스트 기계로부터 '합격' 증서를 보여주기 전까지 방을 떠나지 못하게 합니다.
  • 상태 머신: AI 는 전체 이야기를 기억할 필요가 없습니다. 대신 "현재 '수정' 단계에 있습니다"라고 적힌 작은 디지털 배지만 가지고 있으면 됩니다. '수정'이 완료되기 전에 '보고서 작성' 단계로 건너뛰려고 하면 시스템이 자동으로 이를 막습니다.

"페어리클로 (FairyClaw)" 엔진

이를 구현하기 위해 저자들은 **페어리클로 (FairyClaw)**라는 새로운 엔진을 구축했습니다. 페어리클로는 쇼를 진행하는 스마트 관리자로 생각할 수 있습니다.

  • 이는 AI 와 단순히 대화하는 것이 아니라, AI 의 도구와 규칙을 능동적으로 관리합니다.
  • 큰 작업을 더 작은 하위 작업으로 나누고 각 작업에 적합한 "공식적 스킬"을 할당합니다.
  • AI 가 어디에 있는지, 무엇을 했는지, 그리고 무엇을 아직 해야 하는지를 정확히 기록하여 AI 가 길을 잃지 않도록 합니다.

결과: 더 빠르고, 저렴하며, 안전함

저자들은 Harness-Bench라는 까다로운 테스트를 사용하여 이 시스템 (페어리클로) 을 다른 인기 있는 AI 에이전트 시스템과 비교 테스트했습니다.

  • 점수: 페어리클로는 실제로 작업을 완료하는 데 있어 다른 시스템과同等하거나 더 좋은 성과를 냈습니다.
  • 비용: 이것이 큰 승리입니다. 페어리클로는 다른 시스템들의 평균보다 토큰을 48% 적게 사용했습니다 (돈/컴퓨팅 파워).
    • 비유: 다른 시스템들이 도시를 돌아다니며 운전사에게 매번 커다란 지도를 소리 내어 읽어주는 배송 트럭이라면, 페어리클로는 운전사에게 다음 커브만 보여주고 나머지는 필요할 때까지 숨겨두는 GPS 와 같습니다.
  • "코드 수리" 테스트: 버그가 있는 코드를 수정하는 특정 작업에서 페어리클로는 명백한 승자였습니다. "공식적 스킬"이 AI 에게 작업을 완료하기 전에 작업을 검증하도록 강제했기 때문에, 다른 에이전트들이 저지른 어리석은 실수를 하지 않았습니다.

요약

이 논문은 AI 스킬을 길고 모호한 지시 매뉴얼처럼 취급하는 것을 멈추고, 엄격하고 실행 가능한 소프트웨어 프로토콜처럼 취급해야 한다고 주장합니다. 규칙을 "AI 가 읽는 텍스트"에서 "AI 가 실행하는 코드"로 옮김으로써, 실행 비용이 더 저렴하고 속임수에 더 강하며 복잡한 절차를 더 잘 따르는 에이전트를 얻을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →