← 최신 논문
🤖 AI

LACUNA: Safe Agents as Recursive Program Holes

LACUNA 는 모델이 채우고 실행 전 정적 타입 검증을 통해 검증되는 타입화된 프로그램 홀로 행동을 처리하는 LLM 에이전트를 위한 안전한 프로그래밍 모델로, 이를 통해 에이전트의 제어 흐름과 생성된 코드를 통합하면서도 런타임 실패를 방지하고 도구 접근을 제한합니다.

원저자: Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 회사의 CEO 라 가정해 보십시오. 그리고 당신은 당신의 업무를 수행하도록 천재적이지만 약간은 신뢰할 수 없는 비서 (AI) 를 고용합니다.

기존 방식 (현재의 에이전트):
보통 당신은 비서에게 구체적이고 작은 지시를 내립니다. "전화 회사에 전화를 걸어라." 비서는 정확히 그 지시대로 수행한 후 멈추고 당신의 다음 명령을 기다립니다. 당신은 클립보드를 들고, 업무 순서를 결정하며, 사무실 열쇠를 가지고 있습니다. 비서는 대신 은행에 전화를 걸거나 사무실 규칙을 다시 작성할 수 없습니다. 왜냐하면 그들은 한 번에 누를 수 있는 단일 버튼만 가지고 있기 때문입니다.

문제점:
때때로 비서는 당신이 쓴 까다로운 메모 (프롬프트 인젝션) 에 혼란을 겪거나, 업무 수행 도중 실수를 하여 사무실을 지저분하고 일관성 없는 상태로 방치합니다. 비서는 건물을 부술 수는 없지만, 그들이 있는 방 안에서는 여전히 큰 혼란을 초래할 수 있습니다.

새로운 방식 (LACUNA):
이 논문은 LACUNA를 소개하며, 이는 관계를 변화시킵니다. 비서에게 단일 버튼을 누르게 하는 대신, 당신은 계약서의 **빈 공간 (타입된 구멍)**을 주고 "이 문제를 해결하는 데 필요한 모든 코드로 이 공간을 채우되, 우리 법적 계약에 완벽하게 들어맞아야 한다"고 말합니다.

간단한 비유를 사용하여 이것이 어떻게 작동하는지 설명하겠습니다.

1. "마법 계약서" (타입된 구멍)

이 섹션의 최종 결과가 숫자 목록이어야 한다고 명시된 계약서가 있다고 상상해 보십시오.

  • 당신은 AI 에게 묻습니다. "이 목록에서 소수를 찾아라."
  • AI 는 이를 해결하기 위한 전체 단락의 지시사항 (코드) 을 작성합니다.
  • 안전 점검: AI 가 실제로 무언가를 수행하기 전에 엄격한 검사관 (컴파일러) 이 AI 의 단락을 점검합니다.
    • 그 단락이 실제로 "숫자 목록"으로 이어집니까? 만약 AI 가 "사과 목록"을 반환하려 한다면, 검사관은 즉시 이를 거부합니다.
    • AI 가 만질 수 없는 도구를 사용하려 했습니까? (예: 열쇠가 없는 파일을 열려고 시도하는 경우). 검사관도 이를 잡아냅니다.
    • 결과: AI 가 실수를 하면, 어떤 행동이 발생하기 전에 계약서가 거부됩니다. 사무실은 깨끗하게 유지됩니다. AI 는 거절 통지를 받고 다시 시도하여 더 나은 단락을 작성합니다.

2. "전부 아니면 전무" 규칙

기존 방식에서는 AI 가 "파일 삭제"를 시도한 후 "합계 계산"을 하다가 계산이 실패하면, 파일은 이미 삭제되어 있을 수 있습니다.
LACUNA 에서는 이것이 단일하고 분할 불가능한 점토 덩어리와 같습니다.

  • AI 는 전체 덩어리를 조각합니다.
  • 검사관은 전체 덩어리를 한 번에 점검합니다.
  • 조각의 어떤 부분이라도 잘못되면 (잘못된 모양, 잘못된 재료), 전체 덩어리가 폐기됩니다. 아무 일도 일어나지 않습니다. 사무실은 AI 가 작업을 시작하기 전과 정확히 동일하게 유지됩니다. 이는 "반쯤 끝난" 재앙을 방지합니다.

3. "열쇠 고리" (기능)

이 논문은 또한 **기능 (Capabilities)**에 대해 논의합니다. AI 가 업무에 필요한 특정 열쇠 세트를 (열쇠 고리) 부여받았다고 상상해 보십시오.

  • 업무가 "메뉴판 읽기"라면, AI 는 "메뉴판 열쇠"를 받습니다.
  • 업무가 "이메일 보내기"라면, AI 는 "이메일 열쇠"를 받습니다.
  • 비록 AI 가 "은행 열쇠를 사용하여 돈을 훔쳐라"는 나쁜 메모에 속아 넘어진다 하더라도, 그들은 물리적으로 그렇게 할 수 없습니다. 그들은 주머니에 은행 열쇠를 가지고 있지 않기 때문입니다. 검사관은 그들이 자물쇠를 돌리기 전에 열쇠 고리를 점검합니다.
  • 이는 해커가 AI 를 속여 나쁜 일을 하도록 유도한다 하더라도, AI 는 문자 그대로 그 문을 열 "열쇠"가 부족하다는 것을 의미합니다.

4. "중첩된 러시아 인형" (재귀)

AI 는 자신에 대한 더 많은 지시사항을 포함하는 코드를 작성할 수 있습니다.

  • 당신은 묻습니다. "세 가지 주제에 대한 보고서를 작성하라."
  • AI 는 다음과 같은 계획을 작성합니다. "먼저 AI 에게 주제 A 를 조사하게 하고, 그다음 주제 B, 그다음 주제 C 를 조사한 후, 마지막으로 이를 결합하라."
  • 이러한 더 작은 요청 각각도 실행되기 전에 검사관에 의해 점검받는 "구멍"입니다. 이는 모든 인형이 열리기 전에 점검받는 일련의 중첩된 러시아 인형과 같습니다.

논문이 실제로 발견한 것

연구자들은 Scala 3 라는 프로그래밍 언어를 사용하여 이 시스템 (LACUNA) 을 테스트했습니다.

  • 안전성: 그들은 "검사관"이 실행되기 전에 AI 의 시도 중 약 **8.6%**를 잡아냈습니다. 이러한 시도들은 잘못된 형태이거나 AI 가 허가받지 않은 도구를 사용하려던 시도들이었습니다.
  • 재시도: AI 가 실수를 했을 때, 시스템은 다시 시도하도록 요청했습니다. 평균적으로 유효한 답변을 얻는 데 0.7 회의 시도만 필요했습니다.
  • 성능: 이 시스템은 어려운 연구 과제의 약 **27%**와 고객 서비스 과제의 **76%**를 해결했습니다. 이는 다른 표준 AI 에이전트와 거의 동일하여, 이러한 엄격한 안전 점검을 추가하는 것이 AI 를 "바보"로 만들지 않고 단지 더 안전하게 만들었음을 증명했습니다.
  • 보안성: 그들은 AI 를 속이려는 해커 (프롬프트 인젝션) 에 대해 시스템을 테스트했습니다. AI 가 "열쇠 고리" (기능) 로 제한되었기 때문에, 해커들은 AI 를 속여 시도하게 하더라도 AI 가 허용된 범위를 벗어나게 할 수 없었습니다.

함정 (한계점)

논문은 몇 가지 사실을 인정합니다.

  • 완벽하지는 않음: 검사관은 AI 가 규칙을 준수했는지 (올바른 도구를 사용했는가? 올바른 유형의 답변을 반환했는가?) 를 점검하지만, AI 가 논리적으로 올바른 일을 했는지는 점검하지 않습니다. AI 가 잘못된 수학 계산을 계산하는 완벽한 코드를 작성하면, 검사관은 이를 통과시킵니다.
  • 똑똑한 AI 가 필요함: AI 가 코드 작성에 능숙하지 않다면, 자주 거부당하게 되며 과정은 느려질 것입니다.
  • 더 느림: 시스템이 매번 코드를 멈추고 점검하고 재점검해야 하기 때문에, AI 가 단순히 버튼을 누르게 하는 것보다 더 많은 시간과 컴퓨팅 전력이 소요됩니다.

요약하자면: LACUNA 는 AI 를 버튼 누르는 사람에서 작업을 수행하기 전에 전체 계획을 승인받아야 하는 계약자로 바꿉니다. 계획이 규칙을 위반하면, 작업은 결코 시작되지 않으며, 이로 인해 시스템은 실수와 속임수로부터 안전하게 유지됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →