← 최신 논문
🤖 machine learning

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

본 논문은 기존 순차적 웹 에이전트 루프에 비해 상당한 속도 향상과 정확도 개선을 달성하기 위해 자연어 작업을 실행 가능한 코드로 변환하는 플래너, 스케줄러, 불변성 강제 프로토콜로 구성된 에이전트 JIT 컴파일을 소개합니다.

원저자: Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 "타코 벨에서 가장 싼 타코를 주문해 줘"와 같은 복잡한 용건을 수행하도록 시킨다고 상상해 보세요.

현재 대부분의 로봇은 매우 조심스럽고 느린 인간 보조원처럼 작동합니다. 화면을 보고, 다음에 무엇을 해야 할지 초지능적인 두뇌 (AI) 에게 물어보고, 버튼을 클릭한 뒤 화면이 바뀌기를 기다렸다가, 다시 두뇌에게 물어보고, 단어를 입력한 뒤 기다렸다가, 또 다시 물어보는 식입니다. 이 "보고-생각하고-행동하기" 루프가 반복적으로 발생합니다. 이는 느리고 비용이 많이 들며 (AI 두뇌를 물을 때마다 비용이 발생하기 때문), 화면이 약간만 달라져도 로봇이 잘못된 것을 클릭할 수 있어 실수가 발생하기 쉽습니다.

이 논문은 이러한 로봇을 더 빠르고 똑똑하게 만드는 새로운 방식을 소개합니다. 이를 에이전트 JIT 컴파일이라고 합니다. 이는 로봇이 움직이기 전에 "단계별 지시 설명서"에서 "맞춤형 소프트웨어 스크립트 작성"으로 전환하는 것과 같습니다.

다음은 이를 세 가지 간단한 부분으로 나누어 설명한 것입니다:

1. "비행 전" 계획자 (JIT-Planner)

시스템은 매 단계마다 AI 에게 "다음에 무엇을 해야 하나요?"라고 묻는 대신, 먼저 당신의 요청 ("가장 싼 타코 주문하기") 을 받아 문제를 해결할 수 있는 여러 가지 다른 **컴퓨터 프로그램 (코드)**을 즉시 생성합니다.

  • 비유: 뉴욕에서 보스턴으로 운전해야 한다고 가정해 보세요.
    • 구식 방식: 주유소마다 멈춰서 현지인에게 "보스턴은 어느 방향인가요?"라고 물어봅니다. 1 마일 운전하고 다시 물어보고, 또 1 마일 운전하고 다시 물어봅니다.
    • 신식 방식: 출발하기 전에 지도 앱에게 세 가지 다른 경로를 생성하도록 요청합니다. 앱은 교통 상황, 도로 상태, 거리를 확인한 뒤 절대적으로 가장 빠른 경로를 선택하여 자동차 내비게이션 시스템에 GPS 좌표를 한 번 입력합니다. 그 후 당신은 그냥 운전하면 됩니다.
  • 마법 같은 점: 시스템은 생성된 경로들이 논리적인지 확인합니다 (예: "장바구니 담기"를 클릭하기 전에 "주문하기"를 클릭할 수는 없음). 그리고 가장 적은 양의 "두뇌 능력" (AI 호출) 과 시간을 사용하는 경로를 선택합니다.

2. "교통 경찰" (JIT-Scheduler)

로봇이 계획을 세우면, 이를 어떻게 실행할지 결정해야 합니다. 모든 것을 하나씩 수행해야 할까요? 세 가지를 동시에 시도해야 할까요? 아니면 같은 작업을 세 번 병렬로 시도하고 먼저 완료된 것만 사용하면 될까요?

  • 비유: 파티를 위해 음식을 주문한다고 가정해 보세요.
    • 직렬 (하나씩): 한 식당에 전화를 걸어 답장을 기다린 뒤, 다음 식당에 전화하고 기다립니다.
    • 병렬: 세 개의 식당에 동시에 전화를 겁니다.
    • 헤징 (Hedging): 세 개의 식당에 전화를 걸지만, 가장 먼저 전화를 받은 곳의 답변만 중요하게 생각합니다. 하나가 느리더라도 기다리지 않고, 빠른 곳의 답변만 받습니다.
  • 마법 같은 점: 시스템은 특정 작업을 보고 과거 데이터를 활용해 어떤 전략이 가장 좋은지 추측합니다. 작업이 단순하면 하나씩 진행합니다. 작업이 까다롭고 멈출 가능성이 있다면, 빠르게 완료되도록 여러 경로를 동시에 시도 (헤징) 합니다. 가장 많은 시간을 절약하는 전략을 선택합니다.

3. "규칙집" (불변성 강제 프로토콜)

로봇이 충돌하거나 잘못된 버튼을 클릭하지 않도록 하기 위해, 로봇이 사용하는 모든 도구 ("버튼 클릭" 또는 "텍스트 입력" 등) 에는 엄격한 규칙집이 함께 제공됩니다.

  • 비유: 자동판매기를 생각해 보세요.
    • 구식 방식: 무작위로 버튼을 누릅니다. 때로는 기계가 비어있을 때 "간식" 버튼을 누르면 아무 일도 일어나지 않습니다.
    • 신식 방식: 기계에는 센서가 있습니다. "기계가 켜져 있나요? 안에 돈이 들어있나요? 문이 닫혀 있나요?"를 확인합니다. 조건이 충족되지 않으면 기계는 버튼 누르기를 거부합니다.
  • 마법 같은 점: 로봇이 코드를 실행하기 전에 시스템은 이러한 규칙을 확인합니다. 만약 계획이 "장바구니"가 비어있을 때 "주문하기"를 시도한다면, 시스템은 로봇이 시작하기 전에 그 실수를 미리 잡아내어 오류와 시간 낭비를 방지합니다.

결과

저자들은 음식 배달, 이메일, 쇼핑 사이트 등 다섯 가지 다른 웹사이트에서 이를 테스트했습니다. 결과는 인상적이었습니다:

  • 속도: 그들의 새로운 방법은 표준적인 "매 단계마다 AI 에게 묻기" 방법보다 10 배 더 빠릅니다.
  • 정확도: 정확도도 28% 더 높아서, 실제로 올바른 타코를 얻을 확률이 28% 더 높았습니다.
  • 비교: 다른 고급 AI 에이전트 (OpenAI 나 Anthropic 의 에이전트 등) 와 비교해도 그들의 방법은 2.4 배 더 빠르고 9% 더 정확했습니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: AI 에게 차를 단계별로 운전하게 하지 마십시오. 대신 AI 가 전체 운전 경로를 스크립트로 작성하게 하고, 해당 경로가 안전한지 확인한 뒤, 운전하는 가장 빠른 방법을 선택하여 스크립트만 실행하게 하십시오. 이는 느리고 더듬거리는 대화를 매끄럽고 고속의 실행으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →