cotomi Act: Learning to Automate Work by Watching You
이 논문은 적응형 관찰과 최상위 N 선택을 통해 최첨단 수준의 자율적 작업 수행을 달성하면서 동시에 사용자의 행동을 수동적으로 관찰하고 편집 가능한 산출물로 추상화함으로써 지속적인 조직 지식을 학습하는 브라우저 기반 에이전트인 cotomi Act 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능 cotomi Act라는 이름의 새롭고 놀라울 정도로 똑똑한 인턴이 있다고 상상해 보세요. 지시 목록을 받아서 일을 끝내면 모든 것을 잊어버리는 다른 인턴들과 달리, cotomi Act 는 특별한 능력을 가지고 있습니다: 당신을 지켜보며 배웁니다.
이 논문은 그 특별한 능력을 단순한 개념으로 나누어 다음과 같이 설명합니다:
1. 문제: "망각증" 인턴
당신을 대신해 웹 작업을 수행하려는 대부분의 컴퓨터 프로그램은 그 망각증 인턴과 같습니다. 그들은 단일하고 명확한 지시 (예: "이 신발의 가격을 찾아보세요") 를 따르는 데는 매우 능숙하지만, 당신 회사의 비밀은 모릅니다. 그들은 다음을 알지 못합니다:
- 보통 누가 이러한 요청을 승인하나요?
- 당신의 팀이 사용하는 특정 전문 용어는 무엇인가요?
- 어떤 작업이 이미 반쯤 완료되었나요?
이러한 "내부 지식"이 부족하기 때문에, 그들은 질문을 너무 많이 하여 (당신의 속도를 늦추거나) 또는 잘못 추측하여 (실수를 유발합니다).
2. 해결책: 두 가지 초능력
저자들은 cotomi Act 를 이 문제를 해결하기 위해 두 가지 뚜렷한 "근육"으로 구축했습니다:
근육 A: "슈퍼 러너" (실행)
이 시스템 부분은 혼란에 빠지지 않고 실제로 웹에서 작업을 수행하도록 설계되었습니다.
- 비유: 마라톤을 달린다고 상상해 보세요. 시작선 이후로 취한 모든 단계를 기억하려 한다면 뇌가 터질 것입니다. 당신은 단지 풍경의 변화 (예: "방금 물 공급소를 지났습니다") 만 기억하면 됩니다.
- 작동 방식: AI 에게 과거에 클릭한 모든 기록이라는 방대하고 지루한 역사를 제공하는 대신, cotomi Act 는 "게으른" 전략을 사용합니다. 현재 화면에 있는 것만 주의 깊게 살펴보고 마지막 단계로부터의 변화 를 요약합니다. 이렇게 하면 AI 의 뇌가 가볍고 빠르게 유지됩니다.
- 결과: 실제 웹 작업을 비디오 게임처럼 만든 까다로운 테스트인 "WebArena"에서, 이 "슈퍼 러너"는 작업의 80.4% 를 정확히 수행했습니다. 이는 실제로 평균 인간 (동일한 테스트에서 78.2% 정확도) 보다 더 좋은 성과입니다.
근육 B: "그림자 필경사" (학습)
이 부분은 배경에서 당신이 일하는 모습을 지켜봅니다.
- 비유: 조용히 당신 뒤에 앉아 웹을 서핑하는 모습을 지켜보는 필경사를 상상해 보세요. 필경사는 단순히 화면의 원시 비디오를 기록하는 대신 (이는 messy 하고 방대함), 메모를 작성하여 유용한 도구로 변환합니다:
- 작업 보드: 당신이 작업 중인 것들의 목록.
- 위키: 팀이 일을 처리하는 방식의 규칙집 (예: "우리는 항상 인쇄를 위해 Vendor X 를 사용합니다").
- 타임라인: 최근 활동의 캘린더.
- 반전: 이것은 비밀 일기가 아닙니다. 공유 작업 공간입니다. 필경사가 쓴 내용을 확인하고, 틀리면 수정하거나 메모를 추가할 수 있습니다. AI 는 당신의 세계를 이해하기 위해 이 메모들을 읽습니다.
3. 어떻게 함께 작동하는가
이 논문은 "관찰 → 추출 → 행동" 이라는 사이클을 설명합니다.
- 관찰: 당신이 평소처럼 웹을 서핑합니다. "그림자 필경사"가 지켜봅니다.
- 추출: 시스템은 당신의 messy 한 서핑을 정리된 메모 (예: "하드웨어 주문 방법" 가이드) 로 변환합니다.
- 행동: 나중에 AI 에게 "하드웨어를 주문하세요"라고 요청하면, AI 는 추측하지 않습니다. 대신 당신으로부터 배운 "주문 방법" 메모를 보고, 그 단계를 따라 작업을 완료합니다.
4. 증명
연구자들은 실제 작업의 시뮬레이션인 "프록시" 실험으로 이를 테스트했습니다.
- 발견: AI 가 당신의 행동에 대한 메모가 없을 때, 실패율이 높았습니다.
- 개선: AI 가 당신의 작업 방식에 대한 메모 (행동 지식) 를 더 많이 수집할수록, 성공률은 크게 향상되었습니다.
- 한계: 흥미롭게도, AI 가 단순히 당신의 화면에 대한 원시적이고 messy 한 비디오 로그를 외우려 시도했다면, 처음에는 오히려 성능이 나빠졌습니다. 정보의 요약과 정리를 위해 "그림자 필경사"가 필요했습니다.
5. 라이브 데모
이 논문에서는 사람들이 이를 직접 시도해 볼 수 있는 라이브 데모를 언급합니다. 그들은 다음을 할 수 있습니다:
- AI 에게 작업 (예: 컨퍼런스 마감일 찾기) 을 요청합니다.
- AI 가 그들의 습관에 대해 무엇을 배웠는지 확인하기 위해 "공유 작업 공간"을 살펴봅니다.
- 보드의 작업을 수정하고, AI 가 즉시 그 새로운 정보를 사용하여 올바른 작업을 시작하는 모습을 지켜봅니다.
요약
cotomi Act는 단순히 지시를 따르는 브라우저 도우미가 아닙니다. 그것은 당신의 작업을 지켜보고, 당신의 습관을 공유된 규칙집으로 변환하며, 그 규칙집을 사용하여 더 좋고 신뢰할 수 있는 동료로 거듭납니다. 이 연구는 빠르고 똑똑한 실행과 일상적인 행동으로부터의 학습을 결합함으로써, AI 가 복잡한 웹 작업에서 실제로 인간을 능가할 수 있음을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.