← 최신 논문
🤖 AI

Understanding User Experiences of Computer Use Agents: Design Space and Opportunities for Building Agent UX Prototypes

본 논문은 디자인 분류 체계를 개발하고, 전문가 연구를 통해 프로토타이핑 요구사항을 식별하며, 개발자가 다양한 에이전트 상호작용 방식을 설계하고 평가할 수 있도록 지원하는 도구인 "AgentUXlab"을 소개함으로써, 그동안 충분히 연구되지 않았던 컴퓨터 사용 에이전트의 사용자 경험 문제를 다룬다.

원저자: Jenny T. Liang, Titus Barik, Jeffrey Nichols, Eldon Schoop, Ruijia Cheng

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jenny T. Liang, Titus Barik, Jeffrey Nichols, Eldon Schoop, Ruijia Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 단순히 질문에 답하는 것을 넘어 실제로 무언가를 '수행'하는 초지능형 디지털 비서를 가지고 있다고 상상해 보세요. 이 비서는 당신의 화면을 관찰하고 당신이 원하는 바를 이해함으로써 버튼을 클릭하고, 웹사이트를 스크롤하며, 양식을 채우고, 심지어 당신의 커피를 대신 주문할 수도 있습니다. 이것은 마법이 아닙니다. 이것은 '컴퓨터 사용 에이전트(computer use agent)'라고 불리는 새로운 종류의 컴퓨터 프로그램입니다. 마치 브라우저 안에 사는 로봇 집사와 같습니다. 오랫동안 과학자들은 이 로봇들이 더 똑똑하고 빠르게 움직이도록 그들의 '두뇌'(코드와 모델)를 가르치는 데 집중해 왔습니다. 하지만 그들은 대부분 중요한 질문을 잊었습니다. "로봇 집사를 두는 것이 어떤 '기분'인가?" 하는 점입니다. 당신이 무엇을 하고 있는지 전혀 말해주지 않거나, 묻지도 않고 당신의 지갑을 가져가는 인간 비사를 원치 않는 것처럼, 당신에게는 신뢰하기 쉽고, 멈추기 쉬우며, 이해하기 쉬운 로봇 비서가 필요합니다. 이 논문은 이러한 디지털 조력자들의 '성격'과 '행동'을 파고들어, 이들이 우리를 겁주거나 우리가 수정할 수 없는 실수를 저지르지 않도록 설계하는 방법을 연구합니다.

이 연구를 이끄는 제니 T. 리앙(Jenny T. Liang)과 그녀의 팀은 우리가 이러한 강력한 에이전트들을 구축하고 있는 와중에도, 정작 이들이 우리 앞에서 어떻게 행동해야 하는지에 대한 '규칙 책'은 없다는 사실을 깨달았습니다. 이를 해결하기 위해, 그들은 '디자인 공간'(에이전트가 행동할 수 있는 모든 가능한 방식)을 지도화하고, 디자이너들이 이러한 행동들을 테스트하는 데 도움이 될 특별한 도구를 만들기 위해 세 단계의 모험을 떠났습니다.

첫째, 그들은 탐정처럼 행동하여 이미 세상에 나와 있는 11가지의 서로 다른 컴퓨터 에이전트들을 조사했습니다. 그들은 이 에이전트들을 만드는 8명의 전문가를 인터뷰했고, 20명의 일반인을 대상으로 가상의 에이전트를 테스트했습니다. 이를 통해 그들은 디자이너가 고려해야 할 21가지의 서로 다른 요소들로 구성된 거대한 '메뉴'를 만들었습니다. 이 요소들은 다음 네 가지 주요 카테지로 그룹화되었습니다:

  1. 사용자의 질의(The User's Query): 당신이 에이전트와 대화하는 방식입니다. 하나의 큰 명령을 내리나요, 아니면 대화를 주고받나요? 음성, 텍스트, 혹은 이미지를 사용하나요?
  2. 설명 가능성(Explainability): 에이전트가 자신의 작업 과정을 보여주는 방식입니다. 에이전트는 자신이 무엇을 클릭하고 있는지 알려주나요? 행동하기 전에 자신의 '생각'을 보여주나요?
  3. 사용자 제어(User Control): 당신이 에이전트를 멈추거나 변경할 수 있는 방법입니다. 일시 정지할 수 있나요? 에이전트가 막혔을 때 당신이 직접 개입하여 작업을 수행할 수 있나요?
  4. 멘탈 모델(Mental Model): 당신이 에이전트가 무엇을 할 수 있다고 '생각'하는가입니다. 에이전트가 자신의 한계를 명확히 밝혀서 당신이 불가능한 일을 기대하지 않도록 하나요?

이 메뉴를 갖춘 후, 그들은 두 번째 질문을 던졌습니다: "우리는 실제로 이러한 아이디어들을 어떻게 '구축'하고 '테스트'할 것인가?" 에이전트를 설계하는 것은 어렵습니다. 왜냐尽管 보통 무언가를 만들려면 컴퓨터 프로그래머가 되어야 하기 때문입니다. 그래서 팀은 전문가와 일반 사용자를 포함한 12명을 추가로 인터뷰하여 어떤 종류의 도구가 이 과정을 더 쉽게 만들 수 있을지 알아냈습니다. 그들은 디자이너들에게 다섯 가지 주요 활동이 필요하다는 것을 발견했습니다: 에이전트가 할 수 있는 일 정의하기, 보여줄 정보 결정하기, 대화 방식 설계하기, 에이전트를 실행하여 어떤 일이 일어나는지 관찰하기, 그리고 문제가 생겼을 때 수정하기.

이를 해결하기 위해 그들은 AgentUXlab이라는 멋진 새로운 도구를 만들었습니다. 당신이 디자이너가 되는 비디오 게임 레벨을 상상해 보세요. 복잡한 코드를 작성하는 대신, "여기 클릭", "사용자 기다림", 또는 "계획 보여주기"와 같은 블록을 드래그 앤 드롭하여 에이전트가 어떻게 행동해야 하는지에 대한 순서도를 만듭니다. 그런 다음 "재생" 버튼을 누르면, 당신의 에이전트가 실제 웹사이트에서 커피를 주문하려고 시도하는 모습을 브라우저에서 직접 볼 수 있습니다. 만약 에이전트가 당신이 원하지 않는 물건을 사려고 한다면, "일시 정지"를 누르고 직접 개입하여 바로잡을 수 있습니다. 이 도구는 디자이너들이 자신의 에이전트에 대해 다양한 '성격'을 실험할 수 있게 해줍니다. 예를 들어, 매우 수다스러우며 허락을 구하는 에이전트와, 매우 빠르고 묵묵하게 모든 것을 처리하는 에이전트를 비교해 볼 수 있습니다.

마지막으로, 그들은 소프트웨어 엔지니어부터 에이전트를 한 번도 사용해 본 적 없는 사람까지 다양한 경험을 가진 14명을 대상으로 이 도구를 테스트했습니다. 그 결과 도구는 잘 작동했지만, 동시에 까다로운 부분들도 드러냈습니다. 예를 들어, 시각적인 '순서도'(블록)는 전체적인 그림을 보는 데는 좋았지만, 일부 사람들은 이를 작성하는 것을 혼란스러워했습니다. 반면에, 평이한 영어로 지침을 입력하는 방식은 유연했지만 때때로 너무 모호했습니다. 가장 놀라운 점은, 에이전트를 '설계하는' 사람들은 디버깅을 위해 훨씬 더 많은 정보(에이전트의 내부 생각이나 화면 세부 사항 등)를 필요로 하는 반면, 에이전트의 '사용자'들은 그 모든 노이즈를 보고 싶어 하지 않을 것이라는 사실이었습니다.

이 논문은 이러한 에이전트들을 안전하고 유용하게 만들기 위해서, 디자이너들이 이러한 다양한 상호작용 스타일 사이를 쉽게 전환할 수 있게 해주는 도구가 필요하다고 제안합니다. 이 연구가 모든 문제를 해결했다고 주장하는 것은 아닙니다. 사용자가 에이전트의 능력을 진정으로 이해하도록 만드는 법 등 여전히 큰 질문들이 남아 있습니다. 하지만 이 연구는 차세대 인류 친화적 AI 비서를 구축하려는 모든 이들을 위한 견고한 지도이자 새로운 놀이터를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →