← 최신 논문
🤖 AI

Tactile: Giving Computer-Using Agents Hands and Feet

Tactile은 이질적인 UI 증거를 의미론적이고 검증 가능한 액션 객체로 변환함으로써 컴퓨터 사용 에이전트를 강화하는 오픈 소스 툴 레이어로, 취약한 좌표 기반 상호작용을 여러 모델에 걸쳐 작업 성공률을 크게 향상시키는 신뢰할 수 있는 관찰-접지-행동-검증 루프로 대체합니다.

원저자: Yong Liu, Zhenyi Zhong, Zhanpeng Shi

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yong Liu, Zhenyi Zhong, Zhanpeng Shi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 컴퓨터 사용법을 가르치고 있다고 상상해 보세요. 지금 대부분의 로봇은 두꺼운 안개가 낀 고글을 쓰고 눈을 가린 채 자동차를 운전하려는 사람과 같습니다. 그들은 화면을 오직 평면적인 사진(스크린샷)으로만 볼 수 있습니다. 버튼을 클릭하려면 "좌표 450, 200을 클릭해!"라고 외치며 정중앙을 맞추기를 기도하는 것처럼, 정확한 X와 Y 좌표를 추측해야만 합니다. 만약 버튼이 움직이거나 화면이 조금이라도 바뀌면, 로봇은 혼란에 빠져 충돌하고 맙니다. 이것이 현재 "컴퓨터 사용 에이전트(computer-use agents)"의 상태입니다. 그들은 똑똑하지만, 사진 한 장에 의존해 어둠 속에서 작업하느라 손재주가 서툽니다.

하지만 만 만약 컴퓨터가 로봇에게 직접 자신의 비밀을 속삭여 줄 수 있다면 어떨까요? 현대의 운영체제에는 이미 시각 장애인을 위한 스크린 리더처럼, 인간의 도움을 위해 설계된 숨겨진 정보 계층이 존재합니다. 이 계층은 버튼이 무엇인지, 어떤 기능을 하는지, 그리고 지금 누를 준비가 되었는지 정확히 알려줍니다. 과학자들이 던지는 핵심 질문은 이것입니다. 우리가 로봇 에이전트에게 이 비밀스러운 계층으로 통하는 직통 라인을 제공할 수 있을까요? 만약 가능하다면, 이는 로봇이 단순히 화면을 "보는" 것을 넘어 화면을 실제로 "이해하게" 된다는 것을 의미하며, 회의 일정을 잡거나 파일을 정리하는 것과 같은 실제 업무를 훨씬 더 잘 수행하게 될 것입니다.


로봇에게 손과 발을 달아주기: TACTILE 프로젝트

새로운 오픈 소스 도구인 TACTILE을 만나보세요. 이 도구는 컴퓨터를 사용하는 에이전트를 위한 번역기이자 초능력을 가진 손 역할을 합니다. TACTILE의 연구진은 로봇이 점점 똑똑해지고 있음에도 불구하고, 컴퓨터에서 실제로 무언가를 수행하는 능력은 여전히 불안정하다는 점에 주목했습니다. 로봇들은 종종 컴퓨터 화면을 하나의 그림처럼 취급합니다. 화면을 보고, 찌를 위치를 추측한 뒤, 운 좋게 맞기를 바랄 뿐입니다. TACTILE은 로봇에게 컴퓨터의 내부 "접근성(accessibility)" 시스템에 직접 연결되는 통로를 제공함으로써 이 게임의 판도를 바꿉니다. 이는 인간의 장애를 돕기 위해 사용되는 바로 그 시스템입니다.

기존의 방식이 도서관의 선반 사진을 흐릿하게 보고 특정 책을 찾는 것과 같다면, TACTILE은 로봇에게 "당신이 찾는 책은 '우주의 역사'이며, 현재 3번 선반에 있고, 하드커버 형태이며, 꺼낼 수 있습니다"라고 적힌 마법 같은 목록을 주는 것과 같습니다. 이는 복잡하고 시각적인 화면의 혼돈을 로봇이 실제로 만지고 사용할 수 있는 깔끔하고 조직된 목록으로 바꾸어 놓습니다.

TACTILE의 작동 원리: "단서의 사다리"

이 논문은 "운영 사다리(operating ladder)"라고 불리는 영리한 전략을 소개합니다. 로봇에게 "보는 것(화면 보기)"과 "읽는 것(컴퓨터의 내부 데이터 사용)" 중 하나를 강요하는 대신, TACTILE은 로봇이 최선의 답을 찾기 위해 단서의 사다리를 오르게 합니다.

  1. 최상단 칸 (접근성): 만약 컴퓨터가 "여기에 '전송'이라는 이름의 버튼이 있고, 지금 누를 수 있는 상태입니다"라고 말한다면, TACTILE은 즉시 그 정보를 가져옵니다. 이것은 가장 강력하고 신뢰할 수 있는 단서입니다.
  2. 중간 칸 (OCR): 만약 컴퓨터가 특정 부분에 대해 침묵한다면, TACTILE은 화면을 보고 OCR(광학 문자 인식)을 통해 텍스트를 읽어낸 뒤, "좋아, 여기 '전송'이라는 단어가 보이네"라고 판단합니다. 이는 좋은 백업이지만, 내부 데이터만큼 정밀하지는 않습니다.
  3. 최하단 칸 (시각적 폴백): 만약 컴퓨터가 완전히 불투명하다면(예: 비디오 게임이나 커스텀 그래픽), TACTILE은 예전 로봇들처럼 단순히 사진을 보고 좌표를 추측하는 방식으로 돌아갑니다.

마법은 TACTILE이 단 하나만을 선택하는 것이 아니라, 이들을 결합한다는 데 있습니다. TACTILE은 컴퓨터의 "속삭임"을 선호하지만, 컴퓨터가 말을 듣지 않을 때는 "보는 것"으로 전환할 줄도 압니다. 또한 모든 단계에 대한 상세한 일지를 작성하여, 만약 무언가 잘못되었을 때 로봇이 무엇을 보았고, 무엇을 추측했으며, 어디에서 막혔는지 정확히 되짚어 볼 수 있게 합니다.

연구 결과

연구진은 96가지의 다양한 컴퓨터 작업(단순 클릭부터 복잡한 워크플로우까지)을 대상으로 네 가지 유형의 AI 에이전트(Codex, Claude Code, OpenCode, Goose)를 사용하여 TACTILE을 테스트했습니다. 결과는 유망했지만, 모든 문제를 해결하는 마법의 치료제는 아니었습니다.

TACTILE을 추가했을 때, 로봇들의 작업 완료율은 눈에 띄게 향상되었습니다. Codex 에이전트의 경우, 전체 성공률이 **41.1%**에서 **50.0%**로 상승했습니다. 컴퓨터가 친절하게 내부 비밀을 공유하는 작업(접근성 최적화 작업)에서는 개선 폭이 더 컸는데, 성공률이 **45.2%**에서 **55.3%**로 올랐습니다. 컴퓨터가 비밀을 숨기는 더 어려운 작업에서도 로봇들은 **27.8%**에서 **33.3%**로 성능이 향상되었습니다.

이 연구는 로봇에게 구조화된 "손으로 만질 수 있는" 계층에 접근 권한을 주는 것이 훨씬 더 신뢰할 수 있는 결과를 만든다는 것을 시사합니다. 이는 우리에게 더 똑똑한 뇌(더 나은 AI 모델)뿐만 아니라, 그 뇌가 세상과 의미 있게 상호작용할 수 있게 해주는 더 나은 몸(실행 도구)도 필요하다는 것을 증명합니다.

TACTILE이 아닌 것

TACTILE이 하지 못하는 일을 명시하는 것도 중요합니다. TACTILE은 로봇이 화면을 봐야 할 필요성을 대체하지 않습니다. 때때로 컴퓨터의 내부 데이터는 깨져 있거나, 누락되었거나, 그냥 틀릴 수도 있기 때문입니다. 그런 경우 TACTILE은 시각적 단서로 돌아가는 법을 알고 있습니다. 또한, 이는 로봇에게 어떻게 생각할지를 가르치는 "학습된" 정책이 아닙니다. 그것은 로봇의 기존 생각을 실행하기 쉽게 만들어주는 "도구 계층"입니다. 연구진은 이 결과가 예비적인 단계임을 강조하며, TACTILE이 큰 진전이긴 하지만 에이전트를 완벽하게 만들기 위해서는 여전히 할 일이 많다고 말합니다.

왜 중요한가

논문은 유쾌하면서도 심오한 아이디어로 끝을 맺습니다: "에이전트가 사용하기 좋은 소프트웨어는 인간이 접근하기 쉬운 소프트웨어여야 한다." 만약 우리가 로봇이 사용하기 쉬운 컴퓨터를 만든다면, 우리는 또한 장애를 가진 인간이 사용하기 더 쉬운 컴퓨터를 만드는 것이기도 합니다. 접근성 데이터를 공유 인프라로 다룸으로써, TACTILE은 로봇을 돕는 것과 인간을 돕는 것이 결국 같은 목표가 될 수 있음을 보여줍니다. 이는 컴퓨터 화면을 평면적이고 혼란스러운 그림에서, 만지고 이해하고 검증할 수 있는 객체들로 가득 찬 세계로 탈바꿈시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →