← 최신 논문
💻 computer science

Agent-Computer Observation Interfaces Enable Dynamic Computer Use

이 논문은 연속적이고 적응적인 관찰(오디오 및 시각적 내레이션 포함)을 이산적인 행동으로부터 분리함으로써, 재학습 없이도 동적인 작업에서 컴퓨터 사용 에이전트의 성능을 크게 향상시키는 모델 불가지론적 인지 계층인 에이전트-컴퓨터 관찰 인터페이스(AOI)를 소개한다.

원저자: Bojie Li, Noah Shi

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bojie Li, Noah Shi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"눈 멀고 귀 먹은" 로봇 문제

당신이 로봇에게 컴퓨터 사용법을 가르치려 한다고 상상해 보세요. 현재 우리가 이 작업을 수행하는 방식은 로봇에게 3~5초마다 단 한 장의 사진을 찍는 카메라를 주는 것과 같습니다. 사진을 찍는 사이의 시간 동안 로봇은 완전히 눈이 먼 상태가 됩니다.

만약 영상이 재생되거나, 슬라이드가 움직이거나, 팝업 알림이 사진이 찍히는 찰나의 순간에 나타났다 사라진다면, 로봇은 그것을 절대 볼 수 없습니다. 게다가 로봇은 완전히 귀도 먹은 상태입니다. 화면에서 회의가 진행 중이고 누군가 "4월 28일로 달력을 업데이트해 주세요"라고 말한다면, 로봇은 아무것도 듣지 못합니다. 로봇은 그저 달력의 정지된 이미지만을 볼 뿐입니다.

논문에서는 이를 "표준 루프(Standard Loop)"라고 부르며, 이는 로봇이 움직이거나 소리 나는 것을 처리할 수 없게 만듭니다.

해결책: "에이전트-컴퓨터 관찰 인터페이스" (AOI)

저자들은 AOI라고 불리는 새로운 소프트웨어 계층을 구축했습니다. 이것을 컴퓨터 화면과 로봇의 뇌 사이에 서 있는 초감각적인 조수라고 생각하세요.

로봇이 사진을 찍기를 기다리는 대신, 이 조수는 화면을 끊임없이 지켜보고 스피커의 소리를 듣습니다. 하지만 여기서 영리한 점은, 이 조수가 설계 단계부터 게으르다는 것입니다.

  • 화면이 정지 상태(예: 빈 문서)이고 소리가 없다면, 조수는 아무것도 하지 않습니다. 에너지를 낭비하지 않습니다.
  • 무언가 변화가 생기거나(영상이 시작되거나, 슬라이드가 넘어가거나), 누군가 말을 하면 조수는 즉시 깨어납니다. 변화된 장면의 스냅샷을 잡고, 본 것을 요약하여 기록하며, 들은 내용을 받아 적습니다.

그러고 나서 이 "이야기"를 로봇에게 전달합니다. 로봇을 다시 학습시킬 필요는 없습니다. 그저 더 풍부한 보고서를 받게 될 뿐입니다: "여기 새로운 슬라이드가 있고, 방금 화자가 말한 내용은 이렇습니다."

조수의 세 가지 초능력

AOI는 마치 사건을 해결하는 탐정처럼 세 가지 특정 도구를 사용하여 작동합니다.

  1. "키프레임(Keyframe)" 포착기: 로봇에게 영상의 흐릿한 사진 수천 장을 보내는 대신, 이 도구는 장면이 실제로 변하는 특정 순간(예: 새로운 슬라이드가 나타날 때)만을 포착합니다. 지루하고 정지된 부분은 걸러냅니다.
  2. "볼륨" 리스너: 이 도구는 소리가 날 때만 듣습니다. 방이 조용하면 조용히 있습니다. 누군가 말을 하면, 대화 내용을 즉시 텍스트로 옮깁니다.
  3. "내레이터": 이것이 가장 중요한 부분입니다. 로봇 스스로가 새로운 사진에 대해 무엇이 보이는지 짧게 설명하도록 요청됩니다. 조수는 이 설명을 가져와서 텍스트 형태로 로봇의 메모리에 저장합니다. 설령 로봇이 나중에 실제 사진을 잊어버리더라도, 무슨 일이 일어났는지에 대한 이야기는 기억하게 됩니다.

결과: "불가능"에서 "해결"로

연구진은 이 기술을 영상을 보거나, 회의를 듣거나, 팝업에 반응해야 하는 100개의 과제가 포함된 새로운 도전 과제인 DynaCU-Bench에서 테스트했습니다.

  • AOI 적용 전: 로봇들(표준 방식 사용 시)은 거의 모든 작업에서 실패했습니다. 그들은 어둠 속에 갇혀 있었습니다.
  • AOI 적용 후: 로봇들은 갑자기 훨씬 똑똑해졌습니다.
    • 오디오가 포함된 작업(회의 듣기 등)에서, 로봇들은 완전히 실패하던 상태에서 100% 성공률로 올라섰습니다.
    • 움직이는 시각 자료(이미지 캐러셀 시청 등)가 포함된 작업에서, 성공률이 엄청난 폭으로 상승했습니다(최대 48% 향상).
    • 가장 작고 "멍청한" 로봇 모델들조차 엄청난 개선을 보였으나, 여전히 모델 자체의 추론 능력에는 한계가 있었습니다.

놀라운 발견들

논문은 몇 가지 예상치 못한 사실들을 발견했습니다.

  • 사진보다 이야기가 더 중요하다: 조수가 어떤 특정 사진을 잡았는지는 중요하지 않았습니다. 마법은 조수가 그 사진을 텍스트 설명으로 바꾸어 저장했기 때문에 일어났습니다. 로봇은 단순히 사진을 응시하는 것이 아니라, 일어난 일의 역사를 "읽을" 수 있었던 것입니다.
  • 모두에게 맞는 하나의 정답은 없다: 팀은 이 기술을 다양한 로봇 모델에 적용해 보았습니다. 대부분의 경우 전체 패키지(사진 + 오디오 + 이야기)가 가장 효과적이었습니다. 하지만 한 최신 모델(Gemini 3)의 경우, 너무 많은 사진을 보내는 것이 오히려 시각 데이터 과부하로 인해 성능을 저하시켰습니다. 이는 조수를 각 로봇의 뇌에 맞춰 튜닝해야 함을 의미합니다.
  • 더 저렴하다: 조수가 추가적인 작업을 수행함에도 불구하고, 로봇은 더 나은 정보를 가졌기에 작업을 완료하는 데 더 적은 단계를 거쳤습니다. 이는 컴퓨팅 비용 절감으로 이어졌습니다.

핵심 요약

이 논문은 문제가 우리 AI 모델이 너무 멍청해서가 아니라, 우리가 그들에게 잘못된 정보를 주고 있기 때문이라고 주장합니다. 관찰(로봇이 보고 듣는 것)과 행동(로봇이 클릭하는 것)을 분리함으로써, 우리는 기존의 로봇을 처음부터 다시 만들지 않고도 현실의 역동적이고 소란스러운 컴퓨터 환경을 다루는 데 훨씬 더 똑똑하게 만들 수 있습니다.

AOI는 눈이 가려지고 귀가 먹은 사람에게 안경과 보청기를 쥐여준 뒤, 그 사람이 발을 내딛기 전에 친구가 세상의 요약을 속삭여 주는 것과 같습니다. 갑자기, 그들은 방 안을 완벽하게 헤쳐 나갈 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →