← 최신 논문
🤖 machine learning

Mem-W: Latent Memory-Native GUI Agents

Mem-W는 외부 기호 기억과 내부 표현 간의 불일치를 제거하여 웹 및 모바일 벤치마크 전반에 걸친 장기 과제 수행 능력을 크게 향상시키기 위해, 역사적 기억과 작업 기억을 컴팩트한 토큰으로 변환하여 모델의 잠재적 문맥에 직접 통합하는 새로운 유형의 GUI 에이전트를 도입합니다.

원저자: Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 Mem-W 논문에 대한 설명을 일상적인 비유와 함께 간단한 개념으로 나누어 정리한 것입니다.

큰 문제: "수첩" 대 "뇌"

복잡한 비디오 게임 세계 (웹사이트나 모바일 앱과 같은) 를 로봇이 탐색하도록 가르치려 한다고 상상해 보세요. 로봇은 다음과 같은 것들을 기억해야 합니다. "세 화면 전에 잘못된 버튼을 세 번 클릭했다"거나 "이전 게임에서 이런 모양의 메뉴를 본 적이 있다"는 것들입니다.

옛 방식 (수첩):
대부분의 현재 AI 에이전트는 물리적인 수첩을 들고 있는 학생처럼 작동합니다. 무언가를 기억해야 할 때, 멈추고 수첩에 요약 (예: "사용자가 신발을 사고 싶어 했지만 장바구니가 비어 있었다") 을 적어 넣고, 다시 읽어 본 뒤 그 텍스트를 이용해 다음 행동을 결정하려 합니다.

  • 결함: 이는 마치 생각을 영어에서 프랑스어로 번역해 적어 둔 뒤, 다시 영어로 번역해 그리고 나서 그 내용을 생각하는 것과 같습니다. 느리고 투박하며 원래 감정의 뉘앙스를 잃을 수 있습니다. 로봇은 자신의 과거를 사용할 수 있게 하기 위해 끊임없이 "사람이 읽을 수 있는 메모"로 번역하고 있는 것입니다.

Mem-W 해결책 (뇌):
이 논문의 저자들인 Mem-W는 말합니다. "왜 번역을 해야 하지?"
메모를 쓰는 대신 Mem-W 는 로봇의 전체 역사를 원시적이고 연속적인 전기 신호 ("잠재 토큰"이라고 함) 로 변환하여 로봇의 뇌에 직접 적합시킵니다. 이는 로봇이 수첩이 필요 없는 것과 같습니다. 로봇은 단순히 현재 사고 과정의 일부로서 기억을 느끼기만 하면 됩니다.


Mem-W 의 작동 원리: "기억 직조자"

Mem-W 를 두 가지 다른 실을 가져와 로봇이 입을 수 있는 단일하고 매끄러운 직물로 엮어내는 대장 직공으로 상상해 보세요.

1. 두 가지 실의 종류

로봇은 두 가지 종류의 기억이 필요합니다.

  • 작동 기억 ("지금" 실): 현재 작업에서 지난 몇 초 동안 일어난 일입니다. (예: "방금 아래로 스크롤을 내리고 빨간 버튼을 보았다.")
  • 경험 기억 ("과거 경험" 실): 로봇이 이전에 수행했던 다른 작업에서 일어난 일입니다. (예: "이전에 빨간 버튼을 본 적이 있는데, 그것은 '삭제' 버튼이었으니 조심해야 한다.")

2. 마법 압축기 ("방아")

과거에는 이 두 가지 실이 별도의 상자에 보관되었습니다. Mem-W 는 압축기를 도입합니다.

  • 작업의 길고 지저분한 비디오를 가져와 작고 밀도 높은 "기억 칩"으로 축소하는 기계를 상상해 보세요.
  • 비디오를 텍스트로 요약하는 것이 아니라, 로봇의 뇌가 즉시 이해할 수 있는 압축된 신호로 변환합니다.
  • 중요한 점은 "지금" 실과 "과거 경험" 실을 동일한 기계로 압축한다는 것입니다. 이는 두 가지가 동일한 언어로 소통함을 의미합니다.

3. 직조 ("매끄러운 직물")

실들이 이러한 작은 칩으로 압축되면, Mem-W 는 이를 로봇의 현재 화면 뷰와 함께 엮습니다.

  • 결과: 로봇은 화면을 볼 때 "현재 화면"과 "옛 메모"를 따로 보지 않습니다. 대신 "현재 화면 + 과거 교훈 + 현재 진행 상황"이 하나의 유동적인 사고로 섞여 있는 것을 봅니다.

학습 방법: "하며 배우기"

이 논문의 저자는 이 직공이 작동하는 방법을 가르치기 위해 두 단계의 훈련 과정을 설명합니다.

  1. 1 단계: "그림자" 교사 (자기 증류)

    • 로봇은 인간이 작업을 수행하는 길고 완벽한 비디오를 보여줍니다.
    • 로봇은 오직 압축된 기억 칩만을 사용하여 인간을 모방하려 합니다.
    • 로봇이 실수를 하면, 가장 중요한 세부 사항 (예: "빨간 버튼을 클릭하지 마라") 이 작은 칩에 보존되도록 "압축" 방식을 조정하는 법을 배웁니다. 이는 마치 학생이 책의 핵심 줄거리만 기억하여 전체 책을 암기하려 한 뒤, 이야기 내용을 올바르게 이해했는지 확인하는 것과 같습니다.
  2. 2 단계: "결과" 코치 (결과 인식 감독)

    • 이제 로봇은 스스로 작업을 해결하려 시도합니다.
    • 성공하면 시스템은 "좋아! 그 기억 칩들을 그대로 유지해."라고 말합니다.
    • 실패하면 시스템은 "나빠! 그 기억 칩들이 함정을 피하는 데 도움이 되지 않았어. 바꿔."라고 말합니다.
    • 이는 로봇이 성공으로 이어지는 것실패로 이어지는 것을 구체적으로 기억하도록 가르쳐 잡음을 걸러냅니다.

결과: 왜 중요한가

이 논문은 Mem-W 를 네 가지 다른 "세계" (웹사이트 및 모바일 앱) 에서 테스트했습니다. 그 결과는 다음과 같습니다.

  • 더 빠르고 똑똑해짐: "텍스트로 번역" 단계를 건너뛰면서 로봇은 실수를 줄이고 작업을 더 자주 완료했습니다.
  • 작은 뇌에서도 작동함: 더 작고 덜 강력한 AI 모델을 사용하더라도 Mem-W 를 추가하면 이 메모리 시스템이 없는 훨씬 큰 모델만큼 (또는 그 이상으로) 잘 수행했습니다.
  • "최적점": 약 5 개의 과거 경험을 검색하고 현재 역사를 압축하는 것이 완벽한 균형이라는 것을 발견했습니다. 기억이 너무 많으면 속도가 느려지고, 너무 적으면 망각하게 됩니다.

결론

Mem-W는 AI 에이전트가 기억하는 새로운 방식입니다. 그들이 무엇을 했는지 일기를 쓰는 대신, 전체 역사를 뇌가 유창하게 구사하는 모국어로 변환합니다. 이를 통해 과거의 실수와 현재의 진행 상황을 동시에 학습하여 인터넷과 스마트폰과 같은 복잡한 디지털 세계를 탐색하는 능력이 훨씬 향상됩니다.

간단히 말해: Mem-W 는 AI 가 일기를 쓰게 하는 것을 멈추고, AI 가 자신의 모국어로 꿈을 꾸게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →