← 최신 논문
🤖 AI

Agentic Learner with Grow-and-Refine Multimodal Semantic Memory

본 논문은 비주얼 주의 산만 패턴과 논리적 추론 오류를 별도로 인코딩하기 위해 성장 및 정제 원리를 적용하는 듀얼 스트림 메모리 프레임워크인 ViLoMem을 소개하며, 이를 통해 멀티모달 대규모 언어 모델이 궤적 기반 메모리의 한계를 극복하고 다양한 벤치마크에서 반복 오류를 줄이면서 향상된 정확도를 달성할 수 있도록 합니다.

원저자: Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간 서투른 로봇에게 그림과 수학 문제를 모두 포함하는 퍼즐을 푸는 법을 가르친다고 상상해 보세요.

현재 대부분의 이러한 로봇 (멀티모달 대규모 언어 모델이라고 불림) 은 시험을 보고 문제를 틀린 후 그 실수를 즉시 잊어버리는 학생들과 같습니다. 다음 시험에서 비슷한 문제를 보면 그들은 정확히 같은 실수를 반복합니다. 그들은 마치 한 번도 퍼즐을 본 적이 없는 것처럼 모든 문제를 처음부터 다시 풉니다.

일부 연구자들은 로봇에게 과거의 실수를 적어두는 '노트'를 제공함으로써 이를 해결하려 했습니다. 하지만 이러한 노트들은 결함이 있었습니다. 그들은 실수의 논리 부분 (예: "잘못된 공식을 사용했다") 만 기록하고 시각 부분 (예: "그림 속 잘못된 숫자를 보았다") 은 무시했습니다. 마치 교사가 학생에게 "너는 계산을 잘못했어"라고 말하지만, 학생이 그래프의 잘못된 줄을 보고 있었음을 결코 지적해주지 않는 것과 같습니다.

ViLoMem 등장: 로봇의 '이중 뇌' 기억 시스템

이 논문은 인간의 뇌가 작동하는 방식에서 영감을 받아 로봇에게 더 똑똑한 두 부분으로 구성된 기억을 제공하는 새로운 시스템인 ViLoMem을 소개합니다. 하나의 지저분한 노트 대신, ViLoMem 은 서로 협력하지만 분리되어 있는 두 가지 구별되고 전문화된 '스트림'의 기억을 사용합니다.

1. 두 가지 기억 스트림

로봇의 뇌를 두 명의 서로 다른 사서로 생각해 보세요:

  • 시각 사서 (시각 기억): 이 사서는 로봇이 보는 것만 관심을 가집니다. 로봇이 반짝이는 금속 구체를 고무 공으로 오인하거나 차트의 아주 작은 숫자를 잘못 읽는다면, 이 사서는 다음과 같은 규칙을 적어냅니다: "반짝이는 물체를 볼 때는 고무가 아닌 금속처럼 빛을 반사하는지 확인하라." 또한 중요한 세부 사항을 놓치지 않도록 미래의 그림에 정확한 위치를 보여주는 작은 '히트 맵' (마치 스포트라이트처럼) 을 그립니다.
  • 논리 사서 (논리적 기억): 이 사서는 생각하는 것만 관심을 가집니다. 로봇이 잘못된 수학 공식을 사용하거나 숫자를 잘못 더한다면, 이 사서는 다음과 같은 규칙을 적어냅니다: "기억하라, 삼각형의 넓이는 변들을 단순히 더하는 것이 아니라 ½ × 밑변 × 높이임을."

2. 학습 방법: '성장 및 정제' 사이클

이 시스템은 연습과 교정의 지속적인 루프로 작동합니다:

  1. 시도: 로봇은 현재 기억을 사용하여 문제를 해결하려 합니다.
  2. 확인: '검증자' (엄격한 교사 같은 역할) 가 답을 확인합니다.
  3. 진단: 로봇이 틀렸다면, 시스템은 질문합니다: "이것은 보는 실수였는가, 생각하는 실수였는가?"
    • 만약 보는 실수였다면, 시각 사서가 규칙을 업데이트하고 다음을 위한 새로운 스포트라이트를 그립니다.
    • 만약 생각하는 실수였다면, 논리 사서가 규칙을 업데이트합니다.
  4. 정리: 시스템은 혼란을 피할 만큼 똑똑합니다. 로봇이 같은 실수를 두 번 저지르면 새로운 메모 두 장을 작성하지 않고, 기존 메모를 더 명확하게 정제합니다. 이는 기억이 너무 커지고 혼란스러워지는 것 (재앙적 망각이라고 불리는 문제) 을 방지합니다.

3. 이것이 중요한 이유 (결과)

연구자들은 수학, 과학, 그리고 실제 세계의 이미지를 포함하는 여섯 가지 유형의 어려운 퍼즐에 대해 이 시스템을 테스트했습니다.

  • 결과: ViLoMem 을 사용한 로봇들은 이러한 문제를 해결하는 데 훨씬 더 능숙해졌습니다. 그들은 그림을 잘못 읽는 것과 같은 같은 시각적 실수와 잘못된 공식을 사용하는 것과 같은 같은 논리적 실수를 반복하지 않게 되었습니다.
  • 비유: 로봇이 삼각형의 넓이를 계산하려 한다고 상상해 보세요.
    • ViLoMem 없이: 그것은 삼각형의 잘못된 변을 볼 수 있습니다 (시각적 실수) 그리고 잘못된 공식을 사용할 수 있습니다 (논리적 실수). 실패하고, 잊어버리고, 다시 실패합니다.
    • ViLoMem 으로: 한 번 실패한 후, 시각 사서는 말합니다: "다음에는 '5'가 아니라 '12'라고 표시된 변을 보아라." 논리 사서는 말합니다: "다음에는 ½ 을 곱하는 것을 기억하라." 다음 시도에서 로봇은 올바른 곳을 보고 올바른 수학을 사용하여 정답을 맞춥니다.

4. '크로스 트레이닝' 보너스

가장 멋진 발견 중 하나는 이 기억 시스템이 휴대 가능하다는 것입니다. 연구자들은 훨씬 더 크고 똑똑한 로봇의 '노트'에서 더 작고 덜 강력한 로봇이 배울 수 있음을 보여주었습니다. 마치 최상위권 학생의 공부 노트를 읽는 하급생이 스스로 실수를 겪는 모든 고된 과정을 거치지 않고도 즉시 더 똑똑해지는 것과 같습니다.

요약하자면:
ViLoMem 은 AI 가 "내가 본 것"과 "내가 생각한 것"을 분리함으로써 실수에서 배우도록 가르치는 시스템입니다. 이 두 가지 유형의 학습을 분리되고 조직화된 파일에 보관함으로써 AI 는 같은 어리석은 실수를 반복적으로 저지르지 않게 되어 더 신뢰할 수 있고 정확한 문제 해결사가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →