← 최신 논문
💻 computer science

Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

이 논문은 외부 도구에 의존하지 않고 VLM 이 스스로 고수준의 언어적 행동 도구를 생성하고 이를 강화학습을 통해 최적화하여 시각적 추론 능력을 향상시키는 'Lang2Act'를 제안합니다.

원저자: Yuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

Lang2Act: 그림을 보고 생각할 때, '말'로 도구를 만드는 마법

이 논문은 Lang2Act라는 새로운 인공지능 기술을 소개합니다. 이 기술은 복잡한 문서를 보고 질문에 답할 때, 기존 방식의 한계를 뛰어넘어 훨씬 더 정교하게 그림을 이해하고 추론할 수 있게 해줍니다.

쉽게 비유하자면, Lang2Act는 그림을 볼 때 '가위'나 '확대경' 같은 물리적인 도구를 사용하는 대신, '말'로 된 마법 지팡이를 만들어 스스로 문제를 해결하는 방식입니다.


1. 기존 방식의 문제점: "잘라낸 조각만 보는 실수"

기존의 인공지능 (VLM) 이 복잡한 문서나 차트를 볼 때, 필요한 정보를 찾기 위해 이미지를 잘라내거나 (Crop) 확대하는 방식을 썼습니다.

  • 비유: 마치 퍼즐을 풀 때, 정답이 있는 조각만 집어내려고 나머지 퍼즐을 다 잘라내버리는 것과 같습니다.
  • 문제: 필요한 정보를 잘라내다가, 정답에 필요한 중요한 문맥 (예: 옆에 있는 설명이나 전체적인 흐름) 을 실수로 잘라내버려서 정답을 못 맞추는 경우가 많았습니다. 이를 "정보 손실"이라고 합니다.

2. Lang2Act 의 해결책: "말로 된 도구상자"

Lang2Act 는 물리적인 도구를 쓰지 않습니다. 대신, 인공지능이 스스로 **"어떻게 문제를 풀지?"**라고 생각하면서 나오는 **말 (언어)**을 도구로 사용합니다.

  • 창의적 비유:
    • 기존 방식: "이 부분을 잘라내서 확대해 볼게요!" (물리적 조작 → 정보 손실 위험)
    • Lang2Act: "이 부분을 읽어보자 (read_text), 그리고 저 숫자와 비교해보자 (compare_values)." (말로 된 지시 → 전체 그림을 유지하면서 집중)

인공지능은 스스로 "텍스트를 읽는 도구", "숫자를 비교하는 도구" 같은 **언어 도구 (Linguistic Tools)**를 만들어내서, 그림 속의 특정 부분에 주의를 집중시킵니다. 이때 그림 자체는 잘리지 않고 온전히 유지되므로, 중요한 맥락이 사라지지 않습니다.

3. 어떻게 배우나요? (두 단계 훈련)

이 인공지능은 두 단계의 훈련을 통해 이 능력을 익힙니다.

  1. 첫 번째 단계 (스스로 탐험하기):

    • 인공지능에게 많은 문제를 풀게 합니다.
    • "어떤 말을 하면 문제를 잘 풀 수 있을까?"라고 스스로 시도해보게 합니다.
    • 성공적인 해결 과정에서 나온 **유용한 말들 (예: '이 표의 3 번째 줄을 읽어라')**을 모아서 **도구 상자 (Toolbox)**를 만듭니다.
    • 비유: 요리사가 새로운 레시피를 실험하다가, "소금을 조금 더 넣으면 맛이 좋아진다"는 비법을 발견하고 그 비법을 레시피 책에 적어두는 과정입니다.
  2. 두 번째 단계 (도구 활용하기):

    • 이제 만든 '도구 상자'를 가지고 문제를 풉니다.
    • "이 문제를 풀려면 '소금 추가 도구'와 '맛 비교 도구'를 써야겠다"라고 생각하며, 말로 된 도구를 순서대로 사용합니다.
    • 비유: 이제 요리사는 레시피 책에 적힌 비법들을 믿고 따라 하며, 훨씬 더 맛있는 요리를 만들어냅니다.

4. 왜 더 좋은가요?

실험 결과, Lang2Act 는 기존 방법보다 4% 이상 더 높은 정확도를 보였습니다.

  • 할루시네이션 (환각) 감소: 인공지능이 없는 정보를 지어내는 실수가 줄었습니다. 왜냐하면 그림 전체를 유지하면서 정확한 부분을 찾아내기 때문입니다.
  • 맥락 유지: 그림을 잘라내지 않기 때문에, "이 숫자가 왜 중요한지"에 대한 전체적인 설명을 잃지 않습니다.
  • 유연성: 미리 정해진 도구만 쓰는 게 아니라, 상황에 맞춰 새로운 '말' 도구를 만들어낼 수 있습니다.

5. 한 줄 요약

Lang2Act는 인공지능에게 "그림을 잘라내서 보지 말고, 말로 된 지시를 통해 그림 속의 중요한 부분을 찾아내고 생각하라"고 가르친 기술입니다. 마치 **마법 지팡이 (말)**로 그림을 정밀하게 조종하는 것처럼, 실수 없이 정확한 답을 찾아내는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →