← 최신 논문
💻 computer science

LiveFigure: Generating Editable Scientific Illustration with VLM Agents

LiveFigure는 비전-언어 모델을 기반으로 한 에이전트 프레임워크로, 인간 연구자의 다단계 워크플로우를 모방하여 파워포인트 스크립트를 통해 완전히 편집 가능한 벡터 과학 일러스트레이션을 생성하며, 출판 준비도와 인간 선호도 측면에서 기존 베이스라인을 크게 능가합니다.

원저자: Chenyang Shao, Jiahe Liu, Fengli Xu, Yong Li

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenyang Shao, Jiahe Liu, Fengli Xu, Yong Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 놀라운 새로운 아이디어를 발견한 과학자라고 상상해 보세요. 이 아이디어를 세계에 설명하기 위해 다이어그램을 그려야 합니다. 과거에는 파워포인트나 일러스트레이터 같은 소프트웨어에서 상자를 수동으로 드래그하고, 화살표를 그리며, 글꼴을 조정하는 데 몇 시간을 보내야 했습니다. 이는 핀셋으로 벽돌 하나하나를 쌓아 집을 짓는 것처럼 지루한 작업이었습니다.

최근에는 텍스트에서 아름다운 이미지를 생성하는 AI 이미지 생성기들이 이를 대신해 줄 것이라고 약속했습니다. 하지만 이들은 치명적인 결함이 있었습니다. 캔버스에 그림을 그린 다음 바니시로 밀봉해 버린 것입니다. 그림이 완성되면 상자를 하나도 움직이거나 오타를 수정하려면 그림 전체를 다시 그려야 했습니다. "가중 합 (Weighted Sum)" 상자를 아래로 옮기고 싶다면, AI 는 나머지 그림을 왜곡시키는 경우가 많으면서도 전체 이미지를 다시 그리려고만 했습니다.

LiveFigure는 게임의 규칙을 바꾸는 새로운 시스템입니다. 정적인 그림을 그리는 대신, 다이어그램의 완전히 편집 가능한 모델을 구축하는 초지능적이고 초정리된 건축가처럼 작동합니다.

그 작동 원리는 세 가지 간단한 단계로 나뉩니다:

1. "청사진" 단계 (시각적 계획)

무엇을 건설하기 전에 인간 건축가는 성공적인 건물들을 살펴보며 무엇이 효과적인지 확인합니다. LiveFigure 도 마찬가지입니다. 최상위 저널의 수천 개의 고품질 과학 다이어그램을 스캔하여 "교통 규칙"을 학습합니다.

  • 비유: 나무집을 짓는다고 상상해 보세요. 가지가 어디에 위치해야 할지 추측하는 대신, 지금까지 지어진 가장 훌륭한 나무집들의 사진을 살펴봅니다. 계단은 보통 왼쪽에 있고 창문은 햇빛을 향해 있어야 한다는 것을 배우는 것입니다. LiveFigure 는 이러한 "시각적 기억"을 활용하여 한 줄의 코드도 작성하기 전에 다이어그램의 정신적 청사진을 스케치합니다.

2. "시공" 단계 (절차적 생성)

이 단계에서 LiveFigure 는 다른 AI 와 다릅니다. 픽셀을 칠하는 대신 코드(구체적으로는 마이크로소프트 파워포인트와 대화하는 파이썬 스크립트) 를 작성합니다.

  • 비유: 다른 AI 를 팔레트에서 색을 섞는 화가로 생각한다면, LiveFigure 는 사전 제작된 완벽한 부품들을 갖춘 로봇 목수입니다. 상자를 그리는 방법을 "추측"하지 않습니다. add_box()라는 사전 테스트된 도구를 사용합니다. 화살표를 그리는 방법을 추측하지도 않습니다. add_connector()라는 도구를 사용합니다.
  • "경험" 트릭: 때로는 로봇조차 실수를 합니다 (예: 망치를 나사 드라이버처럼 사용하려는 시도). LiveFigure 는 "실수 일지"를 보관합니다. 프로그램이 이전에 충돌하게 만든 작업을 시도하면, *"다시는 그렇게 하지 마라!"라고 기억합니다. 이는 처음부터 실제로 작동하는 코드를 작성하는 데 도움이 됩니다.

3. "품질 검사" 단계 (표적 정제)

로봇이 다이어그램을 구축하면 "시각 검사관"(다른 AI) 이 결과를 검토합니다.

  • 비유: 목수가 선반을 만들었지만, 검사관이 나사가 튀어나와 있거나 선반이 약간 비뚤어진 것을 발견했다고 상상해 보세요. 전체 선반을 뜯어내고 처음부터 다시 시작하는 대신, 검사관은 특정 나사를 가리키며 *"이것을 시계 방향으로 돌려라"*라고 말합니다.
  • LiveFigure 는 코드에 이러한 작고 정밀한 조정을 가합니다. 나머지 다이어그램을 건드리지 않고 비뚤어진 화살표나 겹치는 텍스트 상자를 수정합니다.

결과: "레고" 다이어그램

최종 출력물은 JPEG 같은 평면 이미지가 아닙니다. 모든 상자, 화살표, 단어가 별도의 이동 가능 객체인 파워포인트 파일입니다.

  • 이것이 중요한 이유: 하나의 상자 색상을 바꾸려면 클릭하여 색상만 변경하면 됩니다. 전체 섹션을 이동하려면 드래그하면 화살표가 자동으로 늘어나고 구부러져 따라갑니다. 콘크리트를 부어 만드는 대신 레고 블록으로 조립하는 것과 같습니다.

논문에서 발견한 내용

연구진들은 LiveFigure 를 구글의 "나노 바나나 (Nano Banana)"와 오픈AI 의 "GPT-Image" 같은 최첨단 이미지 생성 AI 모델 및 전통적인 코딩 도구와 비교하여 테스트했습니다.

  • "수정" 테스트: 인간에게 AI 가 생성한 다이어그램을 과학 논문에 사용할 수 있도록 수정하라고 요청했습니다.
    • 다른 AI: 인간은 약 30 회 이상의 수정을 가해 혼란을 정리해야 했으며, 그렇게 해도 **24%**의 다이어그램만 사용 가능한 수준이었습니다.
    • LiveFigure: 인간은 약 17 회의 수정(대부분 작은 조정) 만 하면 되었고, **80%**의 다이어그램은 즉시 출판할 준비가 되었습니다.
  • 인간 선호도: 사람들이 두 다이어그램을 나란히 보여줬을 때 (하나는 LiveFigure, 다른 하나는 경쟁사), 사람들은 LiveFigure 를 60% 의 빈도로 선택했습니다. 더 전문적으로 보였고 논리적으로 더 타당했기 때문입니다.

요약하자면

LiveFigure 는 단순히 그림을 "그리는" 것이 아니라, 인간 전문가가 생각하는 방식을 모방하는 스마트한 단계별 과정을 통해 다이어그램을 구축합니다. 수정하고, 고치고, 완벽하게 만들 수 있는 다이어그램을 생성하여 과학적 일러스트레이션이라는 어려운 작업을 디지털 레고로 조립하는 것처럼 느껴지게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →