← 최신 논문
🤖 AI

ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

이 논문은 계층적 씬 그래프(scene-graph)와 정답 없는 피드백 루프를 활용하여 평면 형식 문서 편집의 레이아웃 취약성과 평가 문제를 극복하고, 기존의 에이전트 파이프라인보다 현저히 낮은 비용과 지연 시간으로 우수한 지시 이행 성능과 인간 선호도를 달성하는 자기 수정형 에이전트 캔버스 편집기인 ACE를 소개한다.

원저자: JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

게시일 2026-08-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 디자인의 세계에서 프레젠테이션을 만드는 일은 공백 상태에서 시작하는 경우가 드뭅니다. 대부분의 사람들은 전문적인 레이아웃과 일관된 시각적 스타일을 제공하는 사전 구조화된 문서인 템플릿으로 시작합니다. 이러한 방식은 시간을 절약하고 품질을 보장하지만, 새로운 문제를 야기합니다. 바로 그 템플릿을 변경하는 것이 종종 어렵다는 점입니다. 사용자가 목록을 재배치하거나, 차트를 다이어그램으로 교체하거나, 수십 개의 슬라이드에 걸쳐 텍스트의 간격을 조정하고 싶을 때, 사용자는 모든 요소를 일일이 수동으로 이동시켜야 합니다. 만약 새로운 항목을 추가한다면, 중첩을 피하기 위해 다른 모든 요소의 위치를 다시 계산해야 하는 경우가 많은데, 이는 지속적인 세심한 주의를 요구하는 지루한 과정입니다.

인공지능은 대규모 언어 모델을 사용하여 지시 사항을 읽고 변경을 수행하는 디지털 비서 역할을 함으로써 이 분야에서 도움을 주기 시작했습니다. 그러나 이러한 시스템은 두 가지 중요한 장애물에 직면해 있습니다. 첫째, 이러한 프레젠테이션을 저장하는 파일들은 종로 종종 계층 구조 없이 고정된 위치를 가진 아이템들의 평면적인 리스트처럼 구축되어 있습니다. 이로 인해 컴퓨터는 모든 것이 어디에 위치해야 하는지 파악하기 위해 복잡한 수학 연산을 수행해야 하며, 이는 레이아웃이 깨지는 빈번한 오류로 이어집니다. 둘째, 디자인은 주관적입니다. 슬라이드가 어떻게 보여야 하는지에 대한 단 하나의 '정답'은 없습니다. 전통적인 컴퓨터 프로그램은 결과를 특정 참조 이미지와 비교하여 성공 여부를 판단하는데, 이는 유효하지만 서로 다른 창의적 선택을 불공정하게 처벌합니다. 이는 자동화된 시스템이 언제 진정으로 성공했는지, 혹은 언제 다시 시도해야 하는지를 알기 어렵게 만듭니다.

서울대학교와 미리디(Miridih)의 연구진은 이러한 구체적인 문제들을 해결하기 위해 ACE라는 새로운 시스템을 개발했습니다. ACE는 프레젠테이션을 좌표의 평면적인 리스트로 취급하는 대신, 웹사이트가 조직되는 방식과 유사하게 요소를 구조화된 가계도(family tree)로 간주합니다. 이 구조에서는 부모 컨테이너를 이동하면 그 안의 모든 항목이 자동으로 업데이트되는데, 이는 컴퓨터 화면에서 폴더의 크기를 조절하면 그 안의 파일들이 함께 움직이는 것과 같습니다. 이러한 접근 방식은 시스템이 위치를 끊임없이 재계산하지 않고도 복잡한 편집을 처리할 수 있게 해줍니다. 이를 효율적으로 만들기 위해, 시스템은 전체 문서를 전달하는 대신 작업에 필요한 프레젠테이션의 특정 부분만을 컴퓨터에 공급하는 스마트 라우터를 사용하여 시간과 컴퓨팅 자원을 크게 절약합니다.

ACE의 가장 뚜렷한 특징은 인간이 작업을 먼저 확인하지 않아도 스스로의 실수를 통해 학습할 수 있는 능력입니다. 이 시스템에는 지시 사항을 읽고 컴퓨터가 방금 수행한 변경 사항과 비교하는 특화된 판사(judge)가 포함되어 있습니다. 만약 변경 사항이 사용자의 의도와 완전히 일치하지 않으면, 판사는 무엇이 누락되었는지 설명하는 명확한 자연어 비평을 작성합니다. 이 비평은 다시 새로운 지시 사항으로서 시스템에 입력되어, 특정 오류를 수정하도록 유도합니다. 이 순환 과정은 시스템이 작업이 완료되었다고 확신할 때까지 반복됩니다. 판사는 결과물을 단일 참조 이미지와 비교하는 것이 아니라 지시 사항이 제대로 이행되었는지를 평가하기 때문에, 다른 시스템들이 거부할 수 있는 유효한 창의적 변형을 허용합니다.

94가지의 다양한 편집 작업을 대상으로 이 시스템을 테스트한 결과, 연구진은 ACE가 기존 방식들을 크게 능가한다는 것을 발견했습니다. 프레젠테이션 파일을 직접 편집하는 표준 코딩 기반 방식과 비교했을 때, ACE는 지시 사항을 더 정확하게 따랐으며 작업을 더 빠르게 완료했습니다. 시스템은 처리해야 할 정보량을 평균적으로 거의 90% 가까이 줄일 수 있어 운영 비용을 훨씬 저렴하게 만들었습니다. 최종 슬라이드의 시각적 품질은 기존의 가장 우수한 방식들과 통계적으로 유사했지만, 인간 평가자들은 일관되게 ACE가 생성한 결과를 선호했습니다. 블라인드 테스트에서 사람들은 절반 이상의 확률로 ACE의 결과물을 대안보다 선택했으며, 스스로 수정 루프를 거친 버전을 압도적으로 선호했습니다.

또한 이 연구는 시스템이 올바르게 수행하기 위해 많은 시도를 할 필요가 거의 없다는 것을 입증했습니다. 약 3분의 2의 경우에서 시스템은 첫 번째 시도만에 작업을 정확히 수행했습니다. 스스로를 수정해야 했던 경우에도 그 과정은 매우 효과적이었으며, 대다수의 수정 작업이 더 나은 결과로 이어졌습니다. 연구진은 또한 수정 시도가 결과를 더 악화시키는 경우 이전 버전으로 자동 복구하는 안전 메커니즘을 구현하여, 시스템이 작업 품질을 저하시키지 않도록 보장했습니다. 이처럼 문서를 표현하는 더 스마트한 방식과 인간의 의도를 이해하는 자기 수정 루프를 결속함으로써, 이 새로운 접근 방식은 전문적인 프레젠테이션 편집이라는 복잡하고 세밀한 작업을 자동화하는 신뢰할 수 있는 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →