← 최신 논문
🤖 AI

Vector-Bench: Can Models Surgically Edit SVG Code?

이 논문은 지시 기반 벡터 편집을 평가하기 위해 설계된 40개의 SVG 복구 작업으로 구성된 엄격한 벤치마크인 Vector-Bench를 소개하며, 가장 강력한 모델들조차 요청되지 않은 요소를 변경하지 않고 요청된 변경 사항만을 정밀하게 적용하는 데 어려움을 겪어 전체 사양 성공률이 15.0%에 불과하다는 점을 밝혀냈다.

원저자: Yug Aditi Gupta, Prannay Hebbar

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yug Aditi Gupta, Prannay Hebbar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 디지털 아티스트가 되는 법을 가르치고 있다고 상상해 보세요. 당신은 코드(물감 대신 명령어로 만들어진 디지털 그림)로 된 사진 한 장을 주며 이렇게 말합니다. "이 그림 속의 태양이 너무 커. 태양을 줄여줘, 하지만 구름이나 산은 건드리지 마." 이것이 바로 벡터 그래픽의 세계입니다. 격자 형태의 색 점들로 이루어진 일반적인 사진과 달리, 벡터 이미지는 살아있는 프로그램입니다. 그것은 컴퓨터에게 선, 도형, 색상을 어떻게 그릴지 알려주는 명령의 목록입니다. 코드이기 때문에, 만약 로봇이 엉뚱한 선을 수정하면 단순히 그림이 이상해지는 것에 그치지 않고, 파일 전체를 망가뜨려 나중에 파일을 열거나 편집하는 것 자체를 불가능하게 만들 수도 있습니다.

과학자들이 던지는 핵심 질문은 이것입니다. 과연 이 똑똑한 AI 모델들이 나머지 부분을 망가뜨리지 않고 특정 부분의 코드를 수정하라는 지시를 실제로 따를 수 있을까? 이는 마치 요리사에게 국의 온도나 냄비, 혹은 옆에 놓인 빵의 레시피는 바꾸지 않으면서 국에 들어간 소금만 교체하라고 요청하는 것과 같습니다. 만약 AI가 국의 맛은 맞췄지만 빵을 태워버린다면, 설령 국의 모양이 좋아 보이더라도 그것은 실패입니다. 이것이 바로 **지시 기반 편집(instruction-based editing)**의 과제입니다. 즉, 보이지 않는 코드의 구조를 완벽하게 유지하면서, 당신이 요청한 것만, 정확히 요청한 대로 수행하는 것입니다.

여기에 AI 모델이 정말로 정교한 편집가 역할을 할 수 있는지 테스트하기 위해 설계된 새롭고 까다로운 시험인 Vector-Bench가 등장했습니다. 연구진은 SVG 이미지가 '손상된' 40가지의 특정한 퍼즐을 만들었습니다. 예를 들어 기차 문이 엉뚱한 곳에 떠 있거나, 해파리가 촉수를 잃어버린 경우 같은 상황입니다. 그들은 AI 모델에게 "황색 신호가 꺼졌습니다. 신호를 고치되 역은 그대로 두세요"와 같은 간단한 인간 언어 지시를 주었습니다. 모델들은 신호를 고치는 동시에 기차를 움직이거나, 역 승강장을 삭제하거나, 파일 형식을 깨뜨리지 않고 코드를 다시 작성해야 했습니다.

결과는 일종의 현실 자각 타임이었습니다. 연구진은 저렴하고 작은 모델부터 가장 강력한 '프런티어' 모델에 이르기까지 34개의 서로 다른 AI 모델을 테스트했습니다. 가장 뛰어난 성능을 보인 모델인 Claude Sonnet 5조차 오류를 수정하고, 나머지를 안전하게 유지하며, 유효한 파일을 생성하는 이 전체 작업을 완벽하게 수행한 비율은 단 **15.0%**였습니다. 그렇습니다. 가장 똑똑한 AI조차 10번 중 8번 이상의 시도에서 전체 지시를 따르는 데 실패했습니다.

하지만 이야기는 실패에 대해서만 있는 것이 아닙니다. 연구진은 모델들이 '수정하는' 부분에서는 실제로 꽤 괜찮았다는 사실을 발견했습니다. 평균적으로 모델들은 요청된 수리를 통해 눈에 보이는 진전을 약 **43.7%**의 확률로 보여주었습니다. 모델들은 종종 신호를 더 밝게 만들거나 문을 더 가까이 옮길 수 있었습니다. 하지만 그들은 '나머지는 그대로 두라'는 부분에서 형편없었습니다. 모델들은 자주 건드려서는 안 될 것들의 이름을 바꾸거나, 관련 없는 물체를 이동시키거나, 코드 구조를 깨뜨려 파일이 유효하지 않게 만들었습니다.

이 연구는 "보기 좋은 것"이 "올바르게 작동하는 것"과 같지 않다는 점을 명시적으로 배제합니다. 모델이 인간의 눈에 보기 좋게 수정된 이미지를 만들어낼 수는 있지만, 밑바탕이 되는 코드가 재작성되었거나 손상되었다면 그것은 실패입니다. 연구진은 단순히 그림을 보는 것이 아니라 코드 자체를 검사하는 엄격한 컴퓨터 판정관을 사용하여 이를 증명했습니다. 그들은 모델들이 어느 정도 수리는 할 수 있지만, 부수적인 피해 없이 정교하게 코드를 편집하는 능력은 여전히 큰 장벽이라는 것을 발견했습니다.

요약하자면, 이 논문은 AI가 그림을 그리고 고치는 데는 점점 나아지고 있지만, 그 그림을 작동하게 만드는 코드를 정교하고 조심스럽게 편집하는 데는 여전히 어려움을 겪고 있다는 점을 시사합니다. "변화를 주는 것"과 "다른 것을 망가뜨리지 않고 올바른 변화를 주는 것" 사이의 간극은 여전히 넓습니다. 저자들은 자신들의 모든 데이터, 코드, 결과를 공개하며, 가장 비싸고 강력한 모델들조차 현재로서는 정밀한 외과의사가 되기보다는 문제를 해결하려다 실수로 책장을 넘어뜨리는 열정적인 인턴에 가깝다는 것을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →