← 최신 논문
💻 computer science

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench는 프론트엔드 결과물의 상호작용적이고 다양하며 빠르게 진화하는 특성을 다루기 위해 전문화된 역할들이 참여하는 동적이고 협력적인 검토 프로세스로 웹 생성 평가를 재정의하는 자동화된 에이전트 기반 프레임워크를 도입함으로써, 인간 전문가의 판단과 일치하는 성과를 달성한다.

원저자: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 당신과 대화하는 것을 넘어 실제로 무언가를 만들어내는 세상을 상상해 보십시오. 인공지능, 특히 거대언어모델(LLM)의 영역에서 우리는 이제 이 디지털 지성들이 단 한 문장이 아니라 웹사이트 전체를 구축하기 위한 코드를 작성할 수 있는 지점에 도달했습니다. LLM을 매우 빠르고 믿을 수 없을 정도로 박식한 견습 건축가라고 생각해 보십시오. 만약 당신이 "나무 집을 지어줘"라고 요청한다면, 그것은 설계도를 작성하고, 나무를 자르고, 심지어 벽에 페인트칠까지 할 수 있습니다. 하지만 여기서 까다로운 문제가 있습니다. 그 나무 집이 실제로 올라가기에 안전한지 어떻게 알 수 있을까요? 오랫동안 우리는 이러한 AI 건축가들을 테스트하기 위해 그들의 설계도(코드)를 살펴보거나 완성된 집의 사진 한 장을 찍는 방식을 사용해 왔습니다. 하지만 웹사이트는 정적인 사진이 아닙니다. 버튼이 클릭되고, 애니메이션이 튀어 오르며, 사용자들이 돌아다니는 살아 움직이는 놀이터입니다. 만약 설계도만 확인한다면, 흔들리는 사다리나 열리지 않는 문을 놓칠 수도 있습니다. 이것이 바로 연구자들이 다루고 있는 큰 질문입니다: 우리가 AI가 단순히 종이 위에서 멋져 보이는 것이 아니라, 실제로 '작동'하고 사용하기에 좋게 느껴지는 웹사이트를 만들 수 있는지 어떻게 테스트할 것인가?

여기에 바로 이 문제를 해결하기 위해 설계된 새롭고 영리한 프레임워크인 LiveEvalBench가 등장합니다. 저자들은 기존의 테스트 방식—마치 교사가 정적인 에세이를 채점하는 것과 같은 방식—이 상호작용이 가능한 웹 프로젝트에는 충분하지 않다고 주장합니다. 대신, 그들은 AI의 창작물을 철저히 검사하기 위해 각기 다른 직무를 가진 전문가 팀처럼 작동하는 시스템을 구축했습니다.

그들의 "검사 팀"이 작동하는 방식은 다음과 같습니다:

  1. 빌드 엔지니어(The Build Engineer): 집을 실제로 조립하려고 시도하는 건설 현장 소장을 상상해 보십시오. 이 에이전트는 AI의 코드를 가져와 웹사이트를 실행하려고 시도합니다. 만약 웹사이트가 충돌하거나 지침이 혼란스럽다면, 이 엔지니어가 이를 잡아냅니다.
  2. 코드 엔지니어(The Code Engineer): 이들은 집을 직접 만지지 않고 설계도(소스 코드)를 살펴보는 품질 관리 검사관입니다. 이들은 재료가 잘 정리되어 있는지, 구조가 견고한지, 그리고 AI가 당신이 준 특정 규칙(예: "파란색 페인트를 사용하라" 또는 "React 앱으로 만들어라")을 따랐는지 확인합니다.
  3. UI 테스터(The UI Tester): 이들은 놀이터를 뛰어다니는 호기심 많은 아이입니다. 이 에이전트는 코드를 전혀 보지 않고, 오직 버튼을 클릭하고, 이미지 위에 마우스를 올리고, 인간처럼 웹사이트를 사용하려고 시도합니다. 이들은 애니메이션이 부드러운지, 텍스트를 읽기 쉬운지, 그리고 사이트가 실제로 당신이 요청한 대로 작동하는지를 확인합니다.

LiveEvalBench가 특별한 이유는 **적응형(adaptive)**이기 때문입니다. 과거의 테스트는 정답이 하나뿐인 객관식 퀴즈처럼 경직되어 있었습니다. 하지만 현실 세계에서는 훌륭한 웹사이트를 만드는 방법이 수만 가지가 넘습니다. LiveEval-EvalBench는 AI가 실제로 무엇을 만들었는지 살펴보고, 그 특정 버전에 맞는 맞춤형 체크리스트를 생성합니다. 만약 AI가 드롭다운 메뉴 대신 슬라이드 아웃 메뉴를 만들었다면, 테스트는 드롭다운이 아니라는 이유로 탈락시키는 대신, 슬라이드 아웃 메뉴가 제대로 작동하는지 확인하도록 적응합니다. 이는 피자가 사각형이든 원형이든 맛만 있다면 괜찮다고 이해하는 심판과 같습니다.

연구진은 이 새로운 시스템을 100개의 실제 요청(단순한 작업부터 복잡한 다중 페이지 애플리케이션까지)에 대해 테스트했으며, 11개의 가장 똑똑한 AI 모델에게 이를 구축하도록 요청했습니다. 결과는 시사하는 바가 컸습니다. 많은 모델이 코드를 작성하고 웹사이트를 실행하는 데는 뛰어났지만, 실제 사용자 경험에 있어서는 자주 실수를 범했습니다. "UI 테스터"는 사용자가 사이트와 상호작용하려고 할 때—클릭되지 않는 버튼, 멈춰버린 애니메이션, 혹은 깨진 레이아웃 등—가장 큰 문제들이 발생한다는 것을 발견했습니다.

이들의 AI 검사관들을 인간 전문가와 비교했을 때 결과가 매우 유사하게 나타났으며, 이는 이 자동화된 팀이 AI 건축가를 판단하는 신뢰할 수 있는 방법임을 시사합니다. 연구에 따르면 최고의 모델들은 약 90점 만점에 70점 정도를 기록했으며, 최고 성능을 보인 모델들(Claude Opus 4.7 등)은 강력한 기술을 보여준 반면, 다른 모델들은 상호작용적인 부분에서 상당한 어려움을 겪었습니다. 이 논문은 AI가 구축하는 능력은 향 만큼 좋아지고 있지만, '재미'있는 부분—즉, 생동감 있고 반응성이 좋은 것을 만드는 일—이 여전히 가장 어려운 과제임을 시사합니다. LiveEvalBench는 AI가 더 잘 구축하게 됨에 따라, 우리가 그 건물들이 안전하고, 즐겁고, 세상에 나갈 준비가 되었는지 확인할 수 있는 적절한 도구를 갖추도록 하는 유연한 측정 방식을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →