← 최신 논문
🤖 machine learning

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

이 논문은 관찰 가능한 텍스트와 색상 증거를 선택적으로 접지(grounding)하여 JSX를 직접 생성함으로써 스크린샷-투-코드 생성의 충실도-효율성 트레이드오프를 개선하고, 직접 프롬프팅 및 구조화된 파이프라인보다 우수한 성능을 보이면서 동시에 오픈 웨이트 모델의 효과적인 미세 조정을 가능하게 하는 경량 도구 접지 프레임워크인 WidgetGen을 소개한다.

원저자: Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 사진 한 장을 보고 집 그림을 그리는 법을 가르치고 있다고 상상해 보세요. 이것이 바로 인공지능이 웹사이트나 앱의 정지된 이미지를 그것을 구축하는 실제 프로그래밍 명령(코드)으로 변환하려고 시도하는 컴퓨터 과학의 한 분야인 "스크린샷 투 코드(screenshot-to-code)"의 세계입니다. 오랫동안 과학자들은 이를 수행하는 최선의 방법에 대해 논쟁해 왔습니다. 한 가지 접근 방식은 로봇이 교과서 없이 시험을 치는 학생처럼 전체 그림을 한 번에 추측하게 하는 것입니다. 이는 빠르고 유연하지만, 로봇이 없는 창문을 만들어내거나 색상을 틀리게 적는 등 세부 사항을 환각(hallucinate)하는 경우가 많습니다. 다른 접근 방식은 로봇이 엄격하고 사전에 승인된 설계도에 따라 벽돌을 하나씩 쌓도록 강제하는 것입니다. 이 방식은 로봇이 스스로 규칙을 만들 수 없기 때문에 더 정확하지만, 느리고 경직되어 있으며, 만약 집의 모양이 특이해서 설계도가 커버하지 못하는 경우 로봇은 멈춰버립니다.

연구자들이 던지는 핵심 질문은 이것입니다: 두 방식의 장점만을 취할 수는 없을까? 로봇이 터무니없는 추측을 하지 않도록 적절한 "참고 자료"를 제공하면서도, 엄격하고 지루한 설계도를 따르도록 강요하지 않을 방법은 없을까? 이것이 바로 "시각적 위젯에서 UI 코드로: 효율적인 도구 기반 생성(From Visual Widgets to UI Code: Efficient Tool-Grounded Generation)"이라는 논문이 다루는 내용입니다. 이 논문은 여러분의 휴대폰이나 컴퓨터 어디에서나 볼 수 있는 날씨 카드, 음악 플레이어, 주식 차트와 같이 작지만 독립적인 블록인 "위젯(widgets)"에 집중합니다. 이러한 위젯들은 크기는 작지만 텍고, 색상, 모양이 밀집되어 있어 단 하나의 작은 실수만으로도 전체를 망칠 수 있기 때문에 까다롭습니다. 저자들은 복잡하고 맞춤 제작된 규칙들로 속도를 늦추지 않으면서도 어떻게 하면 로봇을 더 똑똑하고 정확하게 만들 수 있을지 알고 싶어 합니다.

연구진은 로봇이 그림을 그리기 시작하기 전에 몇 가지 구체적인 단서를 건네주는 스마트한 조수 역할을 하는 WidgetGen이라는 새로운 방법을 소개합니다. WidgetGen은 로봇이 텍스트나 색상을 처음부터 추측하게 두는 대신(이는 종종 오류를 범하게 됩니다), 특수한 도구를 사용하여 스크린샷으로부터 텍스트를 "읽고" 색상을 직접 "측정"합니다. 이것은 마치 로봇에게 돋보기와 색상 견본 카드를 쥐여주는 것과 같습니다. 일단 로봇이 이러한 확고한 사실들을 확보하면, 자신의 두뇌를 사용하여 레이아웃을 파악한 뒤 코드를 직접 작성합니다.

논문에 따르면 이 "선택적 도구 접지(selective tool grounding)" 방식은 놀라울 정도로 잘 작동합니다. 연구진이 6개의 서로 다른 AI 모델을 사용하여 1,000개의 다양한 위젯을 대상으로 WidgetGen을 테스트했을 때, WidgetGen은 대부분의 카테고리에서 "추측" 방식과 "엄격한 설계도" 방식을 모두 이겼습니다. 구체적으로, WidgetGen이 생성한 코드는 원본 이미지와 훨씬 더 유사했으며, 텍스트 가독성, 색상 정확도, 그리고 원본 위젯의 크기와 모양에 거의 완벽하게 일치하는 레이아웃을 보여주었습니다. 실제로 "기하학(geometry)" 점수(모양이 얼마나 잘 일치하는지)에서 WidgetGen은 테스트한 모든 모델에 대해 완벽한 100.00을 기록한 반면, 다른 방식들은 종종 90을 넘기는 데 어려움을 겪었습니다.

저자들은 또한 이 방법이 효율적이라는 점을 발견했습니다. 엄격한 설계도 방식은 특수한 규칙들을 컴파일하는 데 많은 추가 단계와 시간이 필요했지만, WidgetGen은 더 빠르고 저렴하게 실행되면서도 여전히 더 높은 품질의 결과물을 만들어냈습니다. 그들은 심지어 WidgetGen이 생성한 코드를 더 작은 AI 모델들이 이 작업을 더 잘 수행하도록 가르치는 "훈련 데이터"로 사용할 수 있음을 보여주었는데, 이는 로봇의 성공적인 그림을 동생들을 위한 교과서로 효과적으로 바꾸는 과정이었습니다.

하지만 논문은 그 한계점도 주의 깊게 명시하고 있습니다. 결과는 단일 데이터셋에서 추출한 1,000개의 특정 위젯을 기반으로 하므로, 이 방법이 전 세계의 모든 유형의 앱이나 웹사이트에 적용될 수 있는지는 아직 알 수 없습니다. 또한, 테스트는 최종 이미지가 제대로 보이는지만 확인했을 뿐, 버튼이 실제로 작동하는지 또는 코드가 나중에 사람이 읽고 수정하기 쉬운지는 테스트하지 않았습니다. 그러나 작은 위젯의 스크린샷을 작동하는 코드로 변환하는 특정 작업에 있어서, WidgetGen은 AI에게 몇 가지 신뢰할 수 있는 사실을 제공하는 것이 엄격하고 융통성 없는 규칙 책을 따르도록 강요하는 것보다 훨씬 더 나은 전략임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →