← 최신 논문
💬 NLP

LiveWeb-IE: A Benchmark For Online Web Information Extraction

이 논문은 정적 데이터의 한계를 극복하기 위해 실시간 웹사이트를 대상으로 한 새로운 벤치마크 'LiveWeb-IE'와 인간과 유사한 시각적 추론을 통해 정보를 추출하는 다단계 에이전트 프레임워크 'VGS'를 제안하여 웹 정보 추출 시스템의 실용성과 견고성을 평가하는 기반을 마련했습니다.

원저자: Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

게시일 2026-03-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🌐 웹에서 정보를 찾는 새로운 방법: '라이브웹-IE'와 'VGS' 이야기

이 논문은 **"인터넷에서 정보를 자동으로 찾아내는 기술"**이 왜 지금 당장 고장 나기 쉬운지, 그리고 어떻게 해결할 수 있는지에 대한 아주 흥미로운 이야기를 담고 있습니다.

상상해 보세요. 여러분이 요리 레시피를 찾아보려고 인터넷에 접속했다고 칩시다. 그런데 검색 엔진이 레시피를 찾아주지 못하고, 대신 10 년 전의 낡은 요리책을 펼쳐 보여준다면 어떨까요? 그 책에는 '마이크로파'라는 단어조차 없었을 겁니다.

이 논문은 바로 이런 문제를 해결하기 위해 **새로운 시험장 (Benchmark)**과 **새로운 로봇 (Framework)**을 소개합니다.


1. 문제: "과거의 지도로 미래를 여행할 수 있을까?"

지금까지 웹에서 정보를 추출하는 기술 (WIE) 을 평가할 때는 **정지된 사진 (스냅샷)**을 사용했습니다. 마치 10 년 전의 지도를 가지고 지금의 서울을 찾아가는 것과 비슷합니다.

  • 기존 방식의 문제: 웹페이지는 constantly 변합니다. 오늘 뉴스 사이트의 레이아웃은 내일 바뀔 수 있고, 1 년 뒤에는 완전히 달라질 수 있습니다. 하지만 기존 기술들은 "과거에 찍힌 사진"만 보고 학습했기 때문에, 살아 움직이는 실제 웹사이트에 가면 길을 잃고 엉뚱한 정보를 가져오거나 아예 찾지 못합니다.
    • 비유: "과거의 지도"를 들고 "살아있는 도시"를 탐험하려니, 도로는 바뀌고 건물이 새로 지어져서 길을 잃는 것입니다.

2. 해결책 1: '라이브웹-IE' (LiveWeb-IE) - 살아있는 인터넷의 시험장

저자들은 "정지된 사진"이 아니라, '살아있는 웹사이트' 그 자체에서 정보를 찾아내는 능력을 평가하는 새로운 시험장 **LIVEWEB-IE**를 만들었습니다.

  • 어떻게 작동하나요?
    • 실시간 평가: 시스템이 실제로 웹사이트에 접속해서 현재 화면을 보고 정보를 찾아야 합니다.
    • 다양한 질문: 단순히 "제목은 뭐야?"뿐만 아니라 "이 게임의 포스터 사진은?", "관련 링크는?"처럼 텍스트, 이미지, 링크 등 다양한 정보를 요구합니다.
    • 난이도 조절: 정보를 하나만 찾는 쉬운 문제부터, 여러 개의 정보를 한꺼번에 찾아야 하는 어려운 문제까지 4 단계로 나누어 테스트합니다.
    • 비유: 기존 시험은 "과거의 지도"를 보고 답을 맞히는 것이었다면, **LIVEWEB-IE**는 **"실제 현장에 가서 지금 당장 보이는 것을 찾아오라"**는 미션입니다.

3. 해결책 2: 'VGS' (Visual Grounding Scraper) - 인간의 눈과 뇌를 모방한 로봇

이제 이 새로운 시험장에서 가장 잘 작동하는 새로운 로봇 **VGS**를 소개합니다. 기존 로봇들은 **HTML 코드 (웹페이지의 뼈대)**만 보고 정보를 찾았기 때문에, 코드가 조금만 바뀌어도 길을 잃었습니다.

하지만 VGS 는 인간처럼 행동합니다.

  • VGS 의 4 단계 작전 (인간의 눈과 뇌 모방):

    1. 목표 확인 (Attribute Identification): "무엇을 찾아야 하지?"라고 질문을 분석합니다. (예: "게임의 유튜브 링크를 찾아줘")
    2. 시각적 위치 잡기 (Visual Grounding): **눈 (Vision)**으로 웹페이지를 훑어봅니다. "아, 유튜브 링크는 보통 이쪽 구석에 있겠구나!"라고 화면의 특정 영역을 찾아냅니다.
      • 비유: 도서관에서 책을 찾을 때, 책 전체를 다 읽지 않고 **책장 (Visual Region)**을 먼저 보고 "역사책 코너에 있겠지"라고 추정하는 것과 같습니다.
    3. 정확한 물건 찾기 (Element Pinpointing): 찾은 영역 안에서 정확한 물건을 집어냅니다. "여기 있는 이 버튼이 맞는 거야!"라고 **상자 (Bounding Box)**로 표시합니다.
    4. 지도 만들기 (XPath Synthesis): 이제 그 물건을 다시 찾을 수 있는 **정확한 길 (XPath)**을 만듭니다.
  • 왜 VGS 가 뛰어난가요?

    • 기존 로봇은 HTML 코드라는 복잡한 지도만 보고 헤맸다면, VGS 는 **실제 화면 (이미지)**을 보고 인간처럼 "눈으로" 찾아냅니다.
    • 그래서 웹페이지의 디자인이 바뀌어도, 눈으로 보이는 위치가 비슷하면 여전히 정보를 찾아낼 수 있습니다.

4. 실험 결과: "과거의 지도"는 무용지물

저자들은 다양한 AI 모델들을 이 새로운 시험장에 투입해 보았습니다.

  • 결과: 기존에 유명했던 기술들은 살아있는 웹사이트에서는 성능이 급격히 떨어졌습니다 (F1 점수 15% 이상 하락).
  • VGS 의 활약: VGS 는 다른 모델들보다 훨씬 뛰어난 성능을 보였습니다. 특히 이미지나 링크 같은 복잡한 정보를 찾을 때 그 차이가 두드러졌습니다.
  • 아직도 갈 길이 멀다: VGS 가 가장 잘했지만, 여전히 **사람 (Human)**이 직접 찾아내는 것보다는 성능이 떨어졌습니다. 이는 웹 정보 추출이 여전히 매우 어려운 문제임을 보여줍니다.

5. 결론: 웹의 미래를 위한 새로운 시작

이 논문은 우리에게 중요한 메시지를 줍니다.

"웹은 살아있는 유기체입니다. 과거의 정지된 사진으로 미래를 예측할 수 없습니다. 우리는 살아있는 웹을 보고, 인간처럼 눈으로 정보를 찾아내는 새로운 시대가 필요합니다."

**LIVEWEB-IE**는 그 새로운 시대를 위한 진정한 시험장이 되었고, **VGS**는 그 시험장에서 가장 유망한 새로운 탐험가가 되었습니다. 앞으로 더 똑똑한 AI 가 웹을 자유롭게 오가며 필요한 정보를 찾아줄 날이 머지않았습니다! 🚀

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →