← 최신 논문
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

본 논문은 기존 합성 또는 텍스트 전용 말뭉치로는 부족했던 구조화된 생성 작업에 대한 대규모 언어 모델의 학습 및 벤치마킹을 가능하게 하는 실무자 원격 측정 데이터에서 파생된 93,695 개의 스키마 제약 추출 사건으로 구성된 대규모 실세계 데이터셋인 ScrapeGraphAI-100k 를 소개합니다.

원저자: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하지만 때로는 지나치게 수다스러운 로봇 어시스턴트 (대형 언어 모델) 가 있다고 가정해 봅시다. 여러분은 이 로봇에게 지저분한 웹페이지를 읽게 하고, 신발 가격이나 글의 저자 같은 특정 세부 사항을 추출하도록 요청합니다. 여러분은 답이 산만하게 이어지는 문단이 아니라 완벽하고 깔끔한 상자 (JSON 스키마) 형태로 나오기를 원합니다.

문제는 이러한 로봇들이 어떻게 '대화'하는지에 대한 데이터는 풍부하지만, 엄격한 규칙을 부여했을 때 실제 웹사이트에서 정보를 어떻게 '추출'하는지에 대한 데이터는 부족하다는 점입니다. 대부분의 기존 데이터셋은 실험실에서 만들어낸 연습 문제와 같습니다. 사람들이 실제로 사용하는 지저분한 현실 세계의 웹사이트와는 거리가 멉니다.

이제 "ScrapeGraphAI-100k"가 등장합니다.

이 논문을 이러한 로봇들을 위한 방대한 현실 세계 훈련 매뉴얼의 소개로 생각하세요. 여기 간단한 설명이 있습니다:

1. "현실 세계 체육관"

저자들은 가짜 웹사이트를 만들지 않았습니다. 대신 인터넷에서 데이터를 스크래핑하기 위해 그들의 소프트웨어를 사용한 93,695 개의 실제 사례를 수집했습니다.

  • 출처: 그들은 오픈 소스 도구의 900 만 명의 사용자에게 자신이 무엇을 하고 있는지 익명으로 공유할 수 있는지 물었습니다. 중복과 노이즈를 정제한 후 약 93,000 개의 상호작용이 남았습니다.
  • "4 중 튜플": 이 데이터셋의 모든 예시는 완전한 이야기입니다:
    1. 콘텐츠: 웹페이지 텍스트 (깔끔한 문서처럼 마크다운으로 변환됨).
    2. 요청: 사용자의 프롬프트 (예: "가격과 사이즈를 가져오세요").
    3. 규칙: 로봇이 채워야 하는 엄격한 "상자" (JSON 스키마).
    4. 결과: 로봇이 실제로 작성한 응답.

2. "복잡성 함정"

연구자들은 이러한 예시들을 분석하여 로봇을 위한 속도 제한 표지판과도 같은 흥미로운 패턴을 발견했습니다.

  • 단순한 작업: 규칙 (스키마) 이 간단하다면 (예: 이름과 가격만 요청), 로봇들은 규칙을 따르는 데 뛰어납니다.
  • 절벽: 규칙이 더 복잡해질수록 (더 많은 중첩 폴더, 더 많은 필드, 더 많은 'if/then' 논리), 로봇들은 실패하기 시작합니다.
  • 발견: 뚜렷한 "실패 임계값"이 존재합니다. 규칙 세트가 너무 깊거나 키가 너무 많으면 성공률은 돌처럼 떨어집니다. 마치 인간에게 500 개의 필드가 있는 양식을 작성하라고 요청하는 것과 같습니다. 결국 그들은 포기하거나 실수를 하게 됩니다.

3. "학생 대 교사" 실험

이 데이터셋이 유용함을 증명하기 위해 저자들은 과학 페어 프로젝트와 같은 작은 실험을 수행했습니다:

  • 교사: 데이터셋에 완벽한 답변을 생성한 매우 똑똑하고 비싼 모델 (GPT-5-nano).
  • 학생: 이 새로운 데이터셋을 사용하여 "교육"받은 작고 저렴한 모델 (17 억 개 파라미터).
  • 결과: 이 작은 학생은 현실 세계의 예시들로부터 그렇게 잘 배워서, 엄격한 규칙을 따르는 데 있어 훨씬 크고 비싼 모델 (300 억 개 파라미터) 과 거의 비슷하게 행동하기 시작했습니다.
  • 주의점: 학생은 상자의 외곽선을 올바르게 그리는 데 (구조적 정확성) 뛰어났지만, 상자 안의 정확한 단어를 완벽하게 맞추는 데 (의미적 정확성) 여전히 어려움을 겪는 경우가 있었습니다.

4. 상자 안에는 무엇이 들어있을까?

  • 언어: 데이터의 약 88% 가 영어와 중국어 (번체) 이며, 18,000 가지의 서로 다른 "규칙 세트"를 다룹니다.
  • 누락된 부분: 논문은 웹사이트 의 원시적이고 지저분한 HTML 코드 (깔끔한 텍스트 버전만 포함) 를 포함하지 않았으며, 아직 모든 답변에 대한 "인간 검증" 골드 스탠다드가 없다고 인정합니다. 이는 차기 버전 (Version 2.0) 에서 제공할 예정입니다.

결론

이 논문은 다음과 같이 말합니다: "우리는 로봇들이 데이터를 추출하기 위해 엄격한 규칙을 따르려 했던 현실 세계의 방대한 예시 라이브러리를 구축했습니다. 우리는 규칙이 너무 복잡해지면 로봇들이 혼란을 겪는다는 것을 발견했지만, 만약 작은 로봇을 이 실제 데이터로 훈련시킨다면 거대한 로봇만큼 규칙을 잘 따를 수 있게 배울 수 있습니다."

이는 연구자들이 세부 사항에 빠지지 않고 웹사이트를 읽을 수 있는 더 작고 효율적인 AI 도구를 구축하기 위한 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →