ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation
Este artículo presenta ScrapeGraphAI-100k, un conjunto de datos a gran escala y del mundo real de 93.695 eventos de extracción con restricciones de esquema derivados de la telemetría de profesionales, que permite el entrenamiento y la evaluación de modelos de lenguaje grandes en tareas de generación estructurada donde los corpus sintéticos o solo de texto anteriores eran insuficientes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un asistente robótico muy inteligente, pero a veces excesivamente charlatán (un Modelo de Lenguaje Grande). Le pides que lea una página web desordenada y extraiga detalles específicos, como el precio de un zapato o el autor de un artículo. Quieres la respuesta en una caja perfecta y ordenada (un esquema JSON), no en un párrafo divagante.
El problema es que, aunque tenemos muchos datos sobre cómo estos robots hablan, no tenemos suficientes datos sobre cómo extraen información de sitios web reales cuando se les dan reglas estrictas. La mayoría de los conjuntos de datos existentes son como ejercicios de práctica inventados en un laboratorio; no se parecen a los sitios web desordenados del mundo real que la gente usa realmente.
Presentamos "ScrapeGraphAI-100k".
Piensa en este artículo como la introducción de un manual de entrenamiento masivo y del mundo real para estos robots. Aquí está el desglose en términos sencillos:
1. El "Gimnasio del Mundo Real"
Los autores no inventaron sitios web falsos. Recopilaron 93.695 ejemplos reales de personas usando su software para extraer datos de internet.
- La Fuente: Preguntaron a 9 millones de usuarios de su herramienta de código abierto si podían compartir anónimamente lo que estaban haciendo. Aproximadamente 93.000 de esas interacciones se conservaron después de limpiar duplicados y ruido.
- La "Cuadrupla": Cada ejemplo en este conjunto de datos es una historia completa:
- El Contenido: El texto de la página web (convertido a Markdown, como un documento limpio).
- La Solicitud: El prompt del humano (por ejemplo, "Obtén el precio y la talla").
- Las Reglas: La "caja" estricta (esquema JSON) que el robot debía rellenar.
- El Resultado: Lo que el robot escribió realmente como respuesta.
2. La "Trampa de la Complejidad"
Los investigadores analizaron estos ejemplos y encontraron un patrón fascinante, como un letrero de límite de velocidad para robots.
- Tareas Simples: Si las reglas (esquema) son simples (como pedir solo un nombre y un precio), los robots son excelentes siguiéndolas.
- El Acantilado: A medida que las reglas se vuelven más complejas (más carpetas anidadas, más campos, más lógica de "si/entonces"), los robots comienzan a fallar.
- El Hallazgo: Existe un "umbral de fallo" agudo. Una vez que un conjunto de reglas se vuelve demasiado profundo o tiene demasiadas claves, la tasa de éxito cae como una piedra. Es como pedirle a un humano que rellene un formulario con 500 campos; eventualmente, simplemente se rinden o cometen errores.
3. El Experimento "Estudiante vs. Profesor"
Para demostrar que este conjunto de datos es útil, los autores realizaron un pequeño experimento, como un proyecto de feria de ciencias:
- El Profesor: Un modelo muy inteligente y costoso (GPT-5-nano) que generó respuestas perfectas para el conjunto de datos.
- El Estudiante: Un modelo pequeño y barato (1.7 mil millones de parámetros) que fue "enseñado" usando este nuevo conjunto de datos.
- El Resultado: El pequeño estudiante aprendió tan bien de los ejemplos del mundo real que comenzó a comportarse casi tan bien como un modelo mucho más grande y costoso (30 mil millones de parámetros) cuando se trataba de seguir las reglas estrictas.
- La Trampa: El estudiante era excelente dibujando el contorno de la caja correctamente (precisión estructural), pero a veces aún luchaba por obtener las palabras exactas dentro de la caja perfectas (corrección semántica).
4. ¿Qué hay dentro de la caja?
- Idiomas: Es principalmente inglés y chino tradicional (alrededor del 88% de los datos), cubriendo 18.000 tipos diferentes de "conjuntos de reglas".
- Lo que falta: El artículo admite que no incluyeron el código HTML crudo y desordenado de los sitios web (solo la versión de texto limpio) y que aún no tienen un estándar de oro "verificado por humanos" para cada respuesta individual. Están guardando eso para una actualización futura (Versión 2.0).
La Conclusión
Este artículo dice: "Construimos una biblioteca masiva de ejemplos del mundo real donde los robots intentaron seguir reglas estrictas para extraer datos. Descubrimos que los robots se confunden cuando las reglas se vuelven demasiado complejas, pero si entrenas a un robot pequeño con estos datos reales, puede aprender a seguir las reglas casi tan bien como un robot gigante".
Es una herramienta para que los investigadores construyan herramientas de IA mejores, más pequeñas y más eficientes que puedan leer sitios web sin perderse en los detalles.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.