← Últimos artículos
💻 computer science

Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web

Este estudio revela una creciente asimetría en la intermediación web donde los sitios de noticias de prestigio están bloqueando cada vez más a los rastreadores de IA mediante robots.txt y medidas activas, mientras que los sitios de desinformación permanecen en gran medida abiertos, lo que potencialmente sesga los datos de entrenamiento disponibles para los Modelos de Lenguaje de Gran Tamaño.

Autores originales: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

Publicado 2026-08-13
📖 4 min de lectura☕ Lectura para el café

Autores originales: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como una biblioteca gigante y bulliciosa donde cada libro, artículo y entrada de blog es una pieza de información esperando ser leída. Durante años, los "robots" (programas informáticos especiales) han sido los bibliotecarios de este mundo digital, caminando silenciosamente por los pasillos para copiar libros para que los motores de búsqueda puedan ayudarnos a encontrarlos. Pero recientemente, ha llegado un nuevo tipo de bibliotecario: el robot de Inteligencia Artificial (IA). Estos no solo buscan un libro; están tratando de leer todo a la vez para aprender a escribir, responder preguntas y charlar con nosotros. Para gestionar esto, los propietarios de sitios web tienen un cartel sencillo y voluntario que pueden poner en su puerta llamado robots.txt. Piensa en ello como un cartel de "Prohibido el paso" o "Por favor, pase" para estos bibliotecarios digitales. Si el propietario de un sitio web escribe "No se permite la IA" en este cartel, se supone que los robots de IA educados deben escuchar y mantenerse alejados. Pero aquí surge la gran pregunta: ¿Todos los sitios web ponen estos carteles? Y si lo hacen, ¿lo ponen por las mismas razones? A medida que la IA se vuelve más inteligente y poderosa, entender quién abre sus puertas y quién las cierra con llave se vuelve crucial, porque eso decide qué tipo de información aprende la IA.

Este artículo, titulado "Is Misinformation More Open?" (¿Es la desinformación más abierta?), actúa como una historia de detectives digitales, investigando cómo dos grupos muy diferentes de sitios web gestionan estos carteles de "Prohibido el paso" para la IA. Los investigadores analizaron dos grupos: sitios de noticias "reputados" (los periodistas serios que verifican los hechos) y sitios de "desinformación" (los lugares que difunden historias falsas o engañosas). Querían ver si las organizaciones de noticias serias eran mejores comunicando a los robots de IA que se mantuvieran alejados en comparación con los sitios de noticias falsas.

Los hallazgos revelan un contraste sorprendente y marcado. Los investigadores descubrieron que los sitios de noticias reputados tienen muchas más probabilidades de poner un cartel de "Prohibido el paso" para los robots de IA. De hecho, el 60.0% de estos sitios confiables le dijo explícitamente al menos a un rastreador de IA que no entrara en sus archivos robots.txt. En marcado contraste, solo el 9.1% de los sitios de desinformación hizo lo mismo. Es como si las bibliotecas serias estuvieran cerrando sus puertas a los nuevos estudiantes de IA, mientras que los panfletos de noticias falsas dejan sus puertas abiertas de par en par. En promedio, un sitio de noticias reputado enumeró 15.5 diferentes robots de IA que no quería que lo visitaran, mientras que los sitios de desinformación enumeraron menos de uno.

El estudio también analizó si estos sitios web realmente hacían cumplir sus carteles o si solo los escribían. Descubrieron que los sitios de noticias reputados no solo escribían las reglas, sino que también bloqueaban activamente a los robots de IA que intentaban colarse, haciendo coincidir sus reglas escritas con sus acciones. Los sitios de desinformación eran menos consistentes; aunque algunos sí bloqueaban la IA, muchos ni siquiera se molestaban en escribir las reglas. Los investigadores también observaron cómo cambiaban las cosas, analizando instantáneas desde septiembre de 2023 hasta mayo de 2025. Vieron que los sitios de noticias reputados estaban aprendiendo rápidamente a cerrar sus puertas, con el número de sitios que bloqueaban la IA saltando del 23% a casi el 60% en solo un par de años. Los sitios de desinformación, sin embargo, permanecieron mayormente pasivos, rara vez actualizando sus carteles.

Los autores sugieren que esta brecha creciente crea una situación extraña: a medida que las fuentes "buenas" comienzan a cerrar sus puertas para proteger su contenido, los robots de IA podrían terminar pasando más tiempo leyendo las fuentes "malas" que todavía están abiertas de par en par. Esto podría significar que la IA aprenda más de la desinformación que de las noticias precisas, simplemente porque los sitios de desinformación son más fáciles de acceder. El artículo no afirma que esto ya haya arruinado la IA, pero destaca un riesgo real: si no prestamos atención a quién abre sus puertas, el futuro de la IA podría construirse sobre una base de falsedades.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →