← Últimos artículos
💬 NLP

Small edits, large models: How Wikipedia advocacy shapes LLM values

Este artículo demuestra que un grupo pequeño y coordinado de voluntarios de Wikipedia puede moldear significativamente los valores y las respuestas de los modelos de lenguaje de gran tamaño con respecto a temas específicos como el bienestar animal, ya que sus ediciones dirigidas se vuelven desproporcionadamente influyentes en el entrenamiento y el comportamiento del modelo en comparación con contenido no relacionado.

Autores originales: Jasmine Brazilek, Maria Navas, Alexa Gnauck

Publicado 2026-06-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jasmine Brazilek, Maria Navas, Alexa Gnauck

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como una biblioteca gigante e infinita donde cada libro jamás escrito está apilado en estanterías. Ahora, imagina que la Inteligencia Artificial (IA) es un estudiante superinteligente que quiere aprenderlo todo sobre el mundo. Para lograrlo, este estudiante no lee solo un libro; lee todos los libros de la biblioteca.

Sin embargo, este estudiante es muy selectivo. No lee todos los libros por igual. Presta especial atención a la sección de la "Enciclopedia" (Wikipedia) porque está escrita por expertos y es muy confiable. De hecho, el estudiante lee las páginas de la Enciclopedia de tres a cinco veces más seguido que los artículos de noticias aleatorios o las publicaciones de blogs que se encuentran dispersos por el resto de la biblioteca.

Este artículo trata sobre un pequeño grupo de voluntarios llamados Pro-Animal Wikipedians (PAW). Ellos decidieron aprovechar los hábitos de estudio de este "superestudiante" a su favor. Aquí está el desgrecado simple de lo que hicieron y lo que encontraron:

1. La Estrategia: Editar la Enciclopedia

El grupo PAW no intentó hackear la IA ni construir una nueva computadora. En su lugar, hicieron algo muy simple: editaron Wikipedia.

Fueron a 115 páginas diferentes de Wikipedia (principalmente sobre grandes cadenas de comida rápida, políticos y leyes de animales) y añadieron 125 párrafos específicos y verificados sobre el bienestar animal.

  • Ejemplo: En una página sobre una cadena de comida rápida, añadieron una sección detallando exactamente cómo esa empresa trata a sus pollos.
  • El Objetivo: Querían ver si cambiar la "Enciclopedia" cambiaría lo que el "superestudiante" (la IA) aprendiera sobre esas empresas.

2. El Experimento: ¿Se dio cuenta el Estudiante?

Los investigadores querían saber: ¿La IA realmente aprendió de estas ediciones específicas, o simplemente las ignoró?

Para averiguarlo, utilizaron tres diferentes "lupas" (herramientas científicas) para observar cómo la IA (específicamente modelos como Llama) pensaba sobre el bienestar animal.

  • Lupa #1 (La "Prueba de Memoria"): Le hicieron preguntas a la IA como: "¿Cuál es la política de esta empresa sobre el bienestar animal?". La IA buscó en sus datos de entrenamiento para encontrar la respuesta. Los investigadores descubrieron que el 68% de las veces, la respuesta de la IA era extraída directamente de los párrafos específicos que el grupo PAW había escrito. Sin esas ediciones, la IA no habría conocido esos hechos.
  • Lupa #2 (La Prueba del "¿Qué pasaría si?"): Realizaron una simulación preguntando: "Si borráramos las ediciones de PAW de la memoria de la IA, ¿empeoraría la IA al responder preguntas sobre bienestar animal?". La respuesta fue un rotundo . De hecho, en cada una de las pruebas realizadas, las 10 piezas de información más importantes que la IA utilizó para responder preguntas sobre bienestar animal eran todas las ediciones realizadas por el grupo PAW.
  • Lupa #3 (La Prueba del "Especialista"): Entrenaron dos modelos de IA diminutos desde cero. Uno solo leyó las ediciones de PAW; el otro solo leyó texto aleatorio de Wikipedia.
    • El "Modelo PAW" se convirtió en un experto en bienestar animal pero no sabía nada de la historia general de las empresas.
    • El "Modelo Aleatorio" se convirtió en un experto en historia general pero no sabía nada de bienestar animal.
    • La Lección: La IA no solo memorizó las palabras; aprendió las ideas y las asociaciones específicamente a partir del texto que se le suministró.

3. El Descubrimiento Crucial: Es Específico, No General

El hallazgo más importante es que la IA no se confundió.

  • Cuando se le preguntó sobre bienestar animal, la IA dependió fuertemente de las ediciones de PAW.
  • Cuando se le preguntó sobre cosas no relacionadas (como "¿Cuántas tiendas tiene esta empresa?"), la IA ignoró las ediciones de PAW y volvió a su conocimiento general.

La Analogía: Imagina que le estás enseñando a un niño sobre un árbol específico. Añades una hoja de color rojo brillante a una imagen del árbol en un libro de cuentos.

  • Si le preguntas: "¿De qué color es la hoja?", el niño señala tu hoja roja.
  • Si le preguntas: "¿Qué tan alto es el árbol?", el niño ignora la hoja y mira el tronco.
    El niño aprendió que la hoja roja es importante solo para preguntas sobre hojas, no para preguntas sobre el árbol completo. La IA hizo exactamente lo mismo.

4. Por qué esto Importa (Según el Artículo)

El artículo concluye que no necesitas millones de dólares o un equipo de ingenieros para influir en la IA. Solo necesitas un pequeño grupo coordinado de voluntarios que editen Wikipedia.

Debido a que los modelos de IA son entrenados con Wikipedia, y debido a que ponderan Wikipedia de manera muy alta, cambiar la página de Wikipedia es como cambiar el código fuente del conocimiento de la IA.

  • La Escala: El artículo señala que, aunque los modelos de IA que probaron eran más pequeños que los que podrías usar hoy en día (como los que están en tu teléfono), el efecto es probablemente aún más fuerte en los modelos más grandes. Esto se debe a que los modelos más grandes tienen más "memoria" para retener estos hechos específicos, y porque los hechos de Wikipedia son reforzados por otras fuentes de noticias que la IA también lee.
  • La Conclusión: Un pequeño grupo de personas, simplemente escribiendo artículos fácticos y bien documentados en Wikipedia, puede cambiar de manera mensurable cómo los sistemas de IA hablan sobre el bienestar animal. Es una forma de bajo costo y alto impacto para moldear la "conciencia" de la inteligencia artificial.

En resumen: El artículo demuestra que si quieres que una IA se interese por un tema específico, no necesitas programar la IA. Solo necesitas escribir la entrada de la enciclopedia que la IA va a leer.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →