← Últimos artículos
💻 computer science

Can we Watermark Low-Entropy LLM Outputs?

Este trabajo propone esquemas de marca de agua para salidas de modelos de lenguaje con baja entropía que son indetectables y robustas frente a sustituciones y eliminaciones aleatorias, superando las limitaciones de trabajos anteriores que requerían una tasa de entropía constante y un alfabeto grande.

Autores originales: Noam Mazor, Andrew Morgan, Rafael Pass

Publicado 2026-04-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Noam Mazor, Andrew Morgan, Rafael Pass

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que los Modelos de Lenguaje Grandes (como los que escriben poemas, noticias o código) son como grandes orquestas que tocan música. A veces, la música que tocan es muy compleja y llena de variaciones (alta entropía), pero otras veces tocan una melodía muy simple, repetitiva o predecible (baja entropía), como un tambor que solo hace "bum, bum, bum".

El problema es: ¿Cómo sabemos si esa música fue tocada por una IA o por un humano?

Los investigadores han intentado poner una "marca de agua" invisible en la música de la IA, como una huella digital secreta. Pero hasta ahora, había un gran obstáculo: las técnicas antiguas funcionaban bien solo si la música era compleja. Si la IA tocaba algo simple y repetitivo (baja entropía), la marca de agua se rompía o era imposible de poner sin que se notara.

Este nuevo trabajo de Noam Mazor, Andrew Morgan y Rafael Pass es como un nuevo tipo de pegamento mágico que funciona incluso en superficies lisas y simples.

Aquí te explico cómo funciona, usando analogías sencillas:

1. El Problema: El "Pegamento" Antiguo no Funcionaba en Superficies Lisas

Antes, para poner la marca de agua, los investigadores necesitaban que la IA eligiera palabras de un "menú" muy grande y variado. Imagina que intentas esconder un mensaje secreto en una frase donde cada palabra es elegida al azar de un diccionario gigante. Es fácil esconder el mensaje ahí.

Pero, ¿qué pasa si la IA solo dice "sí", "no", "sí", "no"? O si elige palabras muy comunes y predecibles?

  • El problema: Las técnicas viejas necesitaban que cada palabra tuviera mucha "variabilidad" (entropía). Si la IA era predecible, no podían esconder el mensaje sin cambiar el significado de la frase (lo cual haría que la marca de agua fuera detectable y arruinaría la calidad del texto).

2. La Solución: El "Filtro de Colores" (Hashing)

La gran idea de este nuevo trabajo es no intentar cambiar la palabra en sí, sino mirarla a través de un filtro especial.

Imagina que tienes una caja de lápices de colores (el vocabulario de la IA).

  • Antes: Intentabas cambiar el color del lápiz para esconder el mensaje. Si el lápiz ya era un color muy específico y predecible, no podías cambiarlo sin que se notara.
  • Ahora (La nueva técnica): Tienes un filtro de gafas mágicas.
    1. La IA elige un lápiz (una palabra).
    2. Tú miras ese lápiz a través de tus gafas mágicas (un algoritmo matemático llamado hash).
    3. Las gafas convierten el lápiz en un simple punto rojo o azul (un 0 o un 1).
    4. Si el punto que ves es el color que necesitas para tu mensaje secreto, dejas el lápiz tal cual. Si no, haces un pequeño ajuste (pero solo si es posible sin que se note).

La magia: Incluso si la IA elige siempre el mismo lápiz rojo, tus gafas mágicas pueden decidir si ese rojo cuenta como "rojo" o "azul" para tu mensaje secreto, dependiendo de una clave secreta que solo tú tienes. Así, puedes esconder el mensaje incluso en textos muy repetitivos.

3. La Resistencia: ¿Qué pasa si alguien intenta borrar la marca?

Imagina que un "vándalo" (un adversario) intenta borrar la marca de agua.

  • Cambio de palabras (Sustitución): El vándalo cambia "perro" por "canino".
  • Borrado: El vándalo borra algunas palabras.

El nuevo sistema es como un rompecabezas indestructible.

  • No necesitas que todas las piezas del rompecabezas estén intactas.
  • Solo necesitas que un bloque suficiente de piezas (un trozo del texto) tenga la marca correcta para que el detector diga: "¡Eh, esto es de la IA!".
  • Incluso si el vándalo cambia la mitad de las palabras o borra algunas, el sistema puede encontrar el bloque que sobrevivió y recuperar la marca.

4. ¿Por qué es importante esto?

Antes, si una IA escribía un código muy simple o una respuesta muy directa (baja entropía), no podías saber si era real o falsa.

  • Con esta nueva técnica: Podemos marcar cualquier texto, incluso los más aburridos, repetitivos o simples, sin que nadie se dé cuenta y sin que el texto pierda su calidad.

En resumen:

Los autores han creado un sistema para poner una huella digital invisible en la escritura de las IAs que funciona incluso cuando la IA es muy predecible.

  • La analogía clave: En lugar de intentar cambiar la "música" (el texto) para esconder el mensaje, usan unas "gafas mágicas" que interpretan la música de una manera secreta.
  • El resultado: Podemos saber si un texto fue escrito por una IA, incluso si es un texto corto, simple o repetitivo, y la marca de agua sobrevivirá incluso si alguien intenta editar o borrar partes del texto.

Es como si pudieras poner un sello invisible en una hoja de papel en blanco o en una hoja llena de garabatos, y ese sello seguiría ahí aunque alguien intentara rasgar la hoja o tachar algunas líneas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →