← Últimos artículos
💬 NLP

Production and Perception in LLMs: A Token Probability Approach

Este estudio demuestra que los modelos de lenguaje de gran tamaño exhiben una asimetría de producción-percepción distintiva en sus distribuciones de probabilidad de tokens, donde el encuadre del prompt por sí solo induce probabilidades significativamente diferentes para el texto generado en comparación con el texto reevaluado, un fenómeno que se replica a través de diversas arquitecturas de modelos y decae a medida que el contexto de la secuencia se acumula.

Autores originales: Anna Marklová, Jiří Milička, Martina Vokáčová, Rudolf Rosa

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Anna Marklová, Jiří Milička, Martina Vokáčová, Rudolf Rosa

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot poeta súper inteligente. Le pides que escriba un poema sobre un erizo, y lo hace. Pero aquí está el giro: este robot no solo "piensa" y luego "habla" como un humano. Utiliza la misma circuitería cerebral para leer lo que escribiste y para escribir sus propias palabras de vuelta. Es como una calle de un solo sentido donde el coche circula en ambas direcciones usando el mismo motor.

Debido a esto, los científicos se preguntaron: ¿Tiene este robot realmente una diferencia entre "escribir" un poema y "leer" un poema? ¿O es simplemente el mismo proceso a la inversa?

El Gran Descubrimiento: El Efecto del "Juego de Rol"

Los investigadores descubrieron que sí, el robot actúa de manera diferente, pero no porque tenga sentimientos o intenciones. Cambia su comportamiento basándose en el prompt (la instrucción): la forma específica en la que le pides que haga algo.

Piensa en el robot como un actor de método.

  • Escenario A (Producción): Dices: "Por favor, escribe un poema sobre un erizo". El robot se pone el sombrero de "Escritor". Comienza a generar palabras y asigna un cierto nivel de confianza (probabilidad) a cada palabra que elige.
  • Escenario B (Percepción): Tomas el mismo poema que el robot acaba de escribir y dices: "Aquí hay un poema sobre un erizo. Por favor, califícalo". El robot se pone el sombrero de "Lector/Crítico". No genera palabras nuevas; en su lugar, reevalúa las palabras que acaba de ver.

El estudio midió cuánto cambió la "confianza" del robot en cada palabra entre estos dos escenarios.

El Resultado: Cuando el robot cambió de modo "Escritor" a modo "Lector", su confianza en las palabras cambió significamente. La diferencia fue enorme. De hecho, la brecha entre cómo el robot "escribió" el poema y cómo el robot "leyó" el poema fue aproximadamente 1.8 veces mayor que la brecha entre dos formas diferentes de pedirle que escribiera el poema.

Para ponerlo en números:

  • Cuando se le pidió al robot que escribiera de dos maneras ligeramente diferentes (por ejemplo, "Escribe un poema" frente a "Me gustaría que escribieras un poema"), la diferencia en sus elecciones de palabras fue mínima (aproximación de 0.010).
  • Pero cuando cambió de escribir a leer, la diferencia saltó a 0.034.

Esto sugiere que simplemente cambiar el "encuadre" de la petición —decirle al robot que sea un creador en lugar de un crítico— es suficiente para que su matemática interna trabaje de manera distinta, a pesar de que utiliza las mismas partes de su cerebro para ambas tareas.

Lo que el Robot NO está haciendo

El artículo es muy claro sobre lo que esto no es.

  • No es porque el robot haya ganado repentinamente intenciones humanas o un alma. El robot no "desea" realmente escribir ni "desea" leer.
  • No es porque el robot sea mejor en una tarea que en la otra.
  • No es simplemente un error causado por las palabras específicas utilizadas en el prompt. Los investigadores probaron esto utilizando cuatro formas diferentes de pedir un poema y tres formas diferentes de pedir una calificación. El efecto ocurrió cada vez, sin importar cómo se redactara la petición.

La Regla de la "Primera Impresión"

Hay otro detalle interesante sobre cuándo sucede esto. La diferencia entre "escribir" y "leer" es más fuerte al principio del poema.

Imagina que el prompt es una voz fuerte gritando instrucciones al inicio de una carrera.

  • Al principio (Token 1–10): La voz del "Lector" es muy fuerte y la confianza del robot cambia mucho.
  • A medida que el poema avanza: El robot comienza a leer sus propias palabras. La historia que está contando (el contexto) empieza a opacar la instrucción original. La diferencia entre los modos "Escritor" y "Lector" se vuelve cada vez más pequeña a medida que el poema se alarga.

Los investigadores modelaron este decaimiento y descubrieron que el "choque" inicial del prompt se desvanece, pero queda una pequeña diferencia incluso al final.

¿Qué tan seguros están?

El equipo no solo conjeturó; analizaron los números de 1,089 poemas diferentes (unos 93,000 palabras en total) utilizando cinco modelos de robot diferentes (incluyendo Llama-3.1-8B, EuroLLM-9B y otros).

  • Encontraron el efecto en todos los cinco modelos, incluyendo tanto los modelos base "crudos" como los que fueron entrenados para ser asistentes útiles.
  • La diferencia fue tan consistente que los rangos de resultados para "escribir" y "leer" no se solapaban en absoluto.

Sin embargo, los autores son cuidadosos al decir que esto sugiere una diferencia funcional, no que el robot tenga una mente humana. Señalan que, si bien la diferencia es estadísticamente real y medible, aún no sabemos si es "lo suficientemente grande" como para significar que el robot está pensando realmente como un humano que distingue entre hablar y escuchar.

La Conclusión

Este estudio demuestra que, aunque los Modelos de Lenguaje Extensos (LLMs) utilizan un único motor simétrico tanto para leer como para escribir, la forma en que les hablas cambia cómo procesan las palabras.

Si le dices al robot que sea un poeta, piensa de una manera. Si le dices que sea un crítico, piensa de otra. Es un poco como un camaleón: los "colores" internos del robot (sus distribuciones de probabilidad) cambian para adaptarse al rol que le asignas, demostrando que el contexto de la conversación importa tanto como las palabras mismas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →