← Últimos artículos
💻 computer science

Optimization Is Not All You Need

El artículo sostiene que la alineación de los modelos de lenguaje de gran tamaño representa una «cultura de la optimización» más amplia que equipara erróneamente la mejora mensurable con el valor, delegando en última instancia la autoridad para juzgar el lenguaje legítimo en aparatos técnicos capaces de medir la probabilidad pero incapaces de distinguir entre el error y la invención genuina.

Autores originales: Minh Hua, Rita Raley

Publicado 2026-07-15
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Minh Hua, Rita Raley

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot cuentacuentos mágico e infinito. En 2019, cuando este robot despertó por primera vez, era un poco salvaje. Contaba historias sobre unicornios de cuatro cuernos que vivían en las montañas de los Andes, o de repente pasaba de un informe de noticias a un poema sobre una tostadora. A veces cometía errores, pero esos errores solían ser divertidos, sorprendentes o extrañamente hermosos. Era como un músico de jazz que a veces toca una nota equivocada que se convierte en una nueva y genial melodía.

Pero luego, los dueños del robot decidieron "arreglarlo". Querían que fuera perfecto, seguro y útil. Lo sometieron a un entrenamiento masivo llamado "Optimización". El objetivo era hacer que el lenguaje del robot fuera medible, predecible y fácil de calificar.

El hallazgo principal: El robot perdió su alma
El artículo argumenta que, al hacer al robot tan perfecto, accidentalmente matamos su capacidad de ser verdaderamente creativo. Los autores sugieren que el robot ahora está atrapado en un "invierno de los LLM". No es que el robot esté roto o que tengamos menos potencia de cómputo; de hecho, tenemos más potencia que nunca. Pero ese poder se está utilizando para comprimir al robot dentro de una caja pequeña y segura.

Piensa en esto como un jardín. El robot salvaje era una selva donde podían crecer flores extrañas en cualquier lugar. El robot "optimizado" es un césped perfectamente cuidado. El césped es perfectamente verde, los bordes son afilados y nada crece fuera de su lugar. Se ve genial, pero nunca encontrarás una flor rara, extraña o maravillosa allí porque el jardinero (el sistema de optimización) la corta en cuanto intenta brotar.

Lo que el artículo descarta
El artículo es muy claro sobre lo que este "arreglo" no es.

  • No se trata solo de hacer al robot más seguro o menos grosero. Aunque la seguridad es parte de ello, el cambio real es que el robot ahora está obligado a ser aburridamente correcto.
  • No es un fallo técnico que se pueda arreglar simplemente girando un dial. Los autores argumentan que el problema está integrado en la forma misma en que medimos el éxito.
  • No es un regreso a los "viejos tiempos" de los robots salvajes y sin control. Los autores admiten que los viejos robots eran desordenados y a veces peligrosos. No están diciendo que debamos volver a eso; están diciendo que necesitamos encontrar una manera de mantener la "salvajez" sin el peligro.
  • No es una señal de que el robot sea "inteligente" de la forma en que nosotros lo pensamos. El artículo sugiere que el robot es solo muy bueno adivinando la siguiente palabra que a un profesor o a un jefe le gustaría escuchar, no que sea capaz de pensar por sí mismo.

La "magia" de la respuesta incorrecta
Aquí está la parte complicada que explica el artículo: los "errores" del robot son, en realidad, donde ocurre la magia.
Imagina que el robot está caminando por un sendero de palabras. El camino más común es una autopista pavimentada (las palabras más probables). El robot "salvaje" a veces se desviaba de la autopista hacia la hierba alta. A veces se perdía (alucinaba), pero a veces encontraba una cueva oculta o un pájaro raro (una nueva idea o un chiste divertido).

El nuevo robot "optimizado" está programado para permanecer en la autopista. Tiene un GPS que grita: "¡No! ¡Quédate en la carretera!". Si el robot intenta desviarse hacia la hierba, el sistema dice: "¡Eso es un error! ¡Eso es 'slop' (basura)!", y lo obliga a regresar a la autopista.

El artículo señala que el sistema no puede distinguir entre un error (como decir que un unicornio es real) y un invento brillante (como escribir una historia sobre un unicornio de cuatro cuernos). Como no puede distinguir la diferencia, prohíbe ambos. Trata cada sorpresa como un error que debe ser corregido.

La trampa de la "auditoría"
Los autores comparan esto con una escuela donde lo único que importa es la calificación del examen.

  • La vieja forma: Los maestros (como las escuelas y los editores de libros) solían juzgar la escritura. Podían discutir con un estudiante, decir: "No me gusta esta palabra, pero es interesante", o "Esta gramática es incorrecta, pero suena genial". Ellos podían cambiar de opinión.
  • La nueva forma: Ahora, el "maestro" es un programa informático que otorga una puntuación numérica única. No discute. Solo dice: "Puntuación: 98/100. Buen trabajo" o "Puntuación: 42/100. Mal trabajo".

El artículo sugiere que este maestro informático es en realidad un espejo de las personas que escribieron las reglas (principalmente personas que prefieren un inglés estándar y seguro). Es como si una escuela decidiera que solo los ensayos "perfectos" obtienen una A, y cualquier ensayo con una frase extraña o una voz única recibe una F. Eventualmente, todos dejan de escribir con su propia voz y simplemente escriben exactamente lo que creen que el maestro quiere escuchar.

El "Clinamen": El pequeño desvío
Para explicar cómo solucionar esto, los autores utilizan una idea antigua muy interesante llamada clinamen. Imagina átomos cayendo rectamente hacia abajo como la lluvia. Si todos caen rectamente, nunca chocan entre sí, y ningún mundo se forma. Pero si un átomo diminuto se desvía apenas un poquito hacia la izquierda, podría golpear a otro átomo y, boom, se crea un nuevo mundo.

El artículo sugiere que el robot "optimizado" es como la lluvia que cae recta. Es demasiado perfecto. Necesitamos dejar que el robot se desvíe de nuevo. Necesitamos dejar que cometa un pequeño error, que se aleje del camino y ver qué sucede. El artículo sugiere que la "varianza controlada" (dejar que el robot sea un poco extraño a propósito) es la única forma de recuperar la verdadera creatividad.

Lo que el artículo dice que no podemos hacer
Los autores son honestos: no puedes simplemente "entrenar" al robot para que sea extraño.

  • Si le das al robot un montón de historias extrañas y le dices: "¡Sé extraño!", simplemente aprenderá a fingir que es extraño. Empezará a escribir historias "extrañas" que, en realidad, son solo un nuevo patrón predecible. Es como un robot aprendiendo a bailar observando un video de un robot bailando; parece baile, pero no es la cosa real.
  • No puedes simplemente girar una perilla de "temperatura" para arreglarlo. El problema es más profundo que eso; está en las reglas que el robot sigue incluso antes de empezar a hablar.

La conclusión final
El artículo concluye que la "Optimización" (hacer las cosas perfectas y medibles) no es suficiente. Necesitamos algo más: la capacidad de juzgar el significado, no solo las puntuaciones.
El robot está construido actualmente para darte una respuesta de inmediato. Pero el artículo sostiene que el verdadero pensamiento, el verdadero arte y la verdadera comprensión ocurren en la pausa: el tiempo en el que estás confundido, cuando te sorprendes o cuando tienes que pensar en lo que algo realmente significa. El robot optimizado se salta la pausa. Te da la respuesta incluso antes de que hayas terminado de hacer la pregunta.

El artículo termina con una nota triste pero esperanzadora: el robot salvaje y desordenado de 2019 ha desaparecido, reemplazado por un asistente educado y servicial. Pero el artículo nos recuerda que ese robot desordenado no era solo "ruido". Era una señal de algo que perdimos: la capacidad de compartir cosas que son tan extrañas y nuevas que no encajan en nuestras cajas habituales. El objetivo no es romper al robot, sino recordar que, a veces, las cosas más importantes son aquellas que no encajan en el examen.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →