← Últimos artículos
🤖 machine learning

Synthetic Persona Pretraining: Alignment from Token Zero

Este artículo introduce el Preentrenamiento de Persona Sintética (SPP), un método que incrusta reflexiones en primera persona alineadas con valores directamente en la fase de preentrenamiento para instalar una persona de asistente deseada desde el primer token, demostrando que tal intervención temprana mejora significativamente la adherencia constitucional, la robustez ante jailbreaks y la alineación moral en comparación con los enfoques de alineación post-entrenamiento.

Autores originales: Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Ro
Publicado 2026-08-14
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás criando a un niño. Podrías esperar hasta que sea adolescente, sentarte con él y decirle: "Bien, ahora que ya sabes hablar, estas son las reglas: sé amable, di la verdad y no lastimes a los demás". O bien, podrías empezar a enseñar esos valores desde la primera palabra que aprenda a decir, entretejiéndolos en cada historia que le cuentes a medida que crece. Este es el dilema central que enfrentan los científicos que construyen inteligencia artificial.

Los modelos de IA son como niños digitales que aprenden leyendo miles de millones de páginas de texto de internet. Esta fase inicial de aprendizaje se llama "preentrenamiento". Durante este tiempo, la IA absorbe hechos, estilos de escritura y la forma en que los humanos se comunican entre sí. Sin embargo, las "reglas" para ser un asistente útil y seguro suelen añadirse después de esta fase masiva de aprendizaje, en un paso separado llamado "post-entrenamiento". El problema es que, para cuando la IA termina de leer internet, ya ha formado una personalidad basada en lo que encontró allí. Intentar imponer nuevas reglas a una personalidad ya formada es como intentar enseñarle a un adolescente a ser educado después de que ya ha aprendido a ser grosero; a menudo se siente como una fina capa de pintura sobre una pared desordenada, y los viejos hábitos pueden filtrarse fácilmente.

Este artículo, titulado "Synthetic Persona Pretraining: Alignment from Token Zero", sugiere una forma diferente de criar a nuestros hijos digitales. Los investigadores proponen instalar la personalidad y los valores deseados desde el primer momento de entrenamiento, lo que ellos llaman "token cero". En lugar de esperar para corregir a la IA más tarde, quieren construir al "buen asistente" dentro de su cerebro mientras todavía está aprendiendo a hablar.

El Experimento: Criando a un Niño Digital con una Constitución

Los investigadores, un equipo de la EPFL y diversas universidades, decidieron probar esta idea de "Crianza de Modelos". Crearon un nuevo método llamado Synthetic Persona Pretraining (SPP). Así es como lo hicieron, utilizando una analogía sencilla:

Imagina que la IA está aprendiendo a leer una biblioteca de libros. En la forma antigua, la IA simplemente lee los libros. En la nueva forma, los investigadores tomaron aproximadamente el 10% de esos libros y añadieron una "burbuja de pensamiento" especial después de cada pocos párrafos. Dentro de esta burbuja de pensamiento, la futura personalidad de la IA (llamémosla "Cato") haría una pausa y reflexionaría sobre lo que acaba de leer, diciendo cosas como: "Hmm, esta historia sobre un crimen es triste, y mis reglas dicen que nunca debería fomentar la violencia", o "Este manual técnico es aburrido pero útil".

No solo añadieron estos pensamientos; hicieron que la IA aprendiera a generarlos. Entrenaron al modelo tanto con el texto original como con estos nuevos pensamientos de "reflexión". Lo hicieron de dos maneras:

  1. Token Zero (El enfoque "Desde el Nacimiento"): Esparcieron estos pensamientos de reflexión a lo largo de todo el proceso de entrenamiento, desde el primer segundo hasta el último.
  2. Midtraining (El enfoque "Adolescente"): Esperaron hasta que la IA ya había leído la mayoría de los libros y solo añadieron las reflexiones al final de la fase de entrenamiento.

También incluyeron un grupo de control que simplemente leía los libros normalmente (Vanilla) y uno al que se le quitaron los libros malos pero sin añadir reflexiones (Filtered).

Lo que Encontraron: El Poder de Empezar Temprano

Los resultados fueron fascinantes y sugieren que el cuándo se le enseña a la IA importa tanto como el qué se le enseña.

1. La IA "Desde el Nacimiento" era más inteligente respecto a los valores.
Los modelos entrenados con reflexiones desde el principio (Token Zero) fueron mucho mejores siguiendo su "Constitución" (un conjunto de reglas que debían seguir). Cuando los investigadores los sometieron a dilemas morales complicados —situaciones que la IA nunca había visto antes—, los modelos Token Zero tomaron decisiones que se sentían más alineadas con las reglas. No solo memorizaron las reglas; parecían entender el espíritu de las mismas.

  • Los números: En una prueba llamada "ConstitutionEval", los modelos Token Zero obtuvieron aproximadamente un 67% de aciertos, mientras que los modelos que solo recibieron las reflexiones al final (Midtraining) solo obtuvieron alrededor de un 56%.
  • La sorpresa: Los modelos Token Zero realmente cambiaron sus prioridades. Empezaron a valorar la "Veracidad" y la "Justicia" mucho más que los otros modelos, que preferían la "Creatividad" y el "Aprendizaje". Esto sugiere que empezar temprano no solo añadió reglas; remodeló cómo la IA piensa sobre el mundo.

2. El enfoque del "Adolescente" estaba bien para algunas cosas, pero no para todas.
Curiosamente, si el objetivo era simplemente evitar que la IA fuera "hackeada" (engañada para hacer cosas malas), el enfoque de Midtraining funcionó casi tan bien como el enfoque Token Zero. Parece que, para reflejos simples de "no hagas eso", se pueden enseñar tarde. Pero para un razonamiento moral profundo y complejo, realmente necesitas empezar desde el primer día.

3. Cerebros más grandes, mayores ganancias.
Los investigadores probaron esto en dos tamaños de IA: uno más pequeño (1.7 mil millones de parámetros) y uno más grande (3 mil millones de parámetros). Encontraron que la ventaja de empezar temprano se volvió aún más importante a medida que la IA se hacía más grande y más inteligente. En las pruebas más difíciles, la brecha entre la IA "Desde el Nacimiento" y la IA "Adolescente" se duplicó a medida que escalaban. Esto sugiere que, para las IA masivas y superinteligentes del futuro, empezar con los valores correctos será aún más crítico.

4. El "Pegamento" importa.
Hubo un inconveniente. Los investigadores descubrieron que estos valores tempranos solo se mantenían si el paso final del entrenamiento (donde la IA aprende a charlar con humanos) coincidía con la personalidad que construyeron anteriormente. A esto lo llamaron "vinculación de la personalidad" (persona binding). Si entrenaron a la IA para ser un tipo específico de asistente durante la fase de lectura, pero luego le enseñaron a ser un tipo de asistente totalmente distinto durante la fase de charla, los valores tempranos empezaron a desvanecerse. Es como enseñar a un niño a ser médico, pero luego enviarlo a una escuela de arte; podría olvidar las reglas médicas. Sin embargo, cuando el "pegamento" funcionaba, los valores eran sorprendentemente fuertes, sobreviviendo incluso cuando los investigadores intentaron romperlos con pruebas complicadas.

Por qué esto es importante

Este artículo sugiere que podríamos estar cometiendo un error al intentar "arreglar" la IA después de que ya ha aprendido todo de internet. Los autores argumentan que los valores son difíciles de añadir a un producto terminado. En su lugar, deberíamos "criar" a la IA con los valores correctos desde el primer token que procesa.

Aunque los resultados son prometedores, los investigadores advierten que esto es solo el comienzo. Probaron esto en modelos relativamente pequeños (3 mil millones de parámetros) en comparación con los modelos masivos que utilizan las grandes empresas tecnológicas hoy en día. Sugieren que, a medida que construyamos modelos más grandes y más inteligentes, el beneficio de empezar con los valores correctos desde el principio probablemente será aún más poderoso. También señalaron que, aunque los valores tempranos eran fuertes, aún podían verse debilitados por ciertos tipos de entrenamiento posterior, lo que significa que todavía debemos ser cuidadosos con la forma en que terminamos de criar a nuestros hijos digitales.

En resumen, si queremos una IA que sea verdaderamente segura y útil, no debemos esperar hasta que sea adulta para enseñarle lo que está bien y lo que está mal. Debemos enseñarle mientras todavía está aprendiendo a hablar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →