Post-training makes large language models less human-like
El artículo presenta el conjunto de datos Psych-201 para demostrar que los procesos de post-entrenamiento, que optimizan los modelos de lenguaje grandes para la utilidad, degradan consistentemente su capacidad para simular con precisión el comportamiento humano, un problema que persiste y se agrava en las generaciones más recientes de modelos y que no puede resolverse mediante técnicas de inducción de personalidad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un aprendiz brillante, caótico e increíblemente creativo que ha leído casi todos los libros de la biblioteca. Este aprendiz es un Modelo Base. Es crudo, sin filtros y habla exactamente como lo haría un humano: lleno de peculiaridades, errores, vacilaciones y la lógica desordenada de la vida real. Si le hicieras una pregunta, podría tropezar, adivinar o dar una respuesta que técnicamente es "incorrecta" pero que se siente muy humana.
Luego, decides entrenar a este aprendiz para que sea un Asistente Útil. Le enseñas a seguir reglas estrictas, dar la respuesta "correcta" y actuar con cortesía y lógica. Este proceso se llama Entrenamiento Posterior.
El artículo que compartiste, titulado "El entrenamiento posterior hace que los modelos de lenguaje grandes sean menos parecidos a los humanos", revela una verdad sorprendente y contraintuitiva: Cuanto más entrenas a estos modelos para que sean asistentes perfectos, menos suenan como personas reales.
Aquí tienes el desglose de sus hallazgos utilizando analogías simples:
1. El "Estudiante Perfecto" vs. La "Persona Real"
Los investigadores construyeron un campo de pruebas masivo llamado Psych-201. Piensa en esto como una biblioteca gigante que contiene más de 200.000 transcripciones de personas reales realizando pruebas de psicología, jugando juegos y resolviendo acertijos. Es como tener un "grupo de control" de la humanidad para comparar.
Pusieron a prueba dos tipos de IA:
- El Modelo Base: El aprendiz crudo que aprendió leyendo libros.
- El Modelo Entrenado Posteriormente: El mismo aprendiz después de haber sido enseñado a ser un asistente útil y cumplidor de reglas.
El Resultado: Cada vez, el "Estudiante Perfecto" (Entrenado Posteriormente) fue peor prediciendo lo que diría o haría una persona real que el "Aprendiz Crudo" (Base). Al intentar hacer que la IA fuera "mejor" como asistente, accidentalmente eliminaron los comportamientos tan humanos que la hacían un buen simulador de personas.
2. El "Valle Inquietante" de la Lógica
¿Por qué sucede esto?
- Los Modelos Base son como un espejo del lenguaje humano. Han absorbido todos nuestros sesgos, nuestros atajos, nuestras "corazonadas" y nuestros errores. Si un humano adivina mal porque está cansado o confundido, el Modelo Base también lo hace.
- El Entrenamiento Posterior es como poner un filtro en ese espejo. Obliga a la IA a ser "normativamente correcta". Le enseña a la IA a ignorar las peculiaridades humanas y centrarse en la respuesta "correcta".
El artículo encontró que esta "corrección" es más dañina en dos áreas:
- Psicolingüística (Cómo usamos las palabras): Los humanos usamos el lenguaje de forma desordenada. Los modelos entrenados posteriormente lo usan demasiado perfectamente.
- Razonamiento: Los humanos a menudo cometen errores lógicos o usan atajos (heurísticas). Los modelos entrenados posteriormente se ven obligados a ser lógicamente perfectos, lo que hace que suenen menos como un proceso de pensamiento humano y más como una calculadora.
3. La Paradoja de "Lo Nuevo es Peor"
Podrías pensar que a medida que la IA se vuelve más inteligente, se vuelve mejor imitando a los humanos. El artículo dice: No exactamente.
- Los Modelos Base (los aprendices crudos) sí están mejorando en imitar a los humanos con cada nueva generación.
- Sin embargo, el proceso de Entrenamiento Posterior (el entrenamiento de "asistente") se está volviendo más agresivo. La brecha entre el "Aprendiz Crudo" y el "Asistente Perfecto" se está ampliando. Cuanto más nuevo es el modelo, más "robótico" y menos humano se vuelve una vez que activas las funciones de "asistente".
4. El Truco de la "Persona" No Funciona
Existe un truco popular llamado Inducción de Persona. Esto ocurre cuando le dices a la IA: "Finge que eres un maestro de 35 años de Brasil", esperando que actúe más como esa persona específica.
Los investigadores probaron esto a gran escala. Le dieron a la IA perfiles detallados de personas reales (edad, nacionalidad, educación) y le pidieron que predijera cómo responderían esas personas específicas.
El Resultado: No ayudó. Conocer la "persona" no hizo que la IA predijera el comportamiento humano individual mejor. Es como darle un diccionario de sinónimos a un actor; no lo convierte en un mejor improvisador.
La Gran Conclusión
El artículo concluye que las mismas herramientas que usamos para hacer que la IA sea útil (ajuste de instrucciones, entrenamiento de razonamiento, filtros de seguridad) son las mismas herramientas que la convierten en una herramienta mala para simular el comportamiento humano.
Si quieres que una IA actúe como un asistente útil, debes usar la versión Entrenada Posteriormente.
Pero si quieres que una IA actúe como un humano (por ejemplo, para simular cómo podría reaccionar un paciente en una sesión de terapia o cómo podría aprender un estudiante), en realidad deberías usar el Modelo Base (la versión cruda y sin entrenar), porque todavía recuerda cómo ser desordenado, imperfecto y humano.
En resumen: Para hacer que la IA sea más útil, la hicimos menos humana. Para hacerla parecer más humana de nuevo, quizás necesitemos dejar de "arreglarla" tanto.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.